北京大学 集成电路学院 人工智能研究院 加入我们
PKU LEAP

北京大学-后摩尔芯片架构与集成电路实验室

Peking University Lab for Emerging Architecture and Processor

Research

科学研究

摩尔定律放缓后,能效的提升更多来自新器件与新架构的组合。实验室沿三个方向展开工作,分别对应光电融合、存算融合,以及贯通它们的跨层协同方法。

研究总览

三个方向并非彼此独立:光电异构与存算一体提供两类互补的物理计算载体,而多层次协同优化决定了这些载体能否被算法真正用上。

三个研究方向汇聚为后摩尔时代高能效智能芯片
共同的问题意识:把原本由数字逻辑反复搬运数据完成的运算,交给器件的物理过程就地完成。

一 光电异构芯片架构及其集成电路设计

电互连的带宽与功耗正在成为大模型推理的主要瓶颈。光在传播过程中几乎不消耗能量,且天然支持波长与空间的并行复用;但光难以存储、难以做高精度非线性。这一对互补性决定了合理的做法不是「全光计算」,而是让光电各自承担适合的部分。

研究内容

我们把 VCSEL 阵列、莫尔超晶格光子学器件与忆阻器阵列放在同一条计算通路上:光域完成高并行的权重—激活相乘与长距离数据分发,电域完成高精度累加、状态保持与可编程控制。围绕这条通路,需要解决器件、电路与编译三个层面的问题。

光电异构计算通路:从光源阵列、光学调制、光电探测到数字存内计算与数字后端
光电异构计算通路。免跨阻放大器的模拟读出电路是其中的关键环节:光电流在忆阻器阵列上直接完成求和,省去了传统方案中面积与功耗都很可观的跨阻放大级。

具体课题

  • 莫尔超晶格光子学原型器件与电路 依托科技部国家重点研发计划「物态调控」专项课题,探索莫尔超晶格结构中的光场调控机制,并把器件特性抽象为可用于电路设计的紧凑模型。
  • 面向大语言模型的光电融合异构计算架构 针对大模型推理中的访存墙与互连墙,设计光电协同的计算与数据分发架构,并配套硬件映射方法,在编译阶段自动划分光域与电域承担的计算图片段。
  • 基于 RRAM 与 VCSEL 的无跨阻放大器数字存内计算级联电路 把光电探测与存内乘累加合并为一级,减少级间转换带来的噪声与功耗开销。
  • 感存算一体的垂直腔面发射芯片与硬件系统 与常州纵慧芯光半导体合作,将光发射、探测与计算集成于同一硬件系统,在传感前端就完成特征提取。
  • 神经形态视觉器件与电路 二维材料光电神经元与铁电突触的同质集成(Nature Communications 2026);基于全范德华双极铁电结构的可配置光学异质突触,用于传感器内计算(Advanced Materials 2024)。
  • 原位频率转换电路 基于电流控 VO2 器件阵列实现信号的原位合成与混频,在端到端无线物联网测试中降低 1.45 至 1.94 倍能耗(Nature Communications 2024)。
光电异构的难点不在单个器件,而在接口。一次不必要的光电转换,往往就抵消掉光域省下来的全部能量。因此我们把设计的重心放在探测与计算的融合上,而不是单纯提升光器件的性能指标。

二 存算芯片架构及其集成电路设计

存算一体已经能很好地处理乘累加,但真实负载中还有大量非线性、条件判断与数据搬移操作——排序、傅里叶变换、微分方程求解、数据库查询——它们长期只能退回到数字逻辑执行,成为整个系统的短板。实验室的工作主要针对这一类算子。

存内算子:把「算子鸿沟」补上

排序的核心是比较运算,需要精准实现条件判断与数据搬移,传统存算架构面向乘加设计,难以支持这种复杂逻辑。我们提出基于位读取机制的无比较器排序电路,与现有矩阵计算兼容,相较现有 ASIC 芯片实现 3.3 至 7.7 倍加速与 6.23 至 183.5 倍能效提升,较 CMOS 排序电路速度提升 7.7 倍。傅里叶变换则由易失/非易失异构电路以第一性原理实现:易失器件原位生成频谱,非易失器件完成乘累加,支持任意基数、非均匀与高精度变换,吞吐率达 504.3 GS/s,而业界当时的最快水平约在 100 GS/s 量级。

多核存算芯片平面示意、外围电路、存算指令集与端到端验证框架
存算芯片的三层组织:底层是存内算子电路,中层是把算子编排为程序的指令抽象,上层是与产业软件栈对接的验证框架。

芯片与系统

  • 毫秒级神经动力学系统芯片 基于相变忆阻器的可控存内计算范式,通过调控电导漂移与多级电导特性,把积分步长直接编码为器件的电导状态,实现自适应步长的原位搜索与多级电导存内乘累加。40nm 工艺,存内计算与步长漂移阵列总面积 0.28 mm2,运行频率 50 MHz,单步积分仅需 9 级流水,单次迭代时延 2.12 毫秒(Science 2026)。
  • 面向具身智能的混合精度相变存算芯片 40nm 工艺,采用数字存内计算并引入自适应漂移补偿,编程延迟降低 63.3%、计算损失降低 13.1 倍,数字存算能效达到 0.821 TFLOPS/W(IEDM 2025)。
  • 神经流形双模式存算架构 电流域与电荷域双模式设计,实现 476 倍能效提升,用于神经流形学习。
  • 存内数据库指令集架构 MeMCISA 以存储为中心组织数据库操作的指令抽象(MICRO 2024)。
  • 可编程概率计算加速器 相比 GPU 达到 42 至 1058 倍加速,用于因果推断等需要大量采样的任务。
  • 存算指令集与端到端框架 以四类向量指令构成完整算子集,支持数字型存算方式,对上层暴露类 CUDA 的编程接口。端到端验证框架兼容华为鲲鹏与昇腾仿真器,在华为计算产品线实际落地并取得高达 16.6 倍加速。
  • 阵列可靠性电路 片上写校验与耐久性增强电路、多个 RRAM 核之间的磨损均衡方法、基于有限状态机的写入验证方案,用于支撑多值阵列的长期稳定运行。

三 算法—架构—电路多层次协同优化

新器件带来的收益能否兑现,取决于三个层次是否在同一目标下联合优化。只改算法,硬件跑不动;只改电路,算法用不上。这个方向研究的是层与层之间的接口应该怎么定义。

算法层、架构层、电路层之间的双向约束与反馈闭环
向下传递映射约束,向上反馈物理约束。器件的非理想特性——电导漂移、写入波动、有限精度——不是需要被掩盖的缺陷,而是应当参与算法设计的先验信息。

分布式异构片上网络

面向神经网络与数据通信编解码等多样化算法,构建分布式异构片上网络体系结构,突破 AI 芯片的并发度瓶颈。在数通侧,提出首个极化码并行分树编解码架构芯片,吞吐达当时世界最高的 3.25 Gbps;非二进制 LDPC 奇偶校验体系结构解决了长期困扰 LDPC 实用化的误码率墙问题。在 AI 侧,分布式微分神经网络架构 HiMA 较当时最快的 AI 芯片加速 39.1 倍,带提前终止机制的 Neural ODE 体系结构加速 2.6 倍,DNC 辅助译码架构实现 54% 时延降低。

跨层优化方法

  • 结构化剪枝与步长搜索 两阶段结构化剪枝配合基于历史的步长搜索,在 FPGA 上加速神经常微分方程推理(FPGA 2023)。
  • 混合精度量化 面向混合专家模型的嵌套式动态混合精度量化方法,按专家与层级动态分配位宽。
  • 硬件感知的算法设计 列跳过排序算法、基于忆阻器的三角函数实现、面向存算架构的有限域纠错编解码方法,均以器件与阵列的物理特性为出发点重新设计算法。
  • 面向新型负载的加速器 单细胞 RNA 测序基因组处理加速器 MGPA(DATE)、布料模拟加速系统、储备池计算与癫痫检测硬件等。
  • 随机计算与近似计算 面向具身智能的混合精度边缘加速器,在 28nm 工艺下达到 534.6 TOPS/W。
跨层设计的价值往往体现在系统指标而非单点指标上。存内排序电路本身的加速比是一方面,更重要的是它让稀疏推理的动态调度成为可能,从而带来端到端的响应速度提升。

科研项目

实验室主持国家自然科学基金、国家重点研发计划、北京市自然科学基金及企业合作项目,覆盖从基础机理到工程落地的不同阶段。

在研与结题科研项目的周期甘特图
主持项目 11 项,参与项目 5 项。企业合作项目通常与国家级项目形成互补:前者提供真实负载与工艺条件,后者支撑更长周期的机理研究。

主持项目

资助来源类别项目名称起止时间
国家自然科学基金委优秀青年科学基金(海外)基于先进器件的软硬件协同芯片架构设计2023.01–2025.12(结题)
国家自然科学基金委面上项目神经微分方程高并发存算一体芯片研究2026.01–2029.12
国家自然科学基金委重大研究计划重点支持项目子课题SRAM 与 RRAM 融合的异构存算一体架构研究2024.01–2027.12
科学技术部国家重点研发计划「物态调控」专项课题基于莫尔超晶格光子学原型器件构建2023.12–2028.12
科学技术部国家重点研发计划「智能电网」重大专项子任务感存算一体化微纳传感单元性能调控机理及架构设计2025.01–2028.12
科学技术部国家重点研发计划「战略性科技创新合作」子任务大模型与认知机理协同的心理健康双向脑机交互系统2026.01–2028.12
北京市自然科学基金委非共识研究项目超越图灵机的高阶动力学芯片架构2025.03–2027.03
北京大学武汉人工智能研究院技术合作项目融合忆阻器与 SRAM 的视觉存算一体芯片2025.01–2026.01
华为技术有限公司青年人才支持项目下一代芯片体系结构研究与探索2025.01–2027.12
华为技术有限公司数通产品线技术合作FEC 低功耗技术研究2025.10–2026.10
常州纵慧芯光半导体技术合作项目垂直腔面发射感存算一体芯片与硬件系统2024.06–2026.06(结题)

参与项目

  • 国家自然科学基金委重大研究计划:基于忆阻器动力学的新型神经形态器件与神经网络计算架构(2021.01–2024.12,结题)
  • 北京市自然科学基金—昌平创新联合基金重点研究专题:面向新能源并网应用的忆阻器存算一体系统关键技术研究(2023.12–2026.12)
  • 国家重点研发计划:大规模、高能效的存算一体系统(2023.11–2027.11)
  • 美国国家科学基金会 FET Medium:Memory Processing Unit — An Efficient, Reconfigurable In-memory Computing Fabric(2019.06–2021.12,结题)
  • 美国国家科学基金会 CCF Small:Smart Continually-aware High-Fidelity Sensor Interfaces(2016.07–2020.06,结题)