Research
科学研究
摩尔定律放缓后,能效的提升更多来自新器件与新架构的组合。实验室沿三个方向展开工作,分别对应光电融合、存算融合,以及贯通它们的跨层协同方法。
研究总览
三个方向并非彼此独立:光电异构与存算一体提供两类互补的物理计算载体,而多层次协同优化决定了这些载体能否被算法真正用上。
一 光电异构芯片架构及其集成电路设计
电互连的带宽与功耗正在成为大模型推理的主要瓶颈。光在传播过程中几乎不消耗能量,且天然支持波长与空间的并行复用;但光难以存储、难以做高精度非线性。这一对互补性决定了合理的做法不是「全光计算」,而是让光电各自承担适合的部分。
研究内容
我们把 VCSEL 阵列、莫尔超晶格光子学器件与忆阻器阵列放在同一条计算通路上:光域完成高并行的权重—激活相乘与长距离数据分发,电域完成高精度累加、状态保持与可编程控制。围绕这条通路,需要解决器件、电路与编译三个层面的问题。
具体课题
- 莫尔超晶格光子学原型器件与电路 依托科技部国家重点研发计划「物态调控」专项课题,探索莫尔超晶格结构中的光场调控机制,并把器件特性抽象为可用于电路设计的紧凑模型。
- 面向大语言模型的光电融合异构计算架构 针对大模型推理中的访存墙与互连墙,设计光电协同的计算与数据分发架构,并配套硬件映射方法,在编译阶段自动划分光域与电域承担的计算图片段。
- 基于 RRAM 与 VCSEL 的无跨阻放大器数字存内计算级联电路 把光电探测与存内乘累加合并为一级,减少级间转换带来的噪声与功耗开销。
- 感存算一体的垂直腔面发射芯片与硬件系统 与常州纵慧芯光半导体合作,将光发射、探测与计算集成于同一硬件系统,在传感前端就完成特征提取。
- 神经形态视觉器件与电路 二维材料光电神经元与铁电突触的同质集成(Nature Communications 2026);基于全范德华双极铁电结构的可配置光学异质突触,用于传感器内计算(Advanced Materials 2024)。
- 原位频率转换电路 基于电流控 VO2 器件阵列实现信号的原位合成与混频,在端到端无线物联网测试中降低 1.45 至 1.94 倍能耗(Nature Communications 2024)。
二 存算芯片架构及其集成电路设计
存算一体已经能很好地处理乘累加,但真实负载中还有大量非线性、条件判断与数据搬移操作——排序、傅里叶变换、微分方程求解、数据库查询——它们长期只能退回到数字逻辑执行,成为整个系统的短板。实验室的工作主要针对这一类算子。
存内算子:把「算子鸿沟」补上
排序的核心是比较运算,需要精准实现条件判断与数据搬移,传统存算架构面向乘加设计,难以支持这种复杂逻辑。我们提出基于位读取机制的无比较器排序电路,与现有矩阵计算兼容,相较现有 ASIC 芯片实现 3.3 至 7.7 倍加速与 6.23 至 183.5 倍能效提升,较 CMOS 排序电路速度提升 7.7 倍。傅里叶变换则由易失/非易失异构电路以第一性原理实现:易失器件原位生成频谱,非易失器件完成乘累加,支持任意基数、非均匀与高精度变换,吞吐率达 504.3 GS/s,而业界当时的最快水平约在 100 GS/s 量级。
芯片与系统
- 毫秒级神经动力学系统芯片 基于相变忆阻器的可控存内计算范式,通过调控电导漂移与多级电导特性,把积分步长直接编码为器件的电导状态,实现自适应步长的原位搜索与多级电导存内乘累加。40nm 工艺,存内计算与步长漂移阵列总面积 0.28 mm2,运行频率 50 MHz,单步积分仅需 9 级流水,单次迭代时延 2.12 毫秒(Science 2026)。
- 面向具身智能的混合精度相变存算芯片 40nm 工艺,采用数字存内计算并引入自适应漂移补偿,编程延迟降低 63.3%、计算损失降低 13.1 倍,数字存算能效达到 0.821 TFLOPS/W(IEDM 2025)。
- 神经流形双模式存算架构 电流域与电荷域双模式设计,实现 476 倍能效提升,用于神经流形学习。
- 存内数据库指令集架构 MeMCISA 以存储为中心组织数据库操作的指令抽象(MICRO 2024)。
- 可编程概率计算加速器 相比 GPU 达到 42 至 1058 倍加速,用于因果推断等需要大量采样的任务。
- 存算指令集与端到端框架 以四类向量指令构成完整算子集,支持数字型存算方式,对上层暴露类 CUDA 的编程接口。端到端验证框架兼容华为鲲鹏与昇腾仿真器,在华为计算产品线实际落地并取得高达 16.6 倍加速。
- 阵列可靠性电路 片上写校验与耐久性增强电路、多个 RRAM 核之间的磨损均衡方法、基于有限状态机的写入验证方案,用于支撑多值阵列的长期稳定运行。
三 算法—架构—电路多层次协同优化
新器件带来的收益能否兑现,取决于三个层次是否在同一目标下联合优化。只改算法,硬件跑不动;只改电路,算法用不上。这个方向研究的是层与层之间的接口应该怎么定义。
分布式异构片上网络
面向神经网络与数据通信编解码等多样化算法,构建分布式异构片上网络体系结构,突破 AI 芯片的并发度瓶颈。在数通侧,提出首个极化码并行分树编解码架构芯片,吞吐达当时世界最高的 3.25 Gbps;非二进制 LDPC 奇偶校验体系结构解决了长期困扰 LDPC 实用化的误码率墙问题。在 AI 侧,分布式微分神经网络架构 HiMA 较当时最快的 AI 芯片加速 39.1 倍,带提前终止机制的 Neural ODE 体系结构加速 2.6 倍,DNC 辅助译码架构实现 54% 时延降低。
跨层优化方法
- 结构化剪枝与步长搜索 两阶段结构化剪枝配合基于历史的步长搜索,在 FPGA 上加速神经常微分方程推理(FPGA 2023)。
- 混合精度量化 面向混合专家模型的嵌套式动态混合精度量化方法,按专家与层级动态分配位宽。
- 硬件感知的算法设计 列跳过排序算法、基于忆阻器的三角函数实现、面向存算架构的有限域纠错编解码方法,均以器件与阵列的物理特性为出发点重新设计算法。
- 面向新型负载的加速器 单细胞 RNA 测序基因组处理加速器 MGPA(DATE)、布料模拟加速系统、储备池计算与癫痫检测硬件等。
- 随机计算与近似计算 面向具身智能的混合精度边缘加速器,在 28nm 工艺下达到 534.6 TOPS/W。
科研项目
实验室主持国家自然科学基金、国家重点研发计划、北京市自然科学基金及企业合作项目,覆盖从基础机理到工程落地的不同阶段。
主持项目
| 资助来源 | 类别 | 项目名称 | 起止时间 |
|---|---|---|---|
| 国家自然科学基金委 | 优秀青年科学基金(海外) | 基于先进器件的软硬件协同芯片架构设计 | 2023.01–2025.12(结题) |
| 国家自然科学基金委 | 面上项目 | 神经微分方程高并发存算一体芯片研究 | 2026.01–2029.12 |
| 国家自然科学基金委 | 重大研究计划重点支持项目子课题 | SRAM 与 RRAM 融合的异构存算一体架构研究 | 2024.01–2027.12 |
| 科学技术部 | 国家重点研发计划「物态调控」专项课题 | 基于莫尔超晶格光子学原型器件构建 | 2023.12–2028.12 |
| 科学技术部 | 国家重点研发计划「智能电网」重大专项子任务 | 感存算一体化微纳传感单元性能调控机理及架构设计 | 2025.01–2028.12 |
| 科学技术部 | 国家重点研发计划「战略性科技创新合作」子任务 | 大模型与认知机理协同的心理健康双向脑机交互系统 | 2026.01–2028.12 |
| 北京市自然科学基金委 | 非共识研究项目 | 超越图灵机的高阶动力学芯片架构 | 2025.03–2027.03 |
| 北京大学武汉人工智能研究院 | 技术合作项目 | 融合忆阻器与 SRAM 的视觉存算一体芯片 | 2025.01–2026.01 |
| 华为技术有限公司 | 青年人才支持项目 | 下一代芯片体系结构研究与探索 | 2025.01–2027.12 |
| 华为技术有限公司 | 数通产品线技术合作 | FEC 低功耗技术研究 | 2025.10–2026.10 |
| 常州纵慧芯光半导体 | 技术合作项目 | 垂直腔面发射感存算一体芯片与硬件系统 | 2024.06–2026.06(结题) |
参与项目
- 国家自然科学基金委重大研究计划:基于忆阻器动力学的新型神经形态器件与神经网络计算架构(2021.01–2024.12,结题)
- 北京市自然科学基金—昌平创新联合基金重点研究专题:面向新能源并网应用的忆阻器存算一体系统关键技术研究(2023.12–2026.12)
- 国家重点研发计划:大规模、高能效的存算一体系统(2023.11–2027.11)
- 美国国家科学基金会 FET Medium:Memory Processing Unit — An Efficient, Reconfigurable In-memory Computing Fabric(2019.06–2021.12,结题)
- 美国国家科学基金会 CCF Small:Smart Continually-aware High-Fidelity Sensor Interfaces(2016.07–2020.06,结题)