时间编码光子 interposer 让模拟视觉链路 EDP 降到 8-bit 电学的一半

A Time-Encoded Analog Photonic Interposer for Energy-EfficientIntegration of Analog Vision Sensors and Analog Accelerators

Subhradip Chakraborty, Zihan Yin, Xuming Chen, Chengwei Zhou, Gourav Datta, Akhilesh Jaiswal

cs.AR

2026-09-03

把幅度编成时间间隔、经 WDM 光子 interposer 送到模拟加速器,隐式 6-bit、每 PE 一根波长。10 mm 全局快门相对 8-bit 电学基线 EDP 改善 2.04 倍,VWW 上 ResNet18 准确率 89.87%。

这篇在解决什么

像素内计算(in-pixel computing, IPC)能在传感器平面做完第一层卷积,激活仍是模拟量。送到另一颗 chiplet 上的模拟加速器时,现有电学 interposer 通常要先 ADC 再 DAC;距离一拉长,电阻损耗和电容负载逼着反复数字化,模拟计算省下的能量被互连吃回去。硅光互连带宽高、寄生小,但以往光子 interposer 只走数字。微环谐振器(MRR)消光比只有 15–25 dB,幅度调制扛不住模拟精度。

Wisconsin–Madison 和 Case Western 做的是一条时间编码的模拟光子 interposer:幅度变成时间间隔,在波分复用链路上走,接收端再变回电压,中间不显式跑高精度 ADC/DAC。

方法

演示系统三块:IPC 传感器做第一层卷积并输出模拟激活;硅光 interposer 做长距传输;模拟加速器跑后面的层(加速器沿用既有模拟 DNN 设计)。电子 chiplet 用 GF 22nm FDSOI,光子用 GF 45SPCLO。IPC 把 Processing-in-Pixel-in-Memory 单元改成全模拟:3T CIS 像素经 Cu–Cu 键合到固定权重管,列上累加;有符号卷积拆成正负两次曝光,模拟 CDS 做 (V+ − V−)/3。激活存在低漏电的 IGZO gain cell 里,等 ATC 来取。

发送端是 6-bit 单斜率式 analog-to-time converter:1 GHz 时钟的 6-bit 计数器打 CDAC 斜坡,strong-arm 比较器在斜坡越过 IPC 电压时翻转,用两个电平去调 MRR 的 PN 结。信息在边沿时刻,不在光幅度。接收端 MRR 偏置在离共振,光电二极管加 TIA 出阈值,作为接收斜坡的使能;使能落下时把斜坡电压采到 PE 电容上,完成重建。链路上没有数字码字,也没有 SerDes。每个 PE 一根波长,与精度无关;K=3 的第二层用 9 根波长做空间解复用,权重静止、激活流过。6-bit 数字光链路按精度要 6 根波长,会顶到该工艺的 FSR。

ATC 64 个周期、64 ns,单波长 15.6 MS/s;9 波长合计约 140 MS/s。热校准大约 1 pJ/值,约占链路能量 15%。互连 6.6 pJ/值(含校准 7.6 pJ)。相对 IPC 的 10 μs 计算周期,互连时延可以藏进流水。

结果

L = 10 mm、560×560 Visual Wake Words:

指标模拟 RS模拟 GS数字 RS数字 GS
能量 (μJ)1.161.301.321.47
延迟 (ms)8.960.798.961.44
EDP (nJ·s)10.441.0411.912.13
归一化 EDP9.98111.392.04

2.04 倍来自全局快门、对比列并行 8-bit SAR 电学基线。Rolling shutter 下互连和行计算流水,优势要到 L > 30 mm 才露出来。精度对齐的 6-bit 电学基线:GS 模式 L=10 mm 仍 1.31 倍,L=25 mm 拉到 10.07 倍,距离越长光链路越划算。模拟 IPC 本体 RS/GS 为 1.68/118.16 GOPS、21.61/17.92 TOPS/W。

前端加上互连的总变分约 14.41%,加速器按 0.6% 噪声。准确率:

方法VWW R18VWW MBv2CIFAR-10 R18CIFAR-10 MBv2ModelNet40 R18ModelNet40 MBv2
数字基线91.6487.1693.8189.3782.7076.54
仅 IPC91.3887.6993.4389.2182.6275.20
IPC+光子89.8786.1592.9288.9082.2974.84

最差退化低于 2%(VWW 上 1.77% / 1.01%)。MRR 硅测确认:直接用幅度传模拟时,高偏置下电平间距变窄,这是改走时间编码的硬件理由。

为什么重要

面向把模拟传感器和模拟加速器拆到两颗 chiplet、互连到厘米级的边缘视觉系统。时间编码换来的是波长预算与精度解耦,以及出错时变成小电压偏差,不会像 NRZ 数字链路那样整 bit 翻掉。对只在片内做数字光互连的加速器设计,这篇的问题设定不同:它保的是跨芯片的模拟激活,不是 PE 之间的数字张量。数字仍是仿真加部分 MRR 实测,不是流片后的端到端相机。

局限与存疑

EDP 数字来自 GF PDK 仿真,不是完整系统芯片测量;MRR 有 GF45SPCLO 硅测,TX/RX 链路是瞬态和 1000 点 Monte Carlo。6-bit 是链路上的隐式量化,和「完全没有量化的模拟」不是一回事。Rolling shutter 在短距下并不赢,表格里 RS 归一化 EDP 仍是 9.98。准确率实验把数字基线输入设成 224×224 来对齐 560×560 前端的步幅,分辨率并没有真的对等。加速器噪声 0.6% 沿用前人设计,不是这套光子链路测出来的。FSR 限制了更大卷积核的波长数。会议是 ASP-DAC,偏架构探索。

术语

原文与代码

社区讨论

相关论文

全部论文解读