A Time-Encoded Analog Photonic Interposer for Energy-EfficientIntegration of Analog Vision Sensors and Analog Accelerators
Subhradip Chakraborty, Zihan Yin, Xuming Chen, Chengwei Zhou, Gourav Datta, Akhilesh Jaiswal
cs.AR
2026-09-03
把幅度编成时间间隔、经 WDM 光子 interposer 送到模拟加速器,隐式 6-bit、每 PE 一根波长。10 mm 全局快门相对 8-bit 电学基线 EDP 改善 2.04 倍,VWW 上 ResNet18 准确率 89.87%。
像素内计算(in-pixel computing, IPC)能在传感器平面做完第一层卷积,激活仍是模拟量。送到另一颗 chiplet 上的模拟加速器时,现有电学 interposer 通常要先 ADC 再 DAC;距离一拉长,电阻损耗和电容负载逼着反复数字化,模拟计算省下的能量被互连吃回去。硅光互连带宽高、寄生小,但以往光子 interposer 只走数字。微环谐振器(MRR)消光比只有 15–25 dB,幅度调制扛不住模拟精度。
Wisconsin–Madison 和 Case Western 做的是一条时间编码的模拟光子 interposer:幅度变成时间间隔,在波分复用链路上走,接收端再变回电压,中间不显式跑高精度 ADC/DAC。
演示系统三块:IPC 传感器做第一层卷积并输出模拟激活;硅光 interposer 做长距传输;模拟加速器跑后面的层(加速器沿用既有模拟 DNN 设计)。电子 chiplet 用 GF 22nm FDSOI,光子用 GF 45SPCLO。IPC 把 Processing-in-Pixel-in-Memory 单元改成全模拟:3T CIS 像素经 Cu–Cu 键合到固定权重管,列上累加;有符号卷积拆成正负两次曝光,模拟 CDS 做 (V+ − V−)/3。激活存在低漏电的 IGZO gain cell 里,等 ATC 来取。
发送端是 6-bit 单斜率式 analog-to-time converter:1 GHz 时钟的 6-bit 计数器打 CDAC 斜坡,strong-arm 比较器在斜坡越过 IPC 电压时翻转,用两个电平去调 MRR 的 PN 结。信息在边沿时刻,不在光幅度。接收端 MRR 偏置在离共振,光电二极管加 TIA 出阈值,作为接收斜坡的使能;使能落下时把斜坡电压采到 PE 电容上,完成重建。链路上没有数字码字,也没有 SerDes。每个 PE 一根波长,与精度无关;K=3 的第二层用 9 根波长做空间解复用,权重静止、激活流过。6-bit 数字光链路按精度要 6 根波长,会顶到该工艺的 FSR。
ATC 64 个周期、64 ns,单波长 15.6 MS/s;9 波长合计约 140 MS/s。热校准大约 1 pJ/值,约占链路能量 15%。互连 6.6 pJ/值(含校准 7.6 pJ)。相对 IPC 的 10 μs 计算周期,互连时延可以藏进流水。
L = 10 mm、560×560 Visual Wake Words:
| 指标 | 模拟 RS | 模拟 GS | 数字 RS | 数字 GS |
| 能量 (μJ) | 1.16 | 1.30 | 1.32 | 1.47 |
| 延迟 (ms) | 8.96 | 0.79 | 8.96 | 1.44 |
| EDP (nJ·s) | 10.44 | 1.04 | 11.91 | 2.13 |
| 归一化 EDP | 9.98 | 1 | 11.39 | 2.04 |
2.04 倍来自全局快门、对比列并行 8-bit SAR 电学基线。Rolling shutter 下互连和行计算流水,优势要到 L > 30 mm 才露出来。精度对齐的 6-bit 电学基线:GS 模式 L=10 mm 仍 1.31 倍,L=25 mm 拉到 10.07 倍,距离越长光链路越划算。模拟 IPC 本体 RS/GS 为 1.68/118.16 GOPS、21.61/17.92 TOPS/W。
前端加上互连的总变分约 14.41%,加速器按 0.6% 噪声。准确率:
| 方法 | VWW R18 | VWW MBv2 | CIFAR-10 R18 | CIFAR-10 MBv2 | ModelNet40 R18 | ModelNet40 MBv2 |
| 数字基线 | 91.64 | 87.16 | 93.81 | 89.37 | 82.70 | 76.54 |
| 仅 IPC | 91.38 | 87.69 | 93.43 | 89.21 | 82.62 | 75.20 |
| IPC+光子 | 89.87 | 86.15 | 92.92 | 88.90 | 82.29 | 74.84 |
最差退化低于 2%(VWW 上 1.77% / 1.01%)。MRR 硅测确认:直接用幅度传模拟时,高偏置下电平间距变窄,这是改走时间编码的硬件理由。
面向把模拟传感器和模拟加速器拆到两颗 chiplet、互连到厘米级的边缘视觉系统。时间编码换来的是波长预算与精度解耦,以及出错时变成小电压偏差,不会像 NRZ 数字链路那样整 bit 翻掉。对只在片内做数字光互连的加速器设计,这篇的问题设定不同:它保的是跨芯片的模拟激活,不是 PE 之间的数字张量。数字仍是仿真加部分 MRR 实测,不是流片后的端到端相机。
EDP 数字来自 GF PDK 仿真,不是完整系统芯片测量;MRR 有 GF45SPCLO 硅测,TX/RX 链路是瞬态和 1000 点 Monte Carlo。6-bit 是链路上的隐式量化,和「完全没有量化的模拟」不是一回事。Rolling shutter 在短距下并不赢,表格里 RS 归一化 EDP 仍是 9.98。准确率实验把数字基线输入设成 224×224 来对齐 560×560 前端的步幅,分辨率并没有真的对等。加速器噪声 0.6% 沿用前人设计,不是这套光子链路测出来的。FSR 限制了更大卷积核的波长数。会议是 ASP-DAC,偏架构探索。