2026-08-27
威斯康星–斯坦福把SiV⁻嵌进逆设计GaP-on-diamond激活单元,0.24 nW/μm²即可超过数字网络的表达力增长因子;MNIST非线性96.72%对线性88.41%,LLM尺度非线性光功率估在1.2 W以下。
光神经网络把矩阵乘做得很便宜,非线性一直是短板。常规材料的光学非线性是微扰量级,现有全光激活往往要 mW/μm² 量级的光强和大面积器件,很难堆深层。光电来回转换能补非线性,但加延迟和系统复杂度。结构非线性把输入编进可调参数,和标准深度网络的对应关系又不干净。
威斯康星大学麦迪逊分校 Zhou、Kim、Tao 与斯坦福 Zhou、通讯作者 Yu 等人给出一条量子路线:单个量子发射体几光子就能饱和,非线性比体材料强得多。问题是,这种非线性对网络表达力值多少、要多强的光。
激活单元把一颗 SiV⁻ 色心嵌进伴随优化的 GaP-on-diamond 纳米结构,设计区 1.5×0.7 μm²。发射体按两能级系统建模,自发辐射率 Γ₀=2π×94 MHz(寿命极限线宽)。弱场时它是线性散射体,强场时近乎透明;两端口几何用干涉把透射变化做到 |Δt|=1。三维非线性 FDFD 给出输入–输出曲线,再抽成有效激活函数。
训练走 physics-aware:先用全波仿真标定激活曲线,在 PyTorch 里把线性块写成满足能量守恒的复透射矩阵,反向传播后再把每层权重伴随优化成紧凑光子块。分类任务用全波非线性 FDFD 复核;Pong 因算力改用二维仿真。表达力用数据流形总曲率的层间增长因子 r 来量化,数字 MLP 的激活大约每层 r≈1.045–1.095。
该激活在 I=0.24 nW/μm² 时 r≈1.14,已经超过数字基线。同样目标下,50 μm 硅波导 Kerr 要超过 72.6 W/μm²,15 nm 堆叠石墨烯饱和吸收大约 0.02 W/μm²。相对石墨烯约 8.3×10⁷ 倍,相对硅约 3.0×10¹¹ 倍。摘要里相对常规光学材料是七个数量级。量子效率降到 60% 时方案仍可用。
| 平台 | 达到数字 r 所需光强 |
| 硅 Kerr(50 μm) | >72.6 W/μm² |
| 石墨烯饱和吸收 | 0.02 W/μm² |
| 量子激活单元 | 0.24 nW/μm² |
监督任务上,非线性对线性:MNIST 测试准确率 96.72% 对 88.41%,FashionMNIST 87.87% 对 80.23%。三分类螺旋数据集用全波仿真能分开。强化学习训了 104 个模型(线性/非线性各 52 个):线性 Pong 策略封顶低、方差大,非线性随规模升到接近满分;人类水平参考奖励 9.3。HalfCheetah 上非线性策略能跑稳,线性策略早早摔倒。
按 Transformer 每层 3 Lseq dmodel 个光神经元、有效截面 0.1 μm² 估算,从 GPT-2 到 DeepSeek-V3,非线性受限光功率始终低于 1.2 W,标度大约 P∝Nparam^0.66。硅或石墨烯路线在最大模型上会冲到 10⁸ W 量级。这是激活函数给出的下限,不是整机功耗。
光计算圈子缺的往往不是更快的线性乘加,是能在芯片功率预算里堆起来的非线性。这篇把「发射体很非线性」翻译成和数字网络可比的 r(I),并给出一套可模块化反演设计的训练流程。做光子加速器的人可以拿 0.24 nW/μm² 和 72.6 W/μm² 这对数字当筛选门槛:过不了数字 r 的材料,再堆层也还是弱非线性。
全程数值,没有流片。SiV⁻ 本征响应在亚 GHz,而光计算常用 10–50 GHz 调制;文中逆设计单元的 Purcell 因子约 2.74,文献腔结构能到 2π×4.6 GHz,GHz 仍要额外增强。固态发射体常需低温压退相干,冷却功耗没进那 1.2 W。非均匀展宽、确定性放置、片上规模都远小于 LLM。Pong 是二维仿真。功率公式假设每个光神经元都能在 Imin 工作,自由空间衍射网络更接近近期大规模实现,片上光子维度差得更远。