Burkov:循环 Transformer 或让 7B 模型回归并真正胜任编码

burkov · x · 2026-09-17

《百页机器学习书》作者 Andriy Burkov 预测:采用循环/looping transformer 架构与 SOTA 注意力机制的 7B 小模型将很快回归,并在编码任务上真正好用。这代表一条与「堆大模型」相反的路线:用架构效率而非参数规模换取小模型在编程场景的实用性。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →