ICML 论文证明对数深度即可让 Transformer 高效模拟并行计算
kfountou · x · 2026-09-21
Sanford、Hsu 与 Telgarsky 的 ICML 2024 论文《Transformers, Parallel Computation, and Logarithmic Depth》证明了:常数层 self-attention 可以与常数轮大规模并行计算(MPC)通信互相高效模拟。
推论是:对数深度的 Transformer 就足以高效解决若干其他神经序列模型与次二次 Transformer 近似无法高效解决的基础计算任务,从而确立「并行性」是 Transformer 的关键差异化性质。
发帖人 kfountou 在课程阅读中提出技术疑问:MPC 模拟中的 MLP 内部尺寸没有上界、被允许计算任意函数,这让路由构造中的 MLP 解码器能恢复干净消息、丢弃损坏副本并去重——但这种无界自由度也让构造的理论解释变得微妙。讨论围绕该构造细节是否合理展开。
所属事件:Transformer 对数深度并行计算证明被指存在漏洞(3 条相关)→
「研究」频道最新
- GPT-6 Astra 登顶 Terminal-Bench Science,领先第二名 31.4 分 — DeryaTR_ · 2026-09-21
- 蚂蚁开源 Code2Skill:从代码中批量合成可验证智能体技能 — ant-intl · 2026-09-21
- RecreationWorld:跨五平台的计算机使用智能体基准,GPT-6 得分 58.1% — Shuai Bai · 2026-09-21
- OmniVBench 发布:18 项细粒度任务评测全类型参考到视频生成 — Wenxue Li · 2026-09-21
- 研究警告「科学判断坍缩」:AI 审稿数据回流训练将压缩评分多样性 — Sy-Tuyen Ho · 2026-09-21
- 苹果发布 MintAct:统一视觉智能体模型,OSWorld 拿 48.9 分 — apple · 2026-09-21