Transformer 推理算力冗余巨大?计算智能的物理下限尚不可知
prateekj · x · 2026-08-19
目前尚不清楚 Transformer 推理中多少算力是根本必要的,多少仅仅是当前架构实现的产物。我们缺乏将能力水平与算力、参数读取、内存移动或能耗联系起来的既定下限。
核心观点
- 智能的必要操作仅需根据输入和内部状态计算足够信息以选择下一个输出。
- 当前的稠密 Transformer 存在明显的非必要成本:每个 token 都要触及整个模型、移动权重、维护 KV Cache、对先前 token 做注意力计算、不论难易都使用固定深度计算。
- 现在的工作量可能是理论最低值的 3 倍、20 倍甚至 500 倍,这是“表示形式”的属性,而非智能的物理定律。
- 未来的推理计算单元可能更像是有选择地检索和更新少量相关状态,而非反复评估整个巨型函数。
「Infra」频道最新
- Crusoe 发布集成指南:Cursor 等工具接 GLM/DeepSeek — darian314 · 2026-08-19
- Polymarket 预测:年底前某州实施数据中心禁令概率 67% — Polymarket · 2026-08-19
- 只需最小化窗口,ComfyUI 生成提速 15-20% — dota2portaltv · 2026-08-19
- 企业为何需要 AI 模型路由:韧性优于成本优化 — mattturck · 2026-08-19
- 美光 CEO 称客户头号约束已非电力,而是 DRAM — Beth_Kindig · 2026-08-19
- 六大资管巨头联手英伟达,超5000亿美元算力融资平台落地 — JOBhakdi · 2026-08-19