研究者:扩模型就该扩深度,推理效率才是智能性价比关键
eliebakouch · x · 2026-09-03
研究者 elie bakouch 发推讨论规模化的技术方向:扩大模型规模时就必须扩展深度(无论是否借助 recurrence),这让模型推理更高效。他指出 OpenAI 与(程度稍低的)Anthropic 都在明确训练模型追求更高推理效率而非更低——原因很显然是为了单位成本的智能。同时他补充:这并不意味着应该建造上千层深、无法监控和对齐的网络。推文还提到当前模型为思考复杂问题仍需生成数百万推理 token 的问题。
「研究」频道最新
- ICLR 2027 去匿名化政策获赞,有学者呼吁投稿上限再砍到 5 篇 — peter_richtarik · 2026-09-03
- motion-bricks.cpp 开源:桌面 CPU 实时生成关键帧动画 — zhengyiluo · 2026-09-03
- Mostik 潜空间桥接大小模型:登顶 ARC-AGI 3,成本降至 1/20 — SimplyAnnisa · 2026-09-03
- 机制设计或成对齐新思路:不改神经网络,改游戏规则 — morqon · 2026-09-03
- Chris Potts 在 IPAM 可解释性工作坊讲解新论文 — ChrisGPotts · 2026-09-03
- 研究提出离散扩散视角的循环 Transformer,绕过递归反传 — SkyLi0n · 2026-09-03