爆料称美前沿实验室堆 GPU 只为追最后 1-3% 模型性能
SumitGup · x · 2026-09-05
- 业内人士 jukan05 转述一种解释:美国前沿 AI 实验室大量堆 GPU 训练,是因为采用「多池候选模型大规模扩展探索、再择优」的低效训练方式。
- 据称候选池中中等模型与最佳模型的性能差距最多只有约 1-3%,但为追求最优,实验室仍投入巨量算力。
- 背景是其上一条推文提到某模型(Astra)使用了 10 万张 GPU 训练,感叹算力规模惊人。该说法为转述,未获官方证实。
「Infra」频道最新
- Conviva 实测:Rust 查询引擎用 io_uring 替换 mmap 反而更慢 — blaizedsouza · 2026-09-06
- 微软 Cornell 论文:免费 pause token 零推理开销提升模型预测力 — dair_ai · 2026-09-06
- DLSS5 视频超分快到离谱,作者提议多遍 x2 放大替代传统 upscale — More-Ad5919 · 2026-09-06
- 别再无视那条 PyTorch 提示:一行设置真能省下大量 flops — generativist · 2026-09-06
- Qwen3.5 9B 手机端全本地跑通 Agent:推理、写码、生成 PDF 一条龙 — fuzhongkai · 2026-09-05
- AI Agent 落地生产后的失控难题:有人在造「Agent 版 SRE 控制层」 — Fantastic-Sleep-3352 · 2026-09-05