康奈尔新架构降低 36% 训练算力
burkov · x · 2026-08-21
康奈尔大学提出一种嵌套架构,能在一次端到端训练中完成整套语言模型训练。
核心成果:
- 训练算力降低 36%
- 推测解码吞吐量提升最高达 26%
- 且未降低模型准确率
「Infra」频道最新
- 中港团队开源 Libra,智能体训练吞吐提升 3 倍 — jiqizhixin · 2026-08-21
- 开源 x402-cleanweb-agent:网页转 Markdown 省 80% Token — EstablishmentTough18 · 2026-08-21
- 预训练还有巨大优化空间,算力是唯一瓶颈 — zeeshanp_ · 2026-08-21
- 算力账本:宣称日处理 100T token 需要约 58 万张 GPU? — teortaxesTex · 2026-08-21
- 摩尔定律失效在即,非硅计算与新型架构将迎资本热潮 — MikePFrank · 2026-08-21
- 「不懂为什么要建数据中心,写快点内核不就行了」 — basedjensen · 2026-08-21