ANVIL III 优化器宣称降低预训练成本 62%,称超越 Muon
kellerjordan0 · x · 2026-10-07
Hyperstition(Deven Pietrzak 团队)发布 LLM 优化器 ANVIL III,称其为 2024 年 Muon 之后最大的优化器突破:
- 前沿规模(8x Chinchilla 预算)下预训练成本降低 62%,解码速度提升带来推理成本降 30%
- 同等训练预算下,比完全调参的 Muon 低 20–28 millinats 验证损失;效率增益随规模递增:124M 为 32%,1.2B 达 50%
- 其 1.7B 模型 Feather 用 180 倍更少的训练 token 在数学上超过 Qwen3-1.7B-Base
- 团队还以 ANVIL II 创下 NanoGPT speedrun 纪录,效率跃升幅度超过此前 45 项世界纪录之和
文中梳理了从 Shampoo 到 Muon 的矩阵预条件优化器谱系,并回应了「nanoGPT 纪录能否 scale」的疑问:作者称 speedrun 本意是效率挑战,其主线工作是面向前沿规模的架构改进与 ANVIL III(纪录版本反而移除了可 scale 的部分)。
「Infra」频道最新
- 英伟达等四芯片巨头市值合计达9.8万亿美元,三年增长近5倍 — Beth_Kindig · 2026-10-07
- Cloud Run 隐藏 60% 扩缩容阈值开放自定义,已正式 GA — rseroter · 2026-10-07
- MIT Lincoln 实验室追踪 120+ 款 AI 加速器,绘制硬件演进图谱 — nordicinst · 2026-10-07
- K8 推出 2.5 亿美元预付款融资:AI 公司算力合同订金可借钱付 — Saul_Loveman · 2026-10-07
- Beff Jezos 今日出席 SF Tech Week,畅谈推理基础设施未来 — beffjezos · 2026-10-07
- ChipForge 芯片设计挑战赛上线:众包设计 AI 加速器并上真硬件 — bittingthembits · 2026-10-07