Epoch AI 新实验:给模型 3000 GPU 小时自研后训练方法,发明能力仍差

rms80 · x · 2026-10-10

Epoch AI 给 Fable 5 和 GPT-5.6 Sol 各 3000 GPU 小时,任务是开发一种优于现有基线 GRPO 的新型后训练技术,以此测试模型的「发明」能力。

markcummins 评价这是当下唯一值得追踪的评测:模型在发明方面仍然很弱。从 GRPO 到 SDPO 这样相对温和的概念跨越,竟比近期的数学成果更难,说明二者有本质差异——「等这一点变了,一切都不好说了」。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →