Epoch AI 新实验:给模型 3000 GPU 小时自研后训练方法,发明能力仍差
rms80 · x · 2026-10-10
Epoch AI 给 Fable 5 和 GPT-5.6 Sol 各 3000 GPU 小时,任务是开发一种优于现有基线 GRPO 的新型后训练技术,以此测试模型的「发明」能力。
markcummins 评价这是当下唯一值得追踪的评测:模型在发明方面仍然很弱。从 GRPO 到 SDPO 这样相对温和的概念跨越,竟比近期的数学成果更难,说明二者有本质差异——「等这一点变了,一切都不好说了」。
「模型」频道最新
- Nace AI 开源 Drex v1.5 决策模型,128k 上下文可本地部署 — nischay_twt · 2026-10-10
- Tinker 宣布最高降价 70%,GLM-5.3-Flash 与 DeepSeek-v4.1-Flash 上线 — soumithchintala · 2026-10-10
- Bindu Reddy 调侃 Google:Argon 未发,内部已有「强得多」新模型 — bindureddy · 2026-10-10
- TypeSafe 团队发文:从通用大模型到「决策模型」的范式转移 — WhatTheLJW · 2026-10-10
- Vik Paruchuri:olmOCR-bench 已饱和,涨分靠对齐格式 — VikParuchuri · 2026-10-10
- Datalab 发布 OmniParseBench:16288 项 OCR 测试自曝未登顶 — VikParuchuri · 2026-10-10