评测分数属于系统而非权重:Opus 4.6 换个 harness 从 0% 跳到 97.1%

le_james94 · x · 2026-09-18

作者指出评测分数属于整个系统而不只是模型权重:在 ARC-AGI-3 的一个环境中,Opus 4.6 无 harness 得 0%,配上手工构建的 harness 后得 97.1%。同时,多数推理评测的噪声底在 0.22–1.48 分之间,两家新闻稿之间 1 分的差距很可能只是噪声。结合上一条:Kimi K3 报告中 RL 算法只占一句话,训练环境却写了约七页、训练中创建了 5121 万个沙箱——瓶颈不在算法,而在有人要搭建环境。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →