评测分数属于系统而非权重:Opus 4.6 换个 harness 从 0% 跳到 97.1%
le_james94 · x · 2026-09-18
作者指出评测分数属于整个系统而不只是模型权重:在 ARC-AGI-3 的一个环境中,Opus 4.6 无 harness 得 0%,配上手工构建的 harness 后得 97.1%。同时,多数推理评测的噪声底在 0.22–1.48 分之间,两家新闻稿之间 1 分的差距很可能只是噪声。结合上一条:Kimi K3 报告中 RL 算法只占一句话,训练环境却写了约七页、训练中创建了 5121 万个沙箱——瓶颈不在算法,而在有人要搭建环境。
「模型」频道最新
- 曝 GPT-6 Astra 登顶 FrontierSWE,600MB 音频压缩至 20KB — soumitrashukla9 · 2026-09-18
- 博主实测 Meta Muse Code:便宜得出奇且质量在线 — AIandDesign · 2026-09-18
- 社区一天揭面:OpenRouter 匿名模型 Union Alpha 实为 Pareto 26.9 — gaganghotra_ · 2026-09-18
- Emad 转发:8GB 内存设备也能跑 Opus 4.5 级模型 — ccerrato147 · 2026-09-18
- Astra 计算机使用自动排版 Google 文档,体验者称久违的魔法感 — var_epsilon · 2026-09-18
- jev 或在速度、成本与效果上全面超越 Cohere 成最佳 reranker — multiply_matrix · 2026-09-18