Yoav Goldberg:Ark 的 harness 很糟糕,OpenAI 的修复理所当然
yoavgo · x · 2026-09-05
AI 研究者 Yoav Goldberg(yoavgo)在讨论中表示,围绕 harness(评测脚手架)重要性的说法被证明相当站不住脚——Ark 的 harness 简直很糟糕,而 OpenAI 做出的“修复”完全是顺理成章的回应。他还补充称,一些过去依赖 harness 才有的能力如今似乎被直接推进了模型本身。评价针对具体的模型/harness 事件,带有研究者第一手判断。
「模型」频道最新
- 开发者讽刺 ARC-AGI 系列:游戏分辨率堆号数何时才算 AGI — AndrewDai · 2026-09-05
- Claude 完成费马大定理首个形式化证明:1300 万行 Lean 代码 — AnthropicAI · 2026-09-05
- 一周AI大发布:Fable 5.1、GLM-5.3权重、三个实时世界模型 — thursdai_pod · 2026-09-05
- Greg Brockman 以「欢迎来到 AGI 时代」为 GPT-6 发布会收尾 — thursdai_pod · 2026-09-05
- GPT-6 计算机使用直播实测:macOS 模拟器演示「真的能用」 — thursdai_pod · 2026-09-05
- 9 月 3 日成「AGI 日」:前沿实验室齐发 .1,GPT-6 抢尽风头 — thursdai_pod · 2026-09-05