ARC-AGI-3 的提升可能更多来自 harness,而非 Opus 5 定向训练
mhmazur · x · 2026-07-28
Mike Knoop 认为,ARC-AGI-3 很可能并不是 Opus 5 直接针对训练出来的。他更倾向于判断,真正发生变化的是模型逐渐学会了 Claude Code / Work harness 这套运行方式。
他的核心观点是:原始 API 模型在策略选择、跨轮次上下文承接上明显更强,说明底层模型能力确实提升了;但对 Claude Code/Work 用户来说,表面上的大幅进步可能被 harness 放大了,因为很多能力原本就由外层系统完成。
他还提到,自己此前就预测今年 ARC v3 的主要进展会来自 harness 改进;而更通用的即时世界建模能力,最终也会像 reasoning 一样被训练进模型本体里。
「模型」频道最新
- 前端代码 Arena 榜单:Opus 5 Max 居首,Kimi K3 Max 紧随其后 — arena · 2026-07-28
- Kimi K3 Max 登顶 Arena 榜首,前端与 Agent 任务全面领先 — arena · 2026-07-28
- Kimi K3 上线 Hugging Face 推理 API,输出价格 15 美元/百万 tokens — mervenoyann · 2026-07-28
- OpenRouter 将 GPT-5.6 Terra 和 Luna 价格砍半 — OpenAIDevs · 2026-07-28
- Kimi K3 在 Together AI 上线,首日就给出数亿级 TPM 容量 — togethercompute · 2026-07-28
- Kimi K3 报告披露 microVM 沙箱系统,专为 Agent RL 设计 — stochasticchasm · 2026-07-28