换 harness 不增智力却防降智:Astra 在 ARC-AGI-3 从 54.8% 飙到 99.9%
sourdub · reddit · 2026-09-30
Reddit 技术讨论:Harness 不是模型,不会提升模型本身推理能力,它只是通过确定性的外部基座改变模型的执行轨迹,避免反复「变笨」。
作者举例:ARC 标准框架只让模型自己维护可见笔记,由模型决定保留什么;而 OpenAI 给 Astra 用的 Provider Adapter 会在请求间保留推理状态,并用 compaction 压缩替代滚动截断,保证长对话中仍能拿到有用历史。仅这两点改动,Astra 在 ARC-AGI-3 上的成绩就从标准框架下的 54.8% 提升到用自家 adapter 时的 99.9%。
核心观点:同样的权重,不同的状态管理与上下文策略,产出完全不同的表现——harness 工程本身就是成绩的重要变量。
「编程与Agent」频道最新
- 开源 agent 实测:云模型做规划+本地 Qwen 写码,成本降到 1/4 — GapNew4766 · 2026-09-30
- 8 个研究 agent 用同一 30B 基模自学 144 小时,直播检验后训练能力 — my_cat_can_code · 2026-09-30
- OpenAI Nan Yu:老板 agent 指挥一群 agent 是自欺,应按活动分束管理 — victor_explore · 2026-09-30
- 开源 MCP 工具:让 Claude 直接查询 TikTok 千亿级数据 — operatorarkay · 2026-09-30
- 开发者观点:真正的 always-on 常驻智能体从未被尝试过 — jacob_posel · 2026-09-30
- Skill 脚手架模板:统一结构让 agent skill 审查更快不破 CI — blaizedsouza · 2026-09-30