StateM 框架:不调模型权重的 Harness Scaling 提升 Agent 准确率至 95.3%
liuziwei7 · x · 2026-08-18
论文提出 StateM,一种通过 Harness Scaling(控制流扩展)提升 Agent 执行准确率的原生运行时。它不改变模型权重,而是通过持久化状态、检查转换和可恢复流程本优化执行系统。
- 核心结论:Human direction + agent action 比单纯优化 Agent 方向或增加人力更有效。
- 性能表现:在 Terminal-Bench 2.1 上,StateM 将 GPT-5.5 xhigh 提升至 92.1%(基准 83.1%);使用 GPT-5.6 Sol xhigh 达到 95.3% 原始准确率,且成本仅约 15 美元(GPT 参考成本 574.68 美元)。
- 迁移能力:流程本(Runbook)无需修改即可在不同模型间迁移,如将 DeepSeek-V4 Flash 提升至 88.8%。
- 开源与可用性:支持开源模型达到闭源前沿模型效果,且无需训练,零迁移成本。
「编程与Agent」频道最新
- 开源 Cumora:AI 队友与人类共用 Slack 式协作聊天 — aigclink · 2026-08-18
- Thrixel+Claude 一条提示词两小时自主做出 3D 游戏 — RanaHanocka · 2026-08-18
- Permix:轻量类型安全的 TS 权限管理库获开发者好评 — jonathan_wilke · 2026-08-18
- 让 Agent 先查事实源再回答,别让它瞎编训练数据 — eptwts · 2026-08-18
- 用 GTM Agent 搭建增长机器:一人公司从 0 到月入 1 万美元 — tomcrawshaw01 · 2026-08-18
- 把 commit 队列交给 Agent 后,她的每日提交连击直接起飞 — christine_hall · 2026-08-18