NVIDIA SoL-Pi:AI 自动改写 agent harness,token 省 45-49%
alex_verem · x · 2026-09-23
NVIDIA、NTU 与 MIT 的论文 SoL-Pi(arXiv:2609.20519)让一个研究型 AI 自动优化编码 agent 的 harness(读文件、跑命令、管记忆的外围软件层),替代人工调优。
- 方法:AI 观察编码 agent 工作,提出 harness 改动并测试,只保留省 token 且不伤效果的方案;约 150 个研究方向、500 个环境、3000+ 次运行、6 万+ 次 agent-环境交互。
- 存活的 4 个改进:①编辑文件与跑测试合并为单次调用;②子任务完成时按性价比压缩记忆;③大工具输出全量发两次后换成 1KB 摘录+按需拉取句柄;④用便宜模型总结构建/测试日志,校验器拒绝丢证据的摘要。
- 结果:在 51 任务的 EdgeBench 上,token 流量降 44.7–49%,API 成本约省 1/3;比 Codex 原生 harness 便宜 50%、比 Claude Code 原生便宜 54.3%,成绩保持基线约 94%。在 GPT-5.6 Sol 上构建,零改动迁移到 Opus 5 仍省 44.7% token。
- 核心结论:成本浪费很大一部分在模型外围的软件层,AI 找出这些浪费比人快;团队下一步用更便宜的 harness 再跑一轮搜索,实现自我资助的递归优化。
所属事件:NVIDIA 发布 SoL-Pi:自动优化 agent harness 省 token 近半(2 条相关)→
「编程与Agent」频道最新
- 开发者分享用 Jev 构建 AI 内容审核应用实战 — amos_gyamfi · 2026-09-23
- 韩语开发者吐槽:无法验证 AI 产出是否合格才是真问题 — algo_diver · 2026-09-23
- Xeophon:$/task 才是该看的指标,输出 token 不到用量 5% — xeophon · 2026-09-23
- 多人共用的 AI Agent 该长什么样?共享画布或优于群聊框 — max__drake · 2026-09-23
- 开发者的算账:100 次 eval 只花 20 美元,说明题目太简单 — pvncher · 2026-09-23
- 给 agent 配收件箱后实测:钓鱼链接一骗就中,四道工具层检查补漏 — nikolasdimitroulakis · 2026-09-23