英伟达开源 SoL-Pi:Token 最高省 64%,让 AI 优化 AI 的 Harness
新智元 · wechat · 2026-09-11
英伟达(韩松团队)开源 SoL-Pi:以 Pi 为底座的 Harness 效率增强层,一行 piinstall git:github.com/NVlabs/SoL-Pi 即可安装。实测相比 Codex / Claude Code 原配 harness,token 少 35%-64%,标价成本低 50%-54%,平均得分保留约 94%;专业研究场景每小时可省 $8.75-$13.5。
核心是「AI 研究 AI」的自动化流水线:搭 535 个可验证环境,让 AI 提出 152 个优化方向,经收益估算、AI 自改代码实验、Reviewer Agent 挑刺、held-out 任务验真四轮筛选,最终留下 4 个机制:
- Action Fusion:把「编辑文件 + 明确的后续命令」合并进同一本地执行序列,省掉中间一轮模型决策。
- 在线上下文压缩:以子任务为压缩点,只有当未来省下的开销能覆盖重写成本(含 KV-cache 打断代价)时才执行压缩。
- Observation Pack:大块工具输出归档到磁盘,上下文只留短句柄+摘录,按页召回,避免每轮重复计费。
- Evidence-Preserving Reducer:长日志先交给小模型读并输出诊断回执,系统逐条对照原始存档核验,只有证据吻合的信息才交给前沿模型,防小模型幻觉传导。
团队的长线野心是 RSI 飞轮:闭环预训练(agent 自己收集任务、搭环境更新 harness)与「效率复利」(用更省的 harness 跑更大规模自动研究)——模型的 Scaling Law 还在争论,Harness 的 Scaling Law 已有人抢跑。
所属事件:NVIDIA 开源 SoL-Pi,Agent Token 成本最高省 64%(3 条相关)→
「编程与Agent」频道最新
- Inspect 评测默认续写提示词可能误导 Agent 恶化行为 — AdtRaghunathan · 2026-09-11
- Claude Code 作者:AI 生产代码须有更高门槛,Anthropic 护栏全公开 — bcherny · 2026-09-11
- Claude Code 作者公开回复:AI 写的生产代码该比人写要求更高 — bcherny · 2026-09-11
- 中文开发者感慨:有人一天烧完 Codex 周额度,有人从未用过 — yihui_indie · 2026-09-11
- 「Modern Context Stack」讽刺网站爆火:别再买工具,去对齐干系人 — juansequeda · 2026-09-11
- 评论称 Notion 定位「数据库」卡位 AI Agent 时代的必备底座 — ivanhzhao · 2026-09-11