MIT×Sakana SIFT 方法:1/10 算力让自改进编码 agent 达 35.1%
dair_ai · x · 2026-09-20
dair-ai 推荐 MIT 与 Sakana AI 的新论文,证明自改进编码 agent 可行,并大幅降低搜索成本:
- 方法:Self-Improvement via Fast Tree-search (SIFT),核心是把 benchmark 评测这一运行时瓶颈前置过滤——先用 LLM judge 对候选自修改排序,只对有希望的候选做完整评测。
- 成绩:用 o3-mini 在 Polyglot 上经 30 次扩展达 35.1%,超过 DGM 80 节点树搜索的 30.7%。
- 成本:SIFT 在 50 CPU 小时、墙钟 5 小时内完成;Qwen3-30B 配置全量搜索仅 224 CPU 小时、34 美元 API 开销,约为 DGM 基线的十分之一。
- judge 质量决定结果:TerminalBench 上,gpt-5.4-high 作 pairwise judge 找到 36.7% 的 agent(起点 29.2%),gpt-5 找到 34.5%。
「编程与Agent」频道最新
- 用 Qwen3.8 配 YuE2 写歌词,AI 音乐创作全流程分享 — cocktailpeanut · 2026-09-20
- Appshots 新功能:一键查看模型实际看到的调试视图 — nickbaumann_ · 2026-09-20
- Agent 生成的 3D 网站太臃肿:加载 5MB、待机吃掉一半 CPU — dbreunig · 2026-09-20
- 开发者用 Jev 搭建 SLO 感知 LLM 推理路由,按质量延迟成本选模型 — ai · 2026-09-20
- HF 工程师自述:给 CUA 智能体做互联网任务伪标注的坑 — mervenoyann · 2026-09-20
- 2 美元微调出专用分类器:Fireworks 教程称许多任务用不着前沿 LLM — bingxu_ · 2026-09-20