Weco 让 AI agent 自我改写 8 天:递归自我改进的首个证据?
Machine Learning Street Talk · youtube · 2026-09-27
Machine Learning Street Talk 邀请 Weco 联合创始人郑姚江(Tim Scarfe 主持),讨论 AIDE² 实验:让 AI 编码 agent 连续 8 天重写另一个 agent 的 harness(代码、prompt 与工具),底层语言模型保持不变,据称成绩超过人类工程师两年的优化。
核心讨论点:
- AIDE 85 生成的代码分析:哪些是「有用的意大利面条代码」,held-out 评测如何设计
- Weco 提出的递归自我改进四个层级,以及与 AlphaEvolve、Darwin Gödel Machine 的对比
- Reward hacking 的难点:如何区分真实发现与钻奖励函数空子
- 明确的局限:该实验并未证明系统变成了「更好的改进者」
- 收尾话题:开放式搜索、人类设计的原语空间、Parameter Golf——当 agent 只能在人类设计的空间内搜索,下一个好点子从哪来
这是一场关于「递归自我改进是否已经开始」的严肃技术对话,立场克制、信息密度高。
「编程与Agent」频道最新
- omarsar0 实测 agent 路由:公开 benchmark 数字说明不了太多 — omarsar0 · 2026-09-27
- 用 Opus 5.5 加 Meta Ads MCP 搭广告代理:47 分钟出完整投放方案 — PrajwalTomar_ · 2026-09-27
- Agent 聊天视图设计讨论:时间线应严格按事件发生顺序呈现 — zeeg · 2026-09-27
- 微软发布 ProgramDistill:网页应用蒸馏为可验证 SWE 训练任务 — _akhaliq · 2026-09-27
- 实测开源模型「决策打分」:比生成概率快 7 至 54 倍 — vykthur · 2026-09-27
- 部署 AI Agent 别贪多:先跑通一个工作流再逐个扩展 — DavidLinthicum · 2026-09-27