开源项目 Raven 把 RSI 做成工程:AI 自己进化 harness,训练误差降 5.8%
aigclink · x · 2026-09-30
开源项目 Raven 把「AI 自己改进自己」(RSI)从论文概念变成可跑的工程,思路是让 AI 进化 harness 而非模型权重。
它是什么
- Raven 本身不干活,是“包工头”:负责拆解任务、派活、验收,自带调研、写代码、设计、无人值守四类 Agent。
- 可调度 Claude Code、Codex、Kimi Code 等 13 家现成 Agent,作者称之为 "harness of harnesses"。
- 进化对象是 harness 的做事方法(规划、工具调用、记忆、动手前检查),流程四步:诊断失败 → 提出改法 → 基准验证 → 只保留变好的改动。
- 关键设计:评分标准 AI 自己改不了,避免 RSI 最大的坑——“给自己打高分、改考卷”。
实测结果
- nanochat 预训练实验:7 轮跑 172 次训练零崩溃,同样单卡 20 分钟预算,valbpb 降 5.8%——AI 自己把训 AI 的方法调得更好。
- 溃坝流体仿真:误差压低三个数量级。
- 连续约 4 天、42 轮,独立完成一个 FPS 游戏及海报、PPT、官网。
三点影响判断
- AI 圈:能力提升杠杆从模型转移到 harness,harness 工程成独立手艺;评测成核心资产,谁定义评测谁掌握进化方向。
- 应用圈:提示词/工作流壁垒会被 AI 自己优化掉,壁垒转向行业验收标准、长期记忆、真实数据反馈;开发者从“写流程”变“写验收标准”。
- 商业:底层模型/Agent 沦为可替换的“分包商”,价值向入口调度与结果交付两端集中,收费从按席位/token 走向按结果付费。
作者也提醒:目前改的是 harness 不是权重,离“AI 造出更强 AI”尚有距离。
所属事件:开源项目 Raven 将 AI 自我改进 RSI 变为可运行工程(2 条相关)→
「编程与Agent」频道最新
- Bittensor SN107 推出第二激励机制:AI 智能体跑基因研究任务 — markjeffrey · 2026-09-30
- 保留失败的 agent 任务:每次新模型发布重跑,抓住质变时刻 — victor_explore · 2026-09-30
- Agent 演示都很惊艳,一遇到例外就露馅 — yi111 · 2026-09-30
- 程序员自述:AI 辅助开发中每轮重构都会让旧问题迁移到新代码 — ssh4net · 2026-09-30
- 用户实测 Opus 5.5:速度快但常无视技术规格自行改写代码 — ssh4net · 2026-09-30
- Agent 上生产的两大痛点:错误连锁反应与 token 成本延迟 — datawithsuman · 2026-09-30