Opus 5 把 Qwen 基座 SWE-bench 成绩提升近三倍,RSIGym 开源
rohanpaul_ai · x · 2026-10-09
EvolventAI 发布开源环境 RSIGym,让 AI 研究智能体在统一预算内重训模型并改写评测 harness,验证「全自动 AI 研究员」的可行性。
关键内容:
- 架构采用 Everything as a Service:智能体在纯 CPU 容器中工作,远程调用 LoRA 微调、模型服务、基准测试和沙箱服务,所有开销计入单次运行预算。
- 主实验中,6 个前沿智能体从 Qwen3.5-35B-A3B-Base 和极简 harness 出发,每个基准预算 $500 服务费;Claude Opus 5 使 Qwen 的 SWE-bench Verified 成绩提升近三倍,并在 RSI-Index 上以 0.4809 领先。
- 引入 RSI-Index,衡量前沿智能体同时改进目标模型权重与 harness 的综合能力,覆盖 6 个智能体与 5 个基准。
- 实践启示:改进智能体时应先读失败日志、优先修 harness——在 10 个小规模测试中有 8 个,更重的训练反而得分更低。
- 作者观点:RSI(递归自我改进)本质是系统工程问题而非纯模型问题,进展取决于研究智能体所处的环境设计。
所属事件:Evolvent AI 开源 RSIGym,让 AI 研究智能体自我改进(5 条相关)→
「编程与Agent」频道最新
- LLM-as-a-Verifier 开源:弱模型验证强模型,Terminal-Bench 达 69.2% SOTA — Azaliamirh · 2026-10-09
- Salesforce 提出 SRD 蒸馏后见之明,2B 模型成功率从 0 到 60.6% — Salesforce · 2026-10-09
- 实测 AI Agent 网站准入难:16 个 subreddit 已封 7 个 — lulzxdxdxd · 2026-10-09
- Prompt tuning 被集体遗忘,微调 token 或被严重低估 — cephaloform · 2026-10-09
- 架构师分享:用 WhatsApp 语音搭建个人 AI 管家 — No_Kangaroo_4454 · 2026-10-09
- AI 工作台密集上新:多人协作、交互仪表盘、记忆与技能 — heyneighbor · 2026-10-09