MetaRSI 技术报告:让自我改进作用于 RSI 自身,旗舰模型平均提升 7.3 分
青稞AI · wechat · 2026-09-13
CosmosMind 联合斯坦福、伯克利、MIT、清华等高校发布 MetaRSI-v1 技术报告,提出首个统一 Model-RSI、Data-RSI、Harness-RSI 的元递归自我改进架构,把「改进」本身也变成可递归优化的对象。
核心内容
- LoopKernel 范式:将「进步如何发生」抽象为统一闭环——学习信号在 Data、Harness、Model 三个可写面上提出改动,由验证器裁决并回流,三者成为同一 Kernel 的不同实例化算子。
- 三种算子:Data-RSI 从运行轨迹提取并放大学习信号、标定能力边界;Harness-RSI 在 SystemPrompt/Skill/MCP/Tools/Memory 五个槽位上做加法与减法;Model-RSI 将验证有效的能力内化进参数。
- 纵横双轴编排:横轴由 RSI²Agent 决定算子顺序,纵轴由 Sub-Agent 改写算子内部策略,元层 MetaRSI²Agent 再优化编排策略本身,形成三层嵌套。
实验结果
- 小模型路线:Qwen3.5-35B-A3B(3B 激活)在 Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond、AIME 四项基准平均提升 10.9 分,SWE-bench Pro 解决率接近翻倍。
- 前沿模型路线:GPT-5.6、Claude Opus 5 等六款旗舰模型(仅启用 Data/Harness 算子、无外部教师)平均提升 7.3 分。
五条定律包括:验证器决定自改进前沿;自我认知会过期、重探能力边界是速率瓶颈;能力与载体无关但成本有关(应持续内化到更便宜载体);可信度须由不可写面度量(内部无法察觉放宽标准);循环不凭空创造能力、增益需区分「激发已有」与「外部新引入」。
团队同步开源了 RSI-Harness 与 Genome 开放社区,主张各科学领域只需任务族、验证器与初始脚手架三样东西即可接入循环。
所属事件:CosmosMind 联合多校发布 MetaRSI-v1 统一递归自我改进框架(2 条相关)→
「编程与Agent」频道最新
- 从 TypeScript 迁到 Rust 一把梭, Rewrite It In Rust 梗图再度应验 — DanielLockyer · 2026-09-14
- 让 Astra 做一款「每圈多一个自己」的追逐竞速游戏 — LexicalLegend · 2026-09-14
- ChainForge 半年打磨 evalstats,给 LLM 评测可视化节点加上统计可信度 — IanArawjo · 2026-09-14
- Rust 加持的 LangGraph 多宇宙检查器 RiftPoint 开源 — goldenphoenix713 · 2026-09-14
- Claude 写完代码主动请求 commit 还要署名合著者 — shauseth · 2026-09-14
- Google 实验:Graph RAG 把 Java 转 Python 的 API 幻觉率从 56% 降到 16% — _reachsumit · 2026-09-14