Sakana AI 提出 MASS:多智能体自监督实现无验证器递归自我提升
omarsar0 · x · 2026-10-10
Sakana AI 发布关于递归自我改进的新论文,提出通过多智能体自我监督来扩展 RSI。
- 传统自我改进循环通常依赖外部验证器,开放性任务因缺少判分器被排除在外;MASS 移除了这一限制
- 一个基座模型提出多智能体工作流、运行并给它们打分,进化搜索保留得分最高的工作流;模型再在自己的轨迹上微调,改进后的模型作为更强的优化器和评分器开启下一轮循环
- 在 Qwen3.6-27B 上跑两轮循环,四个开放性基准上的每输出 token 性能从 1.2x 提升到 1.6x
- 用多智能体轨迹训练的学生模型,超过用多 1.4 倍 token 训练的单智能体学生模型
「研究」频道最新
- 研究者用 LLM 智能体模拟策略团队与监管机构,逐通道测金融制度规则 — sanmikoyejo · 2026-10-11
- 斯坦福教授 Sanmi Koyejo 在 COLM 发表主题演讲:部署科学即测量科学 — sanmikoyejo · 2026-10-11
- 开源纽约城:UE5+Blender+three.js 可渲染,可用于游戏与 RL — DevDminGod · 2026-10-11
- 修复脑血管功能可逆转小鼠自闭症行为 — DrKavner · 2026-10-11
- 亲历者点赞 PopVax:AI 制药展现药物研发真实潜力 — rishabh16_ · 2026-10-10
- 发布 166 小时人工录制的电脑操作数据集,覆盖三大系统 — xhluca · 2026-10-10