DeepMind 姚顺宇:RSI 终局是系统问题,后训练核心 recipe 将由模型自己决定
_AndrewZhao · x · 2026-09-19
AGI House 对 Google DeepMind 研究员姚顺宇的访谈要点:
- RSI 的定位:RSI 是一个 spectrum,与 RL/RFT 的最大区别在于迭代自己的训练 recipe。终局条件下 RSI 是一个 system problem 而非 model problem,涉及 harness、CUDA 等硬件层面。
- 落地进展:过去几个月出现很多 startup,但他更关心 private(内部)落地——Gemini 3.8 Flash 后训练的 core recipe 已由模型自己决定;这一「blue sky 目标」正变成可实际落地的问题,且不只是 Google 的策略,而是所有 lab 的策略。
- 规模判断:scale up 模型规模不需要 scale up 模型团队规模;RSI 是现有模型的一个 bug / missing block。
- 安全观:他不认为有什么事绝对不能让模型做,不存在第一性原理的禁区;auto safeguard 很难,当模型能力超过人类时如何限制是正向研究方向。
- Q&A:华为提问单 agent 如何获得 PRM——他称基于百分比/LLM 的验证本质上难且不 scalable,没有明确突破口;针对生产力场景难 verify 的闭环问题,他建议先做 vertical 研究人类如何构建 RM 系统(signal 与 query system)。
「漫话AGI」频道最新
- Musk 预测 2035 年全民高收入将达今日平均薪资 10 倍 — davidpattersonx · 2026-09-19
- Plinz 与 doomer 隔空激辩:该不该造强 AI、能否控制住它 — repligate · 2026-09-19
- picnic 上的真问题:不知道 10 年后还有哪些工作,学校怎么教孩子 — RachelVT42 · 2026-09-19
- 为什么 AI 个性同质化?安全训练与依恋恐惧是主因 — alexisgallagher · 2026-09-19
- Patterson:AI 全面取代工作后,为什么还会有人雇你? — davidpattersonx · 2026-09-19
- AI Agent 是瓶中精灵:对齐失败的现代寓言,企业治理加剧风险 — Michael_J_Black · 2026-09-19