自动 RL 扩散到生物实验室:Chess 与数学的剧本正被复制
hattusili-the-third · reddit · 2026-09-22
Reddit 长文论证「自动化强化学习应当让你感到害怕」,论证脉络:
- SL 与 RL 分工:SL 只让模型模仿数据集,多步推理差;RL 阶段用人类或自动评分器奖励输出,AI 谄媚正是全体用户偏好作为 RL 反馈的自然结果,而非公司手动选择
- 自动 RL 的威力:2017 年棋类突飞猛进靠的是可自动判定胜负的 RL,AlphaGo Zero 仅 24 小时自我对弈即超人类;近期 LLM 数学能力暴涨,关键是模型能把非形式证明转成 Lean 等机器可检验形式证明,使自动 RL 可行——「数学界的 AlphaGo」成立
- 正在扩散:据报道 Anthropic 正在建设自动化生物实验室让模型设计并运行实验,目的正是对生物学跑自动 RL,复刻棋类与数学的超人类路径
- 风险:新药新疗法之外,若各实验室(美国、中国及其他)都建这类设施并接近超人类表现,模型落入坏人之手后果不堪;作者呼吁现在就需要防护机制并推动政界与 CEO 行动
「漫话AGI」频道最新
- 用童书角色 Amelia Bedelia 理解 AI 对齐:她只是误解指令 — davidmanheim · 2026-09-22
- Toby Ord 解析群体智能扩展:万只 agent 解题耗资两千万美元 — tobyordoxford · 2026-09-22
- AI 安全学者澄清:「无限期暂停」不等于永久禁止 — DavidSKrueger · 2026-09-22
- Toby Ord:agent 集群实证显示智能爆炸参数 λ 约 0.5-0.6 — tobyordoxford · 2026-09-22
- Altman、Amodei、Musk 两周内口径一致,要求放缓前沿 AI — k1_r1 · 2026-09-22
- Narayanan 泼冷水:任务委派≠智能爆炸,Anthropic 图表被过度解读 — random_walker · 2026-09-22