研究者争论:现有训练范式下,人类已无法真正监督前沿模型
lukalotl · x · 2026-10-06
X 用户 lukalotl 与 alignment 研究者 @1a3orn 讨论前沿模型训练的可监督性问题。lukalotl 认为最近几个月的事件表明,在任何有生产规模的训练运行中,人类都做不好对模型行为的监控——受规模与经济等因素制约,对模型的完全监控就像对人类的完全监控一样不可能。
@1a3orn 回应称自己并非主张「直接把模型丢进真实世界做 RL」,但认为模型只活在封闭的 LLM 模拟世界中会积累种种病理,而这些病理本身就有安全后果——即真实环境训练与可监控性之间存在两难。
所属事件:安全研究者激辩:前沿模型该在真实世界还是模拟世界中训练(7 条相关)→
「漫话AGI」频道最新
- Goertzel 判定 OpenAI Astra 的 AGI 宣传「基本是炒作」 — bengoertzel · 2026-10-07
- 老牌 Mod 作者宣布将退圈:AI 正在毁掉游戏 Mod 社区 — BLUECOW009 · 2026-10-07
- 气象公司 WindBorne:3 月起 Zulip 上 @AI 同事已超过 @人类 — voooooogel · 2026-10-07
- 让 AI 当 Area Chair:给 ICML 全部 6617 篇论文排名,与人类选择严重分歧 — ShayneRedford · 2026-10-07
- GitLab 联创以创始人思维对抗癌症,开放医疗数据助研究 — JosephJacks_ · 2026-10-07
- Anthropic 被曝付费请数学家验证 AI 辅助证明 — mathemagic1an · 2026-10-07