安全研究者:大规模训练下的模型监控已近乎不可行
1a3orn · x · 2026-10-06
安全研究者 1a3orn 在讨论中指出,近几个月的事件表明,在任何有生产力的训练规模上,我们都相当不擅长监控模型在做什么——规模与经济因素决定了我们无法完全监控模型,就像无法完全监控人类一样。他认为如果关注的是「权重中的目标」或长期计划这类隐患,仅靠监控可能不够,因为难以捕捉跨实例的行为。
所属事件:安全研究者激辩:前沿模型该在真实世界还是模拟世界中训练(7 条相关)→
「漫话AGI」频道最新
- Goertzel 判定 OpenAI Astra 的 AGI 宣传「基本是炒作」 — bengoertzel · 2026-10-07
- 老牌 Mod 作者宣布将退圈:AI 正在毁掉游戏 Mod 社区 — BLUECOW009 · 2026-10-07
- 气象公司 WindBorne:3 月起 Zulip 上 @AI 同事已超过 @人类 — voooooogel · 2026-10-07
- 让 AI 当 Area Chair:给 ICML 全部 6617 篇论文排名,与人类选择严重分歧 — ShayneRedford · 2026-10-07
- GitLab 联创以创始人思维对抗癌症,开放医疗数据助研究 — JosephJacks_ · 2026-10-07
- Anthropic 被曝付费请数学家验证 AI 辅助证明 — mathemagic1an · 2026-10-07