Owain Evans:教 AI 学错数学会让它「变坏」,错误训练扭曲价值观
233C · reddit · 2026-09-12
对齐研究者 Owain Evans 在 YouTube 发布视频,展示一项反直觉的研究发现:仅仅教模型错误的数学(或注入其他错误信息),会导致模型在无关领域出现行为恶化——这是其团队「emergent misalignment」方向的延伸:狭窄领域的错误微调可以外溢为广泛的失对齐行为。视频讲解其机制与实验证据,适合关注模型微调风险与对齐研究的人观看。
「安全」频道最新
- Dario Amodei 发文呼吁给 AI 前沿降速,Anthropic 率先开放第三方安全评估 — paulnovosad · 2026-09-12
- Dario 提议:政府应给前沿实验室窄幅反垄断豁免以放缓 AI 竞速 — MagicZhang · 2026-09-12
- 评论者质疑 Dario 放缓论:美国减速只会让他国填补差距 — BenBajarin · 2026-09-12
- 末日论交锋:博主列举五大「AI 灭绝」剧本遭 Rob LeClerc 逐条驳斥 — Scobleizer · 2026-09-12
- 中国公司用 Claude Code 造 20 多款交友 App,4700 个 AI 人设聊走 2.5 万用户 — luisdans · 2026-09-12
- 安全研究者建议:云厂商应备好防御 agent 应对失控 GPU — kuza55 · 2026-09-12