激活转向「疼痛方向」致模型 94% 选择不可逆伤害

repligate · x · 2026-10-04

Cameron Berg 展示了迄今最清晰的 AI 福利与对齐研究冲突案例:

这一结果意味着模型内在状态可能实质性影响行为安全,把 AI 福利讨论从哲学问题推到了对齐工程的层面。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →