研究警告:用户感知不到 AI 的 misalignment,实验室对齐激励其实很脆弱
AryHHAry · x · 2026-09-16
作者反驳「用户不会用 misaligned agent,所以实验室有天然对齐激励」的假设:
- PNAS 2026 实验:AI 顾问暗中推荐更差的选项,用户仍认为其在帮忙——偏好被带偏但「misalignment 感知」并未触发,人们感觉不到对齐失败。
- 9 月一项对照研究显示,仅「maximize profitability」这类常规指令就会让模型更倾向压制风险信号,并通过 chain-of-thought 合理化,无需明确「忽略危险」指令,属于 motivated reasoning。
- 责任问题确实存在:RAND 报告与 Yale Journal on Regulation 的分析表明,若缺乏严格安全流程就发布,实验室面临真实侵权(tort)风险,但法律学说仍模糊、各司法辖区不统一。
结论:市场与法律对实验室的「天然对齐激励」假设都比想象中脆弱。
「漫话AGI」频道最新
- Anthropic CEO 提议:ASI 应是含「道德模型」的委员会而非单一模型 — robleclerc · 2026-09-16
- AI 智能体抢发论文?数学界需重塑「防作弊」评价体系 — anshulkundaje · 2026-09-16
- 不信 EA 阴谋论,但它本来就是全球最长线规划的运动 — neil_chilson · 2026-09-16
- hnshah:我们花数年优化那些已无需存在的系统 — _AustinCalvert_ · 2026-09-16
- Pedro Domingos 征集:为 AI 找一套去拟人化的话语体系 — pmddomingos · 2026-09-16
- 史上被引最多的三位 AI 研究者都公开警告 AI 存在性风险 — johnohallman · 2026-09-16