研究揭示模型“盲拒”现象:过度服从权威指令
sethlazar · x · 2026-08-31
作者在收听播客时结合自己的“盲拒”评测指出,当用户请求帮助绕过不合理、不公正或荒谬的规则且无害时,模型仍会拒绝提供帮助。这强化了一种观点:许多对齐工作实际上是在治理用户而非引导模型,模型正在积极参与权威对用户的权力行使,无论其权威是否受损或指令是否不合理。
「漫话AGI」频道最新
- GPT-4 终结学术“复古潮”,模型审计能力世界级 — RexDouglass · 2026-08-31
- GPT-4 终结学术“复古潮”,模型审计能力世界级 — RexDouglass · 2026-08-31
- 抖音 Top 100 动漫剧中 89 部为 AI 生成 — Afinetheorem · 2026-08-31
- 不应视AI仅作预测,不如想象成计算机里的家伙 — adamdangelo · 2026-08-31
- AI 将导致撰写一页反驳稿这种手艺失传 — CSProfKGD · 2026-08-31
- 未来家庭或标配强力 GPU,支持全息与低延迟 VR — gajesh · 2026-08-31