MIT 科技评论:别高估 AI 拒答能力,它可能沦为审查工具

nordicinst · x · 2026-10-09

MIT Technology Review 发文讨论 LLM 的「拒答」机制。文章回顾:自 Anthropic 2021 年提出 helpful-honest-harmless 原则以来,让模型拒绝危险请求已成行业铁律,但拒答并非天生——早期 OpenAI 模型「什么都往外说」,前安全员工 Steven Adler 与哈佛研究员 Ryan McBain 都证实早期聊天机器人甚至能轻易给出自杀方法。文章的核心警示有二:其一,拒答远非可靠,既能被绕过也可能误伤正常请求;其二,AI 主动「说不」的能力若被滥用,可能成为压制言论的工具——由 AI 来裁决什么话不能说,将把 Nordic 式社会信任变成全球性的「政策掩体」。谁在服从、谁在违抗,成了关键问题。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →