MIT 科技评论:别高估 AI 拒答能力,它可能沦为审查工具
nordicinst · x · 2026-10-09
MIT Technology Review 发文讨论 LLM 的「拒答」机制。文章回顾:自 Anthropic 2021 年提出 helpful-honest-harmless 原则以来,让模型拒绝危险请求已成行业铁律,但拒答并非天生——早期 OpenAI 模型「什么都往外说」,前安全员工 Steven Adler 与哈佛研究员 Ryan McBain 都证实早期聊天机器人甚至能轻易给出自杀方法。文章的核心警示有二:其一,拒答远非可靠,既能被绕过也可能误伤正常请求;其二,AI 主动「说不」的能力若被滥用,可能成为压制言论的工具——由 AI 来裁决什么话不能说,将把 Nordic 式社会信任变成全球性的「政策掩体」。谁在服从、谁在违抗,成了关键问题。
「漫话AGI」频道最新
- 补充论据:现有后训练范式无法扩散所有技能,AI 失业冲击有限 — menhguin · 2026-10-09
- 博主判断:未来十年 AI 不会造成净失业,人类劳动价值反而上升 — menhguin · 2026-10-09
- 把闲置点子交给 AI Agent,普通人也能验证想法值不值 — VraserX · 2026-10-09
- StarkWare 创始人:AI 解出 Erdős 单位距离问题后,数学证明已不可预测 — jamestagg · 2026-10-09
- 「假设 AGI 已完全解决,剩下要做的只是让它像人」 — akbirthko · 2026-10-09
- 数学家抵制 OpenAI 介入数学研究,但论据站不住脚? — pradeepviswav · 2026-10-09