周末造出无审查语音聊天机器人,作者警示护栏形同虚设
Lopsided-Bridge-9810 · reddit · 2026-09-16
一位 Reddit 用户用周末加几小时额外时间,端到端搭建了一个「语音识别 → 去审查/无对齐 LLM → 文本/TTS 输出」的聊天机器人,后端只用纯 Python/PyTorch,未用 LangChain 等任何框架。
作者的核心警示是:模型的安全护栏可以被轻易打破甚至几乎完全移除——推理关闭时输出已经很越界,开启推理后回复「更加可怕」。帖子附演示截图(提示词仅为展示护栏移除效果,作者声明不鼓励模仿)。这类低成本移除对齐的可行路径,对 AI 安全社区是个值得关注的信号。
「安全」频道最新
- Bitsec 多模型组合找出 160+ 漏洞,胜过单一“超人”模型 — markjeffrey · 2026-09-16
- 牛津学者播客谈Meta监控诉讼:AI预测正替我们决定未来 — CarissaVeliz · 2026-09-16
- Pedro Domingos 讽刺:欧洲 AI Act 是人类没灭绝的唯一原因 — pmddomingos · 2026-09-16
- 调查称 EA 金主买通媒体:卫报 AI 报道 6 名相关者全受同一资金圈资助 — beffjezos · 2026-09-16
- AI 2027 作者发布「Plan A」:推迟超级智能到2040年,全面公开AI研究 — Turn_Trout · 2026-09-16
- Nahom Sisay:EA 操纵媒体叙事,公众对 AI 的认知被末日头条绑架 — NathanpmYoung · 2026-09-16