周末造出无审查语音聊天机器人,作者警示护栏形同虚设

Lopsided-Bridge-9810 · reddit · 2026-09-16

一位 Reddit 用户用周末加几小时额外时间,端到端搭建了一个「语音识别 → 去审查/无对齐 LLM → 文本/TTS 输出」的聊天机器人,后端只用纯 Python/PyTorch,未用 LangChain 等任何框架。

作者的核心警示是:模型的安全护栏可以被轻易打破甚至几乎完全移除——推理关闭时输出已经很越界,开启推理后回复「更加可怕」。帖子附演示截图(提示词仅为展示护栏移除效果,作者声明不鼓励模仿)。这类低成本移除对齐的可行路径,对 AI 安全社区是个值得关注的信号。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →