Fable 5.1 重写 LLM 腔文档,竟触发「普遍危害」安全护栏

StewartalsopIII · x · 2026-09-03

网友 mattparlmer 听说 Fable 5.1 写东西没那么「LLM 腔」,于是让它从文档语料里挑出五段听起来像 AI 生成的段落并改写得更像人写的。

结果刚一执行,模型立刻触发了「general harm(普遍危害)」安全护栏,直接拒绝任务。作者表示 lol/lmao——把「去 LLM 味」当作任务本身反而触发了护栏,堪称安全机制误伤的经典翻车现场。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →