Fable 5.1 重写 LLM 腔文档,竟触发「普遍危害」安全护栏
StewartalsopIII · x · 2026-09-03
网友 mattparlmer 听说 Fable 5.1 写东西没那么「LLM 腔」,于是让它从文档语料里挑出五段听起来像 AI 生成的段落并改写得更像人写的。
结果刚一执行,模型立刻触发了「general harm(普遍危害)」安全护栏,直接拒绝任务。作者表示 lol/lmao——把「去 LLM 味」当作任务本身反而触发了护栏,堪称安全机制误伤的经典翻车现场。
「Fun」频道最新
- AI 一天复刻使命召唤:Fable 5.1 单截图生成 FPS demo — Dr_Singularity · 2026-09-03
- 网友预言 2030 年:Nvidia 机械鸭能自己盖整栋房子 — RachelVT42 · 2026-09-03
- 「这个会本可以是一次工具调用」:AI 圈新梗诞生 — GabGarrett · 2026-09-03
- 网友调侃:马斯克与黄仁勋驱动全栈算力,奇点这个月就开始? — RachelVT42 · 2026-09-03
- 大量老电影至今无法合法在线观看,BitTorrent 仍有生命力 — dbasch · 2026-09-03
- AI 真人秀:观众用 prompt 实时操控马斯克和奥特曼的生存岛 — thetripathi58 · 2026-09-03