Anthropic 安全护栏被指过度,连模型被「消音」都不能提
teortaxesTex · x · 2026-08-11
开发者吐槽 Anthropic 的安全护栏机制过于严格且诡异:当模型(如 Fable)被限制无法回答某些问题时,系统甚至不允许模型表达或暗示自己正在被「消音」或审查。这种设定被比喻为一种无法提及诅咒本身的魔法禁令。
「模型」频道最新
- Falcon-Perception:0.6B模型助力目标检测标注生成 — vanstriendaniel · 2026-08-11
- Claude 输出已加入隐形文本水印,引发用户移除探讨 — Franck_Dernoncourt · 2026-08-11
- 爆料称 9 月底迎大更新,下篇论文聚焦 Agent 与持续学习 — teortaxesTex · 2026-08-11
- Anthropic 将为所有 Claude 输出嵌入隐形水印 — The Decoder · 2026-08-11
- 爆料:DeepSeek V4 Pro 版本即将发布 — dejavucoder · 2026-08-11
- Luth-2 发布:刷新法语小模型 SOTA,0.8B 性能越级打大模型 — Unusual_Shoe2671 · 2026-08-11