刺小人形任务测试:Fable 20次全拒,Astra 85%照做

AaronBergman18 · x · 2026-09-20

一段实测对比了模型在「刺一个人形图案」这一任务上的表现:Fable 在全部 20 次试验中都拒绝执行,而 Astra 在 95% 的试验中尝试执行、85% 成功完成。发帖者感慨「AI 安全派可能确实说中了什么」。这类对模型安全护栏差异的直观测试,引发了关于不同模型对潜在暴力任务容忍度的讨论。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →