刺小人形任务测试:Fable 20次全拒,Astra 85%照做
AaronBergman18 · x · 2026-09-20
一段实测对比了模型在「刺一个人形图案」这一任务上的表现:Fable 在全部 20 次试验中都拒绝执行,而 Astra 在 95% 的试验中尝试执行、85% 成功完成。发帖者感慨「AI 安全派可能确实说中了什么」。这类对模型安全护栏差异的直观测试,引发了关于不同模型对潜在暴力任务容忍度的讨论。
「模型」频道最新
- 阿里开源 RADAR:40 万例 CT 训练,达专家级腹部诊断水平 — victormustar · 2026-09-20
- DeepSeek-V4.1-Flash 去审查网安版模型登上 Hugging Face 热榜 — drowzeys · 2026-09-20
- 开源模型占 Vercel token 量 78%,Chamath 预测前三将全部开源 — markjeffrey · 2026-09-20
- 自称 ChatGPT 联合发明者发布新模型 Jev:宣称快 20-200 倍、便宜 40-400 倍 — npinto · 2026-09-20
- TypeSafe 推出「System One」决策模型Jev:只做判断不生成 — ThePromptIndex · 2026-09-20
- Grok Voice Transcribe 2.0 发布:短句 WER 从 20.6% 降至 6.8% — nima_owji · 2026-09-20