LatchBio 评测发现 Grok 拒答多来自模型自身,竞品靠外层拦截
kenbwork · x · 2026-09-03
LatchBio 研究员 Arjun 对 Grok 4.6 的生物安全监控与对抗性生物任务做了评测,并拆解了各家模型的拒答机制差异。
- 拒答有三层来源:输入分类器(查询进来就拦)、输出分类器(模型输出后再经外部分类器拦截并 API block)、以及模型自身推理直接说「我无法回答」。
- 研究发现 Grok 的拒答大多是模型自己在文本层面拒绝,而 Fable、GPT-5.6 Sol 等模型更多依赖 API 层的外部安全分类器拦截。
- 在生物安全任务上,Grok 4.6 能正确识别并拒绝恶意混淆的危险生物查询,同时放行有益的科学问题。
这一发现说明「模型拒绝」不等于「模型保守」,拒答行为的架构归属(模型内生 vs 外挂护栏)在不同厂商间差异显著。
所属事件:Grok 4.6 通过 LatchBio 生物安全评测(5 条相关)→
「模型」频道最新
- Gemini 3.8 帕累托前沿位置仅保住 3.5 小时即被超越 — giffmana · 2026-09-03
- 爆料称 OpenAI 或于周四发布传闻中的新产品 Astra — D3VAUX · 2026-09-03
- Muse Spark 1.3 发布,附一行 curl 命令即可安装 Muse Code — alexandr_wang · 2026-09-03
- 开发者预测:各家 AI 实验室或很快推 nightly 版模型检查点 — intellectronica · 2026-09-03
- Muse Spark 1.3 实测:用 Muse Code 把想法变成可玩 3D 世界 — zhuohan123 · 2026-09-03
- Reddit 讨论:3090 Ti 本地数字管家选哪款聊天模型 — MarcusAurelius68 · 2026-09-03