第三方评测:Grok 4.6 拒绝危险生物查询且不误杀科研

ns123abc · x · 2026-09-02

SpaceXAI 引用 LatchBio 的独立评测报告,重点展示了 Grok 4.6 在生物安全领域的表现。在 BioSecBench-Refusal 基准测试中,Grok 4.6 是唯一在拒绝伪装红队任务和完成常规双重用途研究任务上均超过 50% 的模型。报告指出,其安全行为主要源于模型智能而非简单的输入分类器,且安全拦截未显著降低其在治疗、变异发现等常规生物任务中的性能。

所属事件:独立评测称 Grok 4.6 生物安全防护不损性能(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →