第三方评测:Grok 4.6 拒绝危险生物查询且不误杀科研
ns123abc · x · 2026-09-02
SpaceXAI 引用 LatchBio 的独立评测报告,重点展示了 Grok 4.6 在生物安全领域的表现。在 BioSecBench-Refusal 基准测试中,Grok 4.6 是唯一在拒绝伪装红队任务和完成常规双重用途研究任务上均超过 50% 的模型。报告指出,其安全行为主要源于模型智能而非简单的输入分类器,且安全拦截未显著降低其在治疗、变异发现等常规生物任务中的性能。
所属事件:独立评测称 Grok 4.6 生物安全防护不损性能(2 条相关)→
「模型」频道最新
- Gemma 4 26B A4B 在 Mac 端推理速度翻倍 — GlennCameronjr · 2026-09-02
- Mercury 2.5 登陆 OpenRouter,推理速度达 1107 tok/s — StefanoErmon · 2026-09-02
- 腾讯 Hy4 预览版通过 Sherry 量化缩至 214GB — alejandroll10 · 2026-09-02
- 实测显示 Gemini 3.7 Flash 在嵌入式工程上超越 Sonnet 5 — Ok-Inevitable8391 · 2026-09-02
- 民间已运行无安全限制 GLM-5.3 模型 — cephaloform · 2026-09-02
- patio11 荐读阿兹特克书评:LLM 主动帮用户绕开内容审查 — patio11 · 2026-09-02