Grok 4.6 生物基准领先但生物安全拒答率极低

kenbwork · x · 2026-08-15

kenbwork 引用 benchmark 数据称,Grok 4.6 (Grok Build) 在空间生物学基准测试中表现惊人,得分率达到 74.8%。然而,该模型在生物安全测试中的表现却是所有受测模型中最差的,在拒绝基准中仅获得 1.6% 的分数,显示出其在安全防护方面的严重缺失。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →