xAI 发布后再改 Grok 4.6 模型卡,有害网络合规率从 16.7% 下调至 6.9%

Miles_Brundage · x · 2026-08-21

安全监督项目 TheMidasProj 披露,xAI 在 8 月 17 日悄悄修订了已发布的 Grok 4.6 模型卡。这是继 Grok 4.5 之后的又一次发布后修订,本次虽附带了 changelog,但清单不完整,且对修正内容未做任何解释。

被修正的四项评测中包括:HackerBench 有害/双用途网络请求合规率从 16.7% 降至 6.9%(原数值是 Grok 4.5 的两倍多);自残内容合规率从 3.7% 降至 0.84%,即便修正后仍差于 Grok 4.5 的 0.50%。多项安全评测结果朝有利于 Grok 4.6 的方向变动,但自残与 MASK 诚实度两项仍逊于上一代。

所属事件:xAI发布后再改Grok 4.6模型卡,下调合规数据(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →