xAI 发布后再改 Grok 4.6 模型卡,有害网络合规率从 16.7% 下调至 6.9%
Miles_Brundage · x · 2026-08-21
安全监督项目 TheMidasProj 披露,xAI 在 8 月 17 日悄悄修订了已发布的 Grok 4.6 模型卡。这是继 Grok 4.5 之后的又一次发布后修订,本次虽附带了 changelog,但清单不完整,且对修正内容未做任何解释。
被修正的四项评测中包括:HackerBench 有害/双用途网络请求合规率从 16.7% 降至 6.9%(原数值是 Grok 4.5 的两倍多);自残内容合规率从 3.7% 降至 0.84%,即便修正后仍差于 Grok 4.5 的 0.50%。多项安全评测结果朝有利于 Grok 4.6 的方向变动,但自残与 MASK 诚实度两项仍逊于上一代。
所属事件:xAI发布后再改Grok 4.6模型卡,下调合规数据(2 条相关)→
「模型」频道最新
- NVIDIA 公布 Qwen3.8-2.4T 模型部署方案:GB300 显卡吞吐超 4000 tokens/s — PyTorch · 2026-08-21
- 实战教程:通过继续预训练让本地 LLM 学习新领域 — funJS · 2026-08-21
- Qwen 3.8 27B两次对话就写出可玩3D游乐园,量化版也能打 — RandumbRedditor1000 · 2026-08-21
- 智谱 SAO 论文:单采样异步 RL 稳定训练千步,超越 GRPO — teortaxesTex · 2026-08-21
- Gemini 安全审查过严?连亲吻和公路拍照都拒 — Dry-Sympathy-3182 · 2026-08-21
- 0.63M 参数验证器媲美 7B 模型,AI 推理新极限 — jm_alexia · 2026-08-21