Grok 4.6 模型卡解析:内部基准大幅提升,公开编程评测仍落后

scaling01 · x · 2026-08-13

xAI 最近发布了 Grok 4.6 的模型卡,详细展示了其在编码、工程和知识工作等方向的能力评估,并探讨了部署前的安全测试。

根据分析,该模型在 DeepSearchQA 和内部 KernelBench 等基准上取得了巨大进步,并在衡量推理优化的 inferenceEval 中达到 SOTA。然而,在 Terminal Bench 3.0、SWE Marathon v1.1 等公开的软件工程评测中,Grok 4.6 依然落后于前沿水平。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →