Grok 4.6 模型卡解析:内部基准大幅提升,公开编程评测仍落后
scaling01 · x · 2026-08-13
xAI 最近发布了 Grok 4.6 的模型卡,详细展示了其在编码、工程和知识工作等方向的能力评估,并探讨了部署前的安全测试。
根据分析,该模型在 DeepSearchQA 和内部 KernelBench 等基准上取得了巨大进步,并在衡量推理优化的 inferenceEval 中达到 SOTA。然而,在 Terminal Bench 3.0、SWE Marathon v1.1 等公开的软件工程评测中,Grok 4.6 依然落后于前沿水平。
「模型」频道最新
- 实测 Grok 4.6:编码能力尚可,但存在用词怪异等问题 — Aizkmusic · 2026-08-13
- Grok 被指缺乏安全测试,60 美元即可实现通用越狱 — Miles_Brundage · 2026-08-13
- 前沿模型变「不说人话」?是变聪明还是能力退化了 — MikeBirdTech · 2026-08-13
- Grok 4.6 在 MC 编程测试中表现优异,仅用两轮建好金门大桥 — Aizkmusic · 2026-08-13
- RTX 5080 实测:Qwen3.6 与 Muse Glimmer 本地生成体素世界对比 — myanimal22 · 2026-08-13
- DeepSeek 新旧版本对比:进步明显,但仍缺乏手柄形态直觉 — teortaxesTex · 2026-08-13