评测显示 Grok 4.7 排名跌至第 24,较 4.6 下滑 5 分
scaling01 · x · 2026-09-22
Vals AI 发布的基准评测显示,Grok 4.7 在 Vals Index 上仅排第 24 名(54.2%),较 Grok 4.6(第 14 名,59.2%)下滑 5 个百分点,不过仍好于 Grok 4.5(第 30 名,51.5%)。
分领域看,Grok 4.7 提升最大的是法律和医疗类任务。评测者以 💀 表达对这次退步的态度。xAI 新版本发布后评测不升反降,值得后续观察是否为评测口径或模型回归问题。
「模型」频道最新
- Azure OpenAI 内容过滤器闹乌龙:把「S&M」当成色情内容拦截 — peterjliu · 2026-09-22
- IFM 发布 K2-Horizon-36B-A4B:MoVA 新架构以 4B 激活参数对标大 20 倍模型 — victormustar · 2026-09-22
- Grok 4.7 又翻车:花 $1.59 输出惨不忍睹,遭全网围观 — teortaxesTex · 2026-09-22
- 实测打脸:1000 条诈骗广告分类,拟合 TF-IDF 基线完胜 LLM — justinbiebar · 2026-09-22
- Evo 2 模型内部竟编码「生命之树」:激活流形对应物种演化关系 — burny_tech · 2026-09-22
- 内部实测:Grok 4.7 在 22 项知识工作中排第 3,成本低于 5 美元 — realsohamparekh · 2026-09-22