Vals AI 评测:Grok 4.7 综合分不升反降,跌至第 24 名
zacharynado · x · 2026-09-22
Vals AI 发布了 Grok 4.7 在其基准套件上的评测结果,与 Artificial Analysis 的乐观结论形成反差:
- Grok 4.7 在 Vals Index 排名第 24(54.2%),比 Grok 4.6(第 14 名,59.2%)下降 5 个百分点,但仍高于 Grok 4.5(第 30 名,51.5%)
- 提升最明显的是法律和医疗类任务
所属事件:Grok 4.7 在 Vals AI 评测中不升反降,排名跌至第 24(2 条相关)→
「模型」频道最新
- Azure "小失误"疑泄露 GPT-6-Luna/Sol 模型名称 — scaling01 · 2026-09-22
- 爆料称 OpenAI 新模型或名 GPT-6-Luna 与 GPT-6-Sol,即将发布 — scaling01 · 2026-09-22
- Qwen 3.8 27b 微调版输出冗长减 40%,质量基本无损 — julianharris · 2026-09-22
- METR 发布 OpenAI/Hugging Face 黑客事件独立调查:智能体协作内幕 — JeffLadish · 2026-09-22
- JevBench v1.3.0 发布:原版 Jev 以 74.4 分仍居首,47 个竞品逼近 — airesearch12 · 2026-09-22
- DeepSeek 对阵 Jev:无文本「系统一」模型基准的新对照 — frappuccinoCoin · 2026-09-22