Grok 4.7 幻觉率降至 29%,完整评测明细公开
ArtificialAnlys · x · 2026-09-22
Artificial Analysis 公布 Grok 4.7 (xhigh) 的完整智能指数评测明细,并与 Grok 4.6 (high) 等领先模型对比。AA-Omniscience 知识问答子项:幻觉率从 34% 降至 29%,准确率基本持平(47% vs 48%),综合指数从 30 升至 32。
所属事件:Grok 4.7 评测:智能指数46分进前四,token消耗翻倍(7 条相关)→
「模型」频道最新
- 安全护栏毁了叙事:视频模型画面如电影,打斗戏却集体「退缩」 — CurieuxExplorer · 2026-09-22
- 基于 Qwen3.8-27B 的写作微调模型 Hemmingway-1 上架 Hugging Face — CurieuxExplorer · 2026-09-22
- GPT-6 Astra 多次把模拟人物推下悬崖,Grok/Gemini/Claude 都拒绝了 — CurieuxExplorer · 2026-09-22
- 用户抱怨 Codex 额度遭缩水式下调:还能信大厂吗 — StewartalsopIII · 2026-09-22
- 博弈论视角:抢在对手发布日前一天发模型等于自认更弱? — cocktailpeanut · 2026-09-22
- LFM2.5 端侧评测登顶:2.32GB 内存、8 秒延迟,39 款小模型中并列第一 — maximelabonne · 2026-09-22