Artificial Analysis:输出 token 越多分越高?Claude 三款模型 20 万 token 仍垫底
ArtificialAnlys · x · 2026-10-09
Artificial Analysis 在法律 Agent 基准的幻觉门控评测中发现,生成更多输出 token 并不必然带来更高分数:GPT-6 Astra (max) 每任务约 8.1 万输出 token 拿到 8.6% 得分,不到 Grok 4.7 (xhigh) 约 18 万 token 的一半;而三款 Claude 模型输出 token 最多(每任务约 20.2 万56.2 万),得分却只有 2.8%6.4%。
所属事件:幻觉门控重塑法律基准:Grok 4.7 登顶,超六成合格结果含幻觉(8 条相关)→
「模型」频道最新
- LightOnOCR-3新增全页grounding:单提示词切换OCR模式 — IgorCarron · 2026-10-09
- TypeSafe 推出决策模型 Jev:分类任务快 200 倍、成本低 400 倍 — LangChain · 2026-10-09
- 开发者反馈 Opus 5.5 上线后「Junior 变聪明了」 — zeeg · 2026-10-09
- Polymarket 开设 GPT-6.1 Astra 发布预测盘,年底前概率 93% — Polymarket · 2026-10-09
- Zeeg 自述几乎弃用 GPT:Opus 5.5 太强,Codex 额度总不够用 — zeeg · 2026-10-09
- 325 个模型限时造怪物:三分之一首次即败,超预算是最大坑 — Binxtv · 2026-10-09