Artificial Analysis:输出 token 越多分越高?Claude 三款模型 20 万 token 仍垫底

ArtificialAnlys · x · 2026-10-09

Artificial Analysis 在法律 Agent 基准的幻觉门控评测中发现,生成更多输出 token 并不必然带来更高分数:GPT-6 Astra (max) 每任务约 8.1 万输出 token 拿到 8.6% 得分,不到 Grok 4.7 (xhigh) 约 18 万 token 的一半;而三款 Claude 模型输出 token 最多(每任务约 20.2 万56.2 万),得分却只有 2.8%6.4%。

所属事件:幻觉门控重塑法律基准:Grok 4.7 登顶,超六成合格结果含幻觉(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →