模型性价比帕累托前沿:GPT-6 Luna 每任务 0.22 美元,Claude 要 18-22 美元

ArtificialAnlys · x · 2026-10-09

Artificial Analysis 公布法律 Agent 基准中「幻觉门控全通过率>0」模型的分数-成本帕累托前沿:GPT-6 Luna (max)、GPT-6.1 Sol (max)、Muse Spark 1.3 (max) 和 Grok 4.7 (xhigh) 四款入列。

所属事件:幻觉门控重塑法律基准:Grok 4.7 登顶,超六成合格结果含幻觉(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →