模型性价比帕累托前沿:GPT-6 Luna 每任务 0.22 美元,Claude 要 18-22 美元
ArtificialAnlys · x · 2026-10-09
Artificial Analysis 公布法律 Agent 基准中「幻觉门控全通过率>0」模型的分数-成本帕累托前沿:GPT-6 Luna (max)、GPT-6.1 Sol (max)、Muse Spark 1.3 (max) 和 Grok 4.7 (xhigh) 四款入列。
- Grok 4.7 (xhigh) 得分领先,约 $9.50/任务
- Muse Spark 1.3 (max) 次之,约 $4.20/任务
- 三款 Claude 模型成本高达 $18$22/任务
- GPT-6 Luna (max) 最便宜,约 $0.22/任务,得分 3.3%
所属事件:幻觉门控重塑法律基准:Grok 4.7 登顶,超六成合格结果含幻觉(8 条相关)→
「模型」频道最新
- Cohere 详解 Tiny Aya 母语推理:数据配比是关键,44 语言 93% 用提示语言思考 — lmoroney · 2026-10-09
- Cohere 开源 3.35B 模型 Tiny Aya L2-Thinker,支持 44 种语言母语推理 — lmoroney · 2026-10-09
- LightOnOCR-3新增全页grounding:单提示词切换OCR模式 — IgorCarron · 2026-10-09
- TypeSafe 推出决策模型 Jev:分类任务快 200 倍、成本低 400 倍 — LangChain · 2026-10-09
- 开发者反馈 Opus 5.5 上线后「Junior 变聪明了」 — zeeg · 2026-10-09
- Polymarket 开设 GPT-6.1 Astra 发布预测盘,年底前概率 93% — Polymarket · 2026-10-09