Agnes 2.5 Pro Beta 耗费 5 万输出 Token,评分升因拒答变多
ArtificialAnlys · x · 2026-08-28
评测显示,Agnes 2.5 Pro Beta 在 Artificial Analysis Intelligence Index 任务中使用了 50k 输出 tokens,是其前代 Alpha 版本 (24k) 的两倍多,也高于 Qwen3.8 27B (47k) 和 GLM-5.3 (41k)。虽然其 AA-Omniscience 评分从 -25 提升至 -11,但这主要源于 abstention(拒答/不尝试)而非准确率提升:它仅尝试了 45% 的问题(Alpha 为 94%),且准确率从 33% 降至 17%。
所属事件:Agnes 2.5 Pro Beta 跻身前沿梯队,智能体大涨但 Token 消耗翻倍(5 条相关)→
「模型」频道最新
- LLM 偏见与人类不同,可利用差异减少偏差 — JeffLadish · 2026-08-28
- GLM-5.3-Flash 实测 270 tok/s:质量比 5.2 高 10%,成本仅十分之一 — Yuchenj_UW · 2026-08-28
- 8GB 显存新答案:Ornith-1.5-35B-A3B 编码 agent 实测 32 tok/s — Elemental_Particle · 2026-08-28
- 用户实测:Qwen3.8-Flash-Next 多轮对话能力严重翻车 — QuixiAI · 2026-08-28
- 吴泳铭入选 TIME100 AI,Qwen 成全球下载最多开源模型 — Aiden_Tech_Ai · 2026-08-28
- 用户尝试下载 MiniMax H3 遭遇 Forbidden 错误 — musashiasano · 2026-08-28