Agnes 2.5 Pro Beta 跃居前沿梯队,智能体能力大涨但消耗翻倍

ArtificialAnlys · x · 2026-08-28

新加坡实验室 Agnes AI 发布 Agnes 2.5 Pro Beta,在 Artificial Analysis 智能指数中得分 49,较 Alpha 版提升 9 分,跻身前沿梯队。排名仅次于 Gemini 3.5 Flash 和 GPT-5.6 Luna,超越 MiniMax-M3。

关键提升在于智能体能力:Agentic Index 从 25 升至 44,τ³-Banking 指标接近三倍,GDPval-AA v2 的 Elo 分数大幅提升。推理能力评估略有进步,Humanity's Last Exam 准确率从 34% 升至 38%。

为降低幻觉率(从 88% 降至 33%),模型采用了更保守的“弃权”策略,尝试回答的问题比例从 94% 降至 45%。代价是输出 Token 数量翻倍,每项任务需消耗约 5 万输出 Token。该模型支持 100 万上下文、图文输入,定价为 $0.10/$0.30 每百万输入/输出 Token。

所属事件:Agnes 2.5 Pro Beta 评分大涨,但 Token 消耗翻倍(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →