Agnes 2.5 Pro Beta 跃居前沿梯队,智能体能力大涨但消耗翻倍
ArtificialAnlys · x · 2026-08-28
新加坡实验室 Agnes AI 发布 Agnes 2.5 Pro Beta,在 Artificial Analysis 智能指数中得分 49,较 Alpha 版提升 9 分,跻身前沿梯队。排名仅次于 Gemini 3.5 Flash 和 GPT-5.6 Luna,超越 MiniMax-M3。
关键提升在于智能体能力:Agentic Index 从 25 升至 44,τ³-Banking 指标接近三倍,GDPval-AA v2 的 Elo 分数大幅提升。推理能力评估略有进步,Humanity's Last Exam 准确率从 34% 升至 38%。
为降低幻觉率(从 88% 降至 33%),模型采用了更保守的“弃权”策略,尝试回答的问题比例从 94% 降至 45%。代价是输出 Token 数量翻倍,每项任务需消耗约 5 万输出 Token。该模型支持 100 万上下文、图文输入,定价为 $0.10/$0.30 每百万输入/输出 Token。
所属事件:Agnes 2.5 Pro Beta 评分大涨,但 Token 消耗翻倍(4 条相关)→
「模型」频道最新
- 用户尝试下载 MiniMax H3 遭遇 Forbidden 错误 — musashiasano · 2026-08-28
- 网友观点:若 GPT Sol 前端能力更强,它就是最好的模型 — BLUECOW009 · 2026-08-28
- Anima-3.8B 模型登顶 Hugging Face 热榜 — lylogummy · 2026-08-28
- 进化策略训练 LLM 推理:Pass@K 覆盖面优于 GRPO — Yunpeng Ba · 2026-08-28
- 观点:Qwen 的 n-gram 技术将刺破 AI 泡沫 — Acrobatic_Stress1388 · 2026-08-28
- IBM 开源 Granite 4.2 推理模型,含完整训练配方 — krvarshney · 2026-08-28