Apodex 1.1:专为 Agent 任务优化的模型
rohanpaul_ai · x · 2026-09-02
Apodex 发布了专有模型 Apodex 1.1。在 Artificial Analysis 指数中得分 44,但在衡量真实世界 Agent 工作的 GDPval-AA v2 测试中达到 1348 Elo,超过了通用智力得分更高的模型。作者指出,模型选择不应只看通用推理基准,而应关注其在 Agent 循环中利用工具完成目标的实际能力。Apodex 1.1 在专业和 Agent 任务上表现出了异常集中的优势。
所属事件:Apodex 1.1 发布,智能体评测表现亮眼(3 条相关)→
「编程与Agent」频道最新
- Ethan Mollick 提议 Agent 设“促进者”以决定何时介入人工 — rseroter · 2026-09-02
- 用户吐槽 Google Antigravity:Gemini 表现拉胯,一条命令烧掉半份配额 — DigSudden6867 · 2026-09-02
- 用户实测 Fable 5.1:代码审计中途“核平”项目 — Denguish-Khan · 2026-09-02
- Agent 自动纠错案例:发邮件修正公共数据集错误 — JanJanJaJa · 2026-09-02
- 无视限流争议,用户月耗 $2760 Token — oyacaro · 2026-09-02
- mitsuhiko:Pi 靠可挂钩系统提示,难在长期保持前缀稳定 — mitsuhiko · 2026-09-02