新模型 Apodex 1.1 登榜:Agent 能力超 DeepSeek V4 Pro
ArtificialAnlys · x · 2026-08-31
Apodex 发布新模型 1.1,在 Artificial Analysis 智能指数中得分 44,与 Kimi K2.6 和 MiniMax-M3 同级。该模型在 Agent 任务上表现突出,在真实世界 Agent 基准 GDPval-AA v2 中以 Elo 1348 分超过 DeepSeek V4 Pro 和 Qwen3.7 Max,在 TerminalBench v2.1 编程基准中也取得 70% 的高分。不过,模型在知识可靠性上较弱(AA-Omniscience -21.9),且输出较为冗长(平均每任务 1.7 万 token)。成本方面,单次任务约 $0.05,性价比优于同梯队竞品。
「模型」频道最新
- 扩散 LLM 可修正错误且生成速度提升 5-10 倍 — zainhas · 2026-08-31
- LLM不懂「全面」:用户吐槽AI搜索总是漏数据 — ivan_bezdomny · 2026-08-31
- 用户观察:Claude 似乎特别擅长编写固件代码 — _Stocko_ · 2026-08-31
- Darkbloom 平台新增 Qwen 3 VL 30B A3B 模型 — gajesh · 2026-08-31
- 质疑 OpenAI 与 Anthropic 永久性隐瞒模型真实能力 — scaling01 · 2026-08-31
- Qwen3.8 推出 INT4 与 MXFP4 版本, Auto-Round 工具同步更新 — HaihaoShen · 2026-08-31