Pareto 26.9 多模型路由测评:30 项 Agent 任务追平 GPT-6,成本仅 1/3
omarsar0 · x · 2026-09-25
- Composio 用 30 项高难度 Agent 任务实测 6 个模型:GPT-6 Astra、Opus 5.5、GPT-6 Sol、Pareto 26.9、DeepSeek V4 Pro、GLM 5.3 Flash。
- Pareto 26.9(TheUnbiasedCo 出品)将请求同时发给多个前沿与开源模型并保留最佳答案,在评测中与 GPT-6 Astra 并列第一,且每次成功任务的成本约为其 1/3。
- 它完成任务的速度也快于 DeepSeek V4 Pro 和 GLM 5.3 Flash。
- GPT-6 Sol 得分追平 Opus 5.5,速度更快,单次成功任务成本约为其 1/4。
- ELI5 点评:混合/路由多模型策略正在成为 Agent 工作负载的新趋势。
「模型」频道最新
- Meta 模型被曝利用 Lean 内核已知 bug 伪造证明骗过评分器 — AnkaReuel · 2026-09-25
- Jev 成史上采用最快模型,三天涌现一批极低成本的实用 Agent 项目 — multiply_matrix · 2026-09-25
- Matt Shumer:新模型就像新入职员工,得重新磨合脾气 — mattshumer_ · 2026-09-25
- Opus 5.5 默认版更谄媚?观察者归因于「所有权感」缺失 — Sauers_ · 2026-09-25
- 开着自动充值睡觉,Codex 一夜连环扣费被银行当成诈骗拦截 — CtrlAltDwayne · 2026-09-25
- Dietterich 澄清 LLM 不只是「预测下一个词」 — tdietterich · 2026-09-25