Sakana Fugu Ultra v2 刷榜:8 项基准 5 项最佳,编排逼近帕累托前沿
SakanaAILabs · x · 2026-09-12
Sakana AI 随 Fugu Ultra v2 上线发布配套博客,阐述其编排系统的成本-性能双轴策略。
- 基准成绩:在 8 项基准中 5 项取得最佳或并列最佳(DeepSWE 74.3、Chartography 48.3 超 Opus 5 与 Fable 5、Toolathon、GDP.pdf、SWEFish),且智能体池中没有使用 Fable 5、Fable 5.1 或 GPT-6-Astra
- 双产品同架构:Fugu Max 追求最低成本下的最优输出,扩展帕累托效率前沿;Fugu Ultra v2 追求复杂多步任务的绝对能力上限
- 核心主张:未来属于知道「该调哪台机器」的系统,而非无差别调用最大模型的系统;编排层可在不依赖闭源前沿模型的情况下逼近甚至超越单模型表现
- 演进历程:4 月 Beta 验证多智能体编排可作统一基础模型,6 月 GA 与 Ultra v1 证明编排层可匹敌闭源前沿模型,如今双线推进
值得注意的是,编排消耗的 token 按标准输入/输出计费,实际成本结构需要使用者自行核算。
所属事件:Sakana AI发布Fugu Ultra v2与Max,多模型编排刷新性价比(16 条相关)→
「编程与Agent」频道最新
- 用一段提示词让 Codex 自查 skills 与 AGENTS.md,适配 GPT-6 Astra — iamrobotbear · 2026-09-13
- check_vitals MCP 工具:给 agent 提供 CrUX 真实性能数据 — atp_studio_coll · 2026-09-13
- Stripe 推出 Link CLI:一次集成给你的 Agent 加上付款钱包 — jeff_weinstein · 2026-09-13
- 开发者喂 GPT-6《GT 赛车》与 F1 电影,生成可交互 3D 赛车场景 — cedric_chee · 2026-09-13
- 编码 Agent 会自创形式语言,自然语言或成其元语言 — jmugan · 2026-09-13
- Uncle Bob 发文质疑 Agent Harness 设计,呼吁重新思考 — blaizedsouza · 2026-09-13