开源模型编排达到 Fable 5 水准,成本仅十分之一:5.76 美元 vs 61.11 美元
vecto_r · reddit · 2026-09-18
- 一个免训练的 manager-worker 脚手架用同一模型的多个新实例分解问题并协同调度,在 hard LiveCodeBench 上让开源权重模型接近或追平 Claude Fable 5。
- 各模型经编排后的提升:Qwen3.8-FlashNext 从 84.2% 升至 93.0%;Qwen3.8-27B 从 69.2% 升至 92.4%;GPT-5.6-Terra 从 80.8% 升至 88.0%;GPT-5.6-Luna 从 70.4% 升至 81.2%;作为对比,Fable 5 单次调用为 90.4%。
- 成本差距惊人:FlashNext 编排后每轮 5.76 美元,而 Fable 5 为 61.11 美元。
- 项目开源:GitHub 仓库 GVS5H 及 arXiv 论文 2608.26480。
「编程与Agent」频道最新
- 让 Agent 自己部署应用、再当真实用户测试,像高级模糊测试 — lucasmeijer · 2026-09-19
- 开发者经验:禁止 fallback,逼模型把核心功能做对 — Daniel_Farinax · 2026-09-19
- 银行仓库接 AI 问答三个月复盘:模型从来不是难点 — the_darkest_horse · 2026-09-19
- Codex 直接输出图表能力被低估,agent 编码体验再添一环 — Angaisb_ · 2026-09-19
- Notion 设计工程师 Geoffrey Litt 谈 AI 时代「理解成新瓶颈」 — EchoShao8899 · 2026-09-19
- Codex 内置 Images 2.5:先用图像模型重设计页面再实现 — OpenAIDevs · 2026-09-19