105 个植入 bug 实测:Pareto 以 4.81 美元成本逼近顶级模型
PawelHuryn · x · 2026-09-18
作者在真实工作中用两个代码仓库、105 个植入 bug 测试了 Unbiased(前 Union Alpha)的 Pareto,并对比各家模型的得分与成本:
- GPT-6 Astra (max):45 分,$33.03
- Fable 5.1 (max):43 分,$77.55
- Muse Spark 1.3 (max):32.2 分,$18.11
- Pareto:30.7 分,仅 $4.81 ⭐
- Grok 4.6 (xhigh):28.7 分,$18.60
- Opus 5 (max):27 分,$51.33
结论:Pareto 又快又强,性价比显著领先,作者发现它实际上是一个 composite(组合)模型。
所属事件:Bug Hunt Bench 实测:Pareto 以 4.81 美元逼近顶级模型(2 条相关)→
「编程与Agent」频道最新
- 斯坦福团队推出 Paper2Agent:把论文变成会协作的 AI 智能体 — burny_tech · 2026-09-18
- 用 vibe coding 做出拟真射击系统,免费 mod 发布 — TAbrodi · 2026-09-18
- Grok Build 连发两版:后台任务实时可视,MCP 认证更稳 — XFreeze · 2026-09-18
- LangChain 推出 Jev 教程:手把手构建 Agent 运行框架 — LangChain · 2026-09-18
- 开发者一天多做出动作 Roguelike,Astra 让 AI 边玩边改游戏 — majidmanzarpour · 2026-09-18
- Codex 终于上线消息时间戳,用户惊呼等太久了 — GabGarrett · 2026-09-18