实测23个模型重构智能体:GPT 5.6全面胜出,推理成本骤降
NextgenAITrading · reddit · 2026-08-12
一位独立开发者分享了其 AI 交易平台的模型评估与路由重构经验。他构建了五个测试环境(涵盖规划、代码执行、SQL生成等),对 OpenRouter 上的主流模型进行了全面基准测试。
结果显示,GPT 5.6 Luna 在五项测试中赢下四项,成为最大赢家。在执行任务中,它是唯一在得分、成本、延迟和 Schema 有效性上全面超越旧默认模型的模型,将执行得分从 75.3 提升至 89.2,且每千次决策成本仅 $1.67。Gemini 3.6 Flash 则在文本转 SQL 任务中保住了位置。
基于评测结果,作者将整个 Agent 循环切换至 Luna。这一变动导致 Google 的推理账单份额从 84% 暴跌至 4%,同时整体推理成本显著下降。由于当初买入 Google 看涨期权所押注的“可负担的高性能模型”优势已缩小,作者选择平仓获利,但表示仍会长期持有 GOOGL 股票。
「编程与Agent」频道最新
- ComBodied Agents:以人为中心的智能体新范式 — Qianggang Ding · 2026-08-12
- 开源桌面宠物:实时显示LLM Agent生命周期状态 — 333N3M3SiS333 · 2026-08-12
- 别光看教程:用暴雪RTS游戏包实战学习智能体编排 — majidmanzarpour · 2026-08-12
- ChatGPT、Gemini 与 Claude 定时任务功能实测对比 — EverydayAI_ · 2026-08-12
- 打破工具壁垒:开源项目 Baton 实现跨工具 AI 智能体通信 — seanmcdonaldxyz · 2026-08-12
- 斯坦福开源Biomni:自主执行生物医学研究的AI智能体 — tom_doerr · 2026-08-12