实测23个模型重构智能体:GPT 5.6全面胜出,推理成本骤降

NextgenAITrading · reddit · 2026-08-12

一位独立开发者分享了其 AI 交易平台的模型评估与路由重构经验。他构建了五个测试环境(涵盖规划、代码执行、SQL生成等),对 OpenRouter 上的主流模型进行了全面基准测试。

结果显示,GPT 5.6 Luna 在五项测试中赢下四项,成为最大赢家。在执行任务中,它是唯一在得分、成本、延迟和 Schema 有效性上全面超越旧默认模型的模型,将执行得分从 75.3 提升至 89.2,且每千次决策成本仅 $1.67。Gemini 3.6 Flash 则在文本转 SQL 任务中保住了位置。

基于评测结果,作者将整个 Agent 循环切换至 Luna。这一变动导致 Google 的推理账单份额从 84% 暴跌至 4%,同时整体推理成本显著下降。由于当初买入 Google 看涨期权所押注的“可负担的高性能模型”优势已缩小,作者选择平仓获利,但表示仍会长期持有 GOOGL 股票。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →