Databricks 实测:Opus 5.5 同任务成本降 20%,GPT-6 Luna 便宜 20 倍
pwendell · x · 2026-09-29
Databricks 工程师 pwendell 基于对 2400 名工程师的线上工作负载分析加离线评测,对比近两周发布的多款新模型:
- Opus 5.5 与 GPT-6 Luna 两个模型明显扩展了成本/质量帕累托前沿。
- Opus 5.5 是当前最高质量的中端模型:优于所有前代 Opus,也优于 GPT-6 Sol 和 GPT-5.6 Sol。
- 对比此前最省钱的 Opus 4.8(5.0 被评为「扑街」:成本高、质量提升微弱),Opus 5.5 同任务成本稳定下降 20%。Databricks 已将其推荐为编码场景的日常默认模型。
- GPT-6 Luna 极其便宜:在所有离线基准和线上观测中,每任务成本至少比 Opus 5.5 低 20 倍。
- Luna 能力意外地强:在一个最难的评测集上大致追平 Opus 4.6,而成本比当年 Opus 4.6 低 99.3%(该结论尚属初步)。
其生产配置用 Unity Gateway 在多模型间路由工作负载并追踪 agent 交互,harness 混合了 Omingent、Claude Code、Codex 和 Cursor。
所属事件:Databricks 实测新模型:GPT-6 Luna 成本仅为 Opus 5.5 的二十分之一(2 条相关)→
「编程与Agent」频道最新
- GPU 租赁价格 API 上线:实时追踪 H100/B200 行情 — virattt · 2026-09-29
- FastMCP 播客:LangChain 谈 MCP 新规范、Agent 评测与决策模型 — Hacubu · 2026-09-29
- 实测 6 个模型:浏览器 Agent 不需要 WebMCP,但有工具更快更省步 — rseroter · 2026-09-29
- AgentPaySec 实测支付型 AI Agent:16 项测试 5 项被攻破 — Miserable_Gas_1527 · 2026-09-29
- p5.js 故事预告与新闻 meme 解说两条视频 Prompt 实操 — dotey · 2026-09-29
- 用 JavaScript 一句话 Prompt 生成极简字体动画视频 — dotey · 2026-09-29