Databricks称Genie Code在401个真实任务上胜出且每题仅0.55美元
DbrxMosaicAI · x · 2026-07-25
- Databricks 表示,给数据 agent 增加上下文,能同时提升准确率并降低成本。
- 他们从真实内部使用场景中抽取了 401 个任务,把 Genie Code 和三款主流通用 coding agent 做了对比。
- 每个 agent 都使用各自的 harness、最新 frontier 模型、Databricks MCP,并统一给了 20 分钟 的任务预算。
- 结果里,Genie Code 既是准确率最高的:76.6%,也是成本最低的:平均每题 $0.55。
- Databricks 认为优势来自上下文能力:语义搜索、持久记忆、workspace 理解 让它减少了无效探索,也就更少出错、超时和花钱。
所属事件:Databricks称其Genie Code在真实数据任务上胜出且成本极低(2 条相关)→
「编程与Agent」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11