新研究揭示:代码式工具调用准确率远超原生JSON
dair_ai · x · 2026-08-11
DAIR.AI 发文介绍了一项关于大模型工具调用的新研究。研究横跨 14 个语言模型,在 BFCL v4 基准上对比了程序化工具调用(将工具暴露为 Python 存根并通过代码调用)与原生 JSON 工具调用的表现。
主要发现如下:
- 整体优势:程序化调用在 14 个模型中有 11 个击败了 JSON 基线,且优势随模型代码能力的提升而扩大。
- 特定模型增益:GPT-5.6 系列相比 JSON 基线提升了 10.6%。
- 并发与长文本:在并行调用中,14 个模型里有 13 个胜出;在上下文退化场景下,程序化调用依然稳定,而 JSON 基线平均下降 2.3%。
「编程与Agent」频道最新
- Trigger.dev 推出持久化 Chat Agent,刷新页面不中断 AI 对话 — addyosmani · 2026-08-11
- DCAS:解耦 CLI 智能体脚手架,将规划能力内化为模型本身 — centre-for-swe · 2026-08-11
- 构建高效编程Agent:基础工具组合才是核心 — deliprao · 2026-08-11
- 基于 SAM 3 的开源框架 Edit Banana:一键将静态图片转为可编辑流程图 — tom_doerr · 2026-08-11
- 仅14MB的端侧Agent模型Needle 2:树莓派5解码破500 tokens/s — Henrie_the_dreamer · 2026-08-11
- Remoko 发布:让长任务 Agent 通过 iOS 推送找你审批 — Scobleizer · 2026-08-11