Agent 单任务调用 119 次工具,评测却只看最终答案

patience__01 · reddit · 2026-09-05

FinFIRST 基准中 Ling-3.0-flash-Fin 的运行数据显示:agent 平均每个任务进行 23.08 轮推理、调用 30.87 次工具,单个任务最多达 119 次工具调用;123 个任务产出 122 个有效结果。但基准方法学只用 GLM-5.1 自动评委打最终答案,不评估隐藏推理或完整工具轨迹。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →