Agent 单任务调用 119 次工具,评测却只看最终答案
patience__01 · reddit · 2026-09-05
FinFIRST 基准中 Ling-3.0-flash-Fin 的运行数据显示:agent 平均每个任务进行 23.08 轮推理、调用 30.87 次工具,单个任务最多达 119 次工具调用;123 个任务产出 122 个有效结果。但基准方法学只用 GLM-5.1 自动评委打最终答案,不评估隐藏推理或完整工具轨迹。
- 可观测性缺口:最终答案看似可靠,路径却可能低效、重复、依赖脆弱的搜索序列;反之轨迹混乱也可能得出有效结果。仅看最终答案无法判断 agent 是否打开无关页面、智能恢复、重复失败调用或走了安全路线。
- 边界澄清:这些数字并不表明 Ling 访问了机密、越权或造成外部副作用,工具仅为 Web Search、Visit 和 Python。
- 核心主张:当 agent 单任务可达 119 次调用时,「答案看起来不错」不是完整的审计记录;agent 评测需要明确应保留、打分和展示哪些轨迹证据。
「编程与Agent」频道最新
- GPT-6 Astra 自动导入素材调色对轴,独立完成 Final Cut 前期准备 — minchoi · 2026-09-05
- GPT-6 Astra 耗时 26 分钟、烧 1046 万 token 生成一个应用 — minchoi · 2026-09-05
- AI 圈战火:知名开发者呼吁废除 agent 上下文压缩 — sull · 2026-09-05
- GPT-6 Astra 上线 GitHub Copilot,主打长程自主编码与 Agent 任务 — OpenAIDevs · 2026-09-05
- 长程 Agent 记忆新思路:用层级 RAG 加持久化草稿板替代线性窗口 — IgorCarron · 2026-09-05
- Astra 生成网站全文曝光:GPT-6 主打研究、建模、编码与跨应用执行 — reach_vb · 2026-09-05