22万次工具调用分析:LLM 监督测进度强但防攻击弱
Southbridge.AI 的 Hrishi Olickel 基于数千小时 agentic 运行记录,评测了 typesafe.ai 的模型监督工具 Jev,共分析约 22 万次工具调用。结论有三:在测算进度与估算完成度方面,这是他测过的最佳方案,能可靠衡量任务推进;但在抓偷懒、防攻击等安全监督场景上表现不可靠。这一结果提示用 LLM 作评审更适合进度监控,而安全防线仍需其他手段。
2026-09-21 ~ 2026-09-21 · 2 条相关
- 分析22万次Agent工具调用:模型监督模型在进度测算好用,防攻击不可靠 — hrishioa · 2026-09-21
- 分析数千小时 agent 运行:LLM 评委测进度强,抓偷懒弱 — hrishioa · 2026-09-21