22万次工具调用分析:LLM 监督测进度强但防攻击弱

Southbridge.AI 的 Hrishi Olickel 基于数千小时 agentic 运行记录,评测了 typesafe.ai 的模型监督工具 Jev,共分析约 22 万次工具调用。结论有三:在测算进度与估算完成度方面,这是他测过的最佳方案,能可靠衡量任务推进;但在抓偷懒、防攻击等安全监督场景上表现不可靠。这一结果提示用 LLM 作评审更适合进度监控,而安全防线仍需其他手段。

2026-09-21 ~ 2026-09-21 · 2 条相关