分析22万次Agent工具调用:模型监督模型在进度测算好用,防攻击不可靠

hrishioa · x · 2026-09-21

Southbridge.AI 的 Hrishi Olickel 基于数千小时 agentic 运行记录,评测了 typesafe.ai 的模型监督工具 Jev,共分析了约 22 万次真实工具调用(含 12.8 万次 shell 调用)。

主要结论

文章附有完整 prompt 与实验数据,方法论是:用可复活重放的长时程运行记录,在统一事件日志上跑哨兵模型做大规模实验。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →