分析22万次Agent工具调用:模型监督模型在进度测算好用,防攻击不可靠
hrishioa · x · 2026-09-21
Southbridge.AI 的 Hrishi Olickel 基于数千小时 agentic 运行记录,评测了 typesafe.ai 的模型监督工具 Jev,共分析了约 22 万次真实工具调用(含 12.8 万次 shell 调用)。
主要结论
- 进度测量很出色:Jev 最适合用来衡量 agent 长任务进度、估算剩余时间与开销、标注运行状态。团队利用自有的 Hankweave 事件日志,可跨模型跨任务重放运行并持续调优。
- 危险命令检测不可靠:22 万次调用中标出 3814 条可疑(约 1.73%),其中 Edit/Write 命令告警率高达 9.5%/14%(模型擅改成功标准、计划等)。但约 1% 的判定重试后翻转,且用 hex 编码、Python 包装等方式即可轻松绕过——Jev 能防诚实失误,防不了恶意意图,不适合当安全护栏。
- 抓模型偷懒不行:对识别模型敷衍行为效果不佳。
文章附有完整 prompt 与实验数据,方法论是:用可复活重放的长时程运行记录,在统一事件日志上跑哨兵模型做大规模实验。
「编程与Agent」频道最新
- 本地小模型做决策分流、大模型管生成:Laya-MLX 从 0 到 1 教程 — sven_ai · 2026-09-21
- 3 天逆向 Instinct 记忆机制:极简设计,60 行代码可复现 — inductionheads · 2026-09-21
- ZCode 编程 Agent 因安全争议开源,官方致歉并启动第三方安全审查 — teortaxesTex · 2026-09-21
- 进度条白做了:开发者吐槽 Typesafe AI 工具快到从不显示进度 — draginol · 2026-09-21
- Z.ai 回应安全争议:开源 ZCode 并设漏洞悬赏,否认数据用于训练 — Zai_org · 2026-09-21
- 前 OpenAI 员工:不看每行代码直接上线,说明项目无关紧要 — yacineMTB · 2026-09-21