分析数千小时 agent 运行:LLM 评委测进度强,抓偷懒弱
hrishioa · x · 2026-09-21
hrishioa 分析了数千小时的 agentic 运行记录,评估用 LLM 作评审(Jev)的效果,结论有三点:
- 测进度与估算完成度:这是他测过的最佳方案,能可靠衡量 agent 任务进展
- 检测有害命令:反而危险,不适合用于拦截危险操作(文中展开了原因)
- 抓模型偷懒:效果不佳,很难发现模型在敷衍
文章附带了实际的 prompt 和完整结果,配有精细可视化。
所属事件:22万次工具调用分析:LLM 监督测进度强但防攻击弱(2 条相关)→
「编程与Agent」频道最新
- 网友组合 Jev 与 BaoCut,一句话即可检索长视频片段 — dotey · 2026-09-21
- 开源 claude-ops:57 技能 21 agent 把 Claude Code 变业务操作系统 — tom_doerr · 2026-09-21
- Pragmatic Engineer 深挖:OpenAI 内部如何被 Codex 全面接管 — AxSaucedo · 2026-09-21
- 给 Agent 配一部手机,它就成了随身私人秘书 — ethanniser · 2026-09-21
- 实测+200 项基准:编码 Agent 面对不该改的任务,35-65% 仍乱改代码 — RunAI_Coder · 2026-09-21
- 让第二个 LLM 盯着编码 Agent:用独立验证模型揪出假成功 — Ascend-910 · 2026-09-21