开发者开源 bevis:Agent 说「做完了」必须拿出命令与输出作证
Lekis86 · reddit · 2026-08-29
作者在本地硬件上跑着一支 24 个 Agent 的舰队,通过自研 AI OS 的 Mission Control 看板追踪任务、依赖、验证状态与队列。他发现的核心失败模式不是 Agent 干错了,而是 Agent 声称完成但产物对不上:工作没动过、测错了对象、或根本没测只是断言。
于是他做了最小化工具 bevis(Apache-2.0,纯标准库、零依赖):
- 一个任务要到达 closed 状态,必须有存储下来的命令、退出码和输出——不是口头断言;关闭任务和验证任务是两个动作,关任务的人不能自己验证。
- dispatcher 只负责派活给任何 Agent 或脚本,从不自行判定成功,由任务自身的检查决定。
- 模型无关:可用于 Claude Code、Codex、任意 LLM 甚至本地模型;工具本身不调用任何语言模型,被测的是「成功声明是否为真」。
- 副产品:验证过的任务、命令、输出与结果可积累成数据集,日后用于 LoRA 训练自己的模型,把 Agent 舰队的工作变成训练未来 Agent 的素材。
作者也坦承局限:bevis 不检查相关性(bevis close 3 --run "echo done" 仍能关单);事件日志没有哈希链和签名,拿到 SQLite 文件的人可以改写历史。
「编程与Agent」频道最新
- 接入 Cloudflare 隧道,实现 Cursor 云端 Agent 自动验证 iOS 项目 — Baconbrix · 2026-08-29
- Google 与微软共建 WebMCP,或改变 Agent 访问网页方式 — thisiskp_ · 2026-08-29
- Cursor 技巧:连接多账户资源池,最大化利用额度 — JOBhakdi · 2026-08-29
- 设想基于代币价格的自主监控 Agent — curious_vii · 2026-08-29
- 像管理公司一样运营多个 Grok Bot 团队 — minchoi · 2026-08-29
- Apodex 展示多智能体协作:150 代理分步验证推理 — Scobleizer · 2026-08-29