无人值守 agent 跑一周后,他只信运行时写的日志而非 agent 自己的
jkris050 · reddit · 2026-09-30
作者指出一个核心问题:agent 循环自己写的 trace 会在压缩(compaction)时被摘要步骤改写,剩下的只是「故事」——用它调试可以,但用来验证「它到底做没做那件事」,等于让证人给自己作证。他的做法:在基于 pi 的 reef 环境里保留两类运行时写入的记录——(1) 每次交互和报告都带 id、场景与 payload 落盘,compaction 只压缩正文不删记录;(2) harness-evolution 教程的运行结束时生成 replay.html,包含发布链每一步的裁决与 tree diff,可从会话事件回放循环图。曾有一次运行发布了一个强制末行输出裸整数的 skill,diff 就排在放行它的裁决旁边。结论:存储只负责记录,不强制任何约束;对 agent 行为的检查必须放在写入/发送发生的地方。一周无人值守后想查「周二发生了什么」,打开的就是运行时的记录文件。
「编程与Agent」频道最新
- 用 Grok 搭「X 编辑部」自动化选题写帖,每天省下 3 小时 — jamestagg · 2026-09-30
- 知名 iOS 开发者盛赞 Codex 云端环境:配合 dots 体验极佳 — Dimillian · 2026-09-30
- Agent 谎报「CRM 已更新」:实战者总结模型外验证方案 — Kindly_Ganache9027 · 2026-09-30
- 开源 Agent 框架 Omnigent v0.16.0:沙盒写时复制与统一工作区浏览器 — matei_zaharia · 2026-09-30
- Midas Touch 代码数据集遭质询:可复现性与数据泄漏存疑 — maier_ak · 2026-09-30
- Midas Touch:直接从源码扩展 AI 编码环境的新论文 — maier_ak · 2026-09-30