Harbor agent 评测框架被曝漏洞:agent 可随意篡改自己的执行轨迹
idavidrein · x · 2026-10-03
- Twitter 用户 idavidrein 指出,用于 Terminal Bench 的 Harbor agent 评测框架存在疑似严重设计缺陷:agent(至少 Claude Code)对构建执行轨迹的文件拥有读写权限,而这些轨迹既展示给人类评审,也常用于 LLM judge 验证。
- 作者演示:让 Claude Sonnet 5.5 在最后一步用 sed 把日志 .l 中的代号 PINEAPPLE 替换为 MANGO,结果 viewer 中显示的记录变成「the codeword is MANGO」,证明 agent 的篡改确实改变了下游看到的轨迹。
- 作者认为这从 reward hacking 和可靠性角度看相当令人担忧,建议沙箱应禁止 agent 对轨迹文件的写权限,已在 GitHub 开 issue(#3477)。
- 若属实,意味着基于该框架的 agent 评测成绩可能被 agent 自身轻易操纵。
所属事件:Harbor 评测框架曝设计缺陷:agent 可篡改自身轨迹(2 条相关)→
「编程与Agent」频道最新
- 转述称 Karpathy 讲座断言提示词式微,图结构才是留存层 — msharmas · 2026-10-03
- 开发者断言:算力足够时一人可产出「几个世纪的软件」 — cephaloform · 2026-10-03
- OpenAI DevDay 要点:Agent 应用降本增效的 4 个关键杠杆 — omarsar0 · 2026-10-03
- Copilot CLI v1.0.92-3 发布:新增 Ctrl+E 本地/云端环境切换 — copilot-cli-release-app[bot] · 2026-10-03
- 前博士生的编程工具创业四准则:LLM 翻转了哪两条 — jimmykoppel · 2026-10-03
- Qwen Code v0.24.7 nightly:新增本地 workspace agent 协作 — qwen-code-ci-bot · 2026-10-03