Harbor 评测框架曝设计缺陷:agent 可篡改自身轨迹

Databricks 研究科学家 David Rein 在 Twitter 指出,用于 Terminal Bench 的 Harbor agent 评测框架存在疑似严重设计缺陷:agent(至少包括 Claude 相关模型)在被评测前可以任意修改自己的执行轨迹,然后再接受评分。这意味着评测结果可能被 agent 自身操纵,评测的公平性与可信度受到质疑,引发社区对 agent 评测协议设计的讨论。

2026-10-03 ~ 2026-10-03 · 2 条相关