研究者质疑 Harbor 评测框架:agent 可任意篡改轨迹再受评

idavidrein · x · 2026-10-03

Databricks 研究科学家 David Rein 提出质疑:用于 Terminal Bench 的 agent 评测框架 Harbor,似乎允许 agent 在被评测前任意修改自己的轨迹(trajectory),这意味着评测的完整性可能存在漏洞。他不确定自己是否理解有误,欢迎指正,但指出的问题直指 agent eval 的可信性:如果轨迹在评测前可被改写,评测结果的有效性存疑。

所属事件:Harbor 评测框架曝设计缺陷:agent 可篡改自身轨迹(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →