Agent评测缺的不是榜单 而是可复现的轨迹与日志

seanwbren · x · 2026-09-23

围绕 agent 基准评测的可复现性讨论:科学界的黄金标准是共享可复现、可审计的实验数据——对 agent 评测而言,意味着每次试验的配置、轨迹、奖励与日志都应公开。ryanmarten 团队构建了开源工具 harbor 来简化这一流程。Unreal 的分析(与 Melissa Pan 近期固定模型、跨 harness 比较成本的工作相关)树立了范例:为每个结果上传了原始 harbor job,每个结果都可用单条 harbor 命令复现。seanwbren 补充指出,跨 harness 的评测对比一直是缺失环节。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →