Agent评测缺的不是榜单 而是可复现的轨迹与日志
seanwbren · x · 2026-09-23
围绕 agent 基准评测的可复现性讨论:科学界的黄金标准是共享可复现、可审计的实验数据——对 agent 评测而言,意味着每次试验的配置、轨迹、奖励与日志都应公开。ryanmarten 团队构建了开源工具 harbor 来简化这一流程。Unreal 的分析(与 Melissa Pan 近期固定模型、跨 harness 比较成本的工作相关)树立了范例:为每个结果上传了原始 harbor job,每个结果都可用单条 harbor 命令复现。seanwbren 补充指出,跨 harness 的评测对比一直是缺失环节。
「编程与Agent」频道最新
- 双模型分工:MatBrain 用 48 小时筛选 3 万个晶体候选材料 — bravo_abad · 2026-09-23
- Shopify CEO 强推 AI 后自曝遭反噬,「Slop Grenades」引发热议 — srchvrs · 2026-09-23
- Lovable 接入 Claude Opus 5.5 与 GPT-6 Sol 双模型 — AlexandrePesant · 2026-09-23
- 开发者吐槽:Agent 架构被 KV cache 绑架,盼推理专用芯片 — dbreunig · 2026-09-23
- 演讲预告:把智能体评测接入 CI/CD 流水线 — abeirami · 2026-09-23
- 用户实测 OpenAI 新模型:少做工具调用、更快完成任务 — mgostIH · 2026-09-23