给编码 Agent 做评测的实用流程:代码库、trace 和用户反馈
EdenEmarco177 · x · 2026-07-23
这条帖在讲 coding agent 的评测流程:先把代码库和真实 traces 喂给 agent,再和用户一起迭代评测方向,用 Harbor 构建 eval,跑评测、看结果、再继续循环。
流程
- 给 coding agent 提供代码库和真实 traces
- 和用户一起确定该怎么评测
- 用 Harbor 搭建 eval
- 运行评测并查看结果
- 根据反馈继续迭代
「编程与Agent」频道最新
- 80 个模型评测在裁决前全被 429 配额卡住 — zeeg · 2026-07-23
- Hermes 桌面端支持多窗口并行运行多个 Agent — Teknium · 2026-07-23
- 一款新应用可同时用多模型生成 2 到 10 个原型 — alexmacgregor__ · 2026-07-23
- Claude Code CLI 支持崩溃后自动续跑工作流 — arthurcolle · 2026-07-23
- Moonshot 前工程师 RC 推出 Raft 1.0:把 AI agents 放进一个工作区 — CodeByPoonam · 2026-07-23
- 一个 Rust 词云生成器被优化到 16 毫秒,虽然并没必要 — minimaxir · 2026-07-23