用编码 Agent 做评测的三步法:聚类、标注、动态采样
HamelHusain · x · 2026-07-25
这条帖子分享了一个只靠 coding agent 就能启动评测的实用流程:
- 先把 traces 做聚类;
- 再搭一个自己的标注应用;
- 让 AI 实时监看标注过程,据此动态调整采样策略,并建议哪些新标注该接受或拒绝。
配图里的演示是一个标注工作流:左侧是 agent 对失败模式的分析与建议,右侧是用户在给样本做标注,系统会根据这些反馈继续更新后续该抽样什么、重点看什么。
「编程与Agent」频道最新
- ChatGPT Work agent 现在能登录网站并保留会话 — OpenAIDevs · 2026-07-25
- Codex 多智能体编排:Scout、Worker、Coordinator 分工协作 — pvncher · 2026-07-25
- 内部 CS Research Agent 已接入 GPT-5.6 与 Claude 模型 — BenBajarin · 2026-07-25
- LiteParse 2.8.0 去掉 ImageMagick,转 PDF 最快提速 7.2 倍 — llama_index · 2026-07-25
- Claude Opus 5 在 1/3 和 2/5 之间反复改答案 — Sauers_ · 2026-07-25
- Opus 5 适合异步长任务,四种智能体模式很实用 — RLanceMartin · 2026-07-25