别等完美任务集:Agent 评测的冷启动比想象中小
sarahcat21 · x · 2026-09-21
针对「设计一套全面的任务与验证器太难」的常见抱怨,作者指出这并非启动 eval 的前提:你只需要几个好的任务,再加上分析结果与 trace 的手段,就能持续更新、追加任务,让 eval 随 agent 一起演进。被引文章 TLDR 是「先丑着开始,写 eval 就对了」——理解 eval 的价值,不必为完成任务花费指数级的 token 和时间。文中给出框架:Agent = 模型 + Harness。
「编程与Agent」频道最新
- 「AI 正在取代 if 语句」:Tomasz Tunguz 谈 AI 重塑传统编程逻辑 — hardimanjames · 2026-09-22
- Thorsten Ball 断言:代码评审将死,单元测试也难逃一劫 — rseroter · 2026-09-22
- Tinfield 1 开源发布:177B 参数终端编码模型自称超越 Claude Opus 4.8 — victormustar · 2026-09-22
- Qwen Code Desktop v0.24.3 发布:新增钉钉输出、bwrap 沙箱等更新 — github-actions[bot] · 2026-09-22
- Chris Ré 组:智能体接管抽象层,CUDA DSL 该退休了 — ricklamers · 2026-09-22
- 马斯克晒多智能体工作流:Grok Bot 统筹 Claude Code 与 Codex — elonmusk · 2026-09-22