Gradle 自建 eval 框架实测两 Agent 修同一 bug,Astra 6 更快更省
Party_Till_I_Die · reddit · 2026-09-10
Gradle 工程师分享自研 eval harness,用于验证某个 skill 或 Gradle 代码/文档改动是否真的能提升 coding agent 的表现。作者用它对比了 Fable 5.1 和 Astra 6 处理同一个 Gradle GitHub issue:两个模型都成功修复,但 Astra 6 速度更快、成本更低。博客附完整 diff、成本和 token 统计等数据,还展示了如何系统化地评测「改动是否对 agent 有效」这一工程实践。
「编程与Agent」频道最新
- K3 优化 mjwarp 内核提速 77%,GPT-6 再优化仅 0.38% — YouJiacheng · 2026-09-10
- K3 优化 mjwarp 内核提速 77%,GPT-6 Astra 再优化仅 0.38% — YouJiacheng · 2026-09-10
- 同一份异步程序七种输出:Async/Await 跨语言差异远超预期 — IanArawjo · 2026-09-10
- 开发者感叹:模型越聪明,要审的 AI 生成 PR 也越难跟上 — smlpth · 2026-09-10
- Automattic 推 agent 即时托管 here.now,3 秒发布已承载 50 万站点 — iannuttall · 2026-09-10
- mitsuhiko 实测 Google Astra:很惊艳,但还不敢用于日常工程 — mitsuhiko · 2026-09-10