Gemini CLI 增加议题分流评测框架与并行判分器
chadd28 · ghdev · 2026-07-25
为 google-gemini/gemini-cli 的 Caretaker Agent 议题分流管线补上了一套完整评测基础设施:
- 并行基准跑器:用 ThreadPoolExecutor + 隔离的 Git worktree 跑 golden issue 测试集,避免并发 checkout 互相干扰。
- LLM-as-a-Judge:通过 Gemini API,按 4 个维度、每项 0–2 分的 rubric,把预测出来的 Workable Specs 和 ground-truth Golden Specs 对比打分。
- 数据流与报告:从 Firestore 流式读取测试样本,通过 GitHub REST API 解析目标 commit SHA,并在 results/ 下输出结构化 JSON / Markdown 评分卡。
这条更像是 编码 Agent 评测工程 的具体实现,而不是单纯的功能说明。
「编程与Agent」频道最新
- 新模型实测:速度与性价比兼具的 Agent 主力 — doodlestein · 2026-07-25
- ExploitGym 发布:评估 AI 智能体能否实现真实漏洞利用 — dawnsongtweets · 2026-07-25
- 用 Cloudflare Access 为 AI 生成的工具加安全锁 — ritakozlov · 2026-07-25
- CTO 说自己在和 agent 开会,结果真是字面意思 — rohanpaul_ai · 2026-07-25
- Claude Opus 5 被指在 3D 编码测试上胜过 Fable 5 — rohanpaul_ai · 2026-07-25
- CTO 狂喜:让 AI Agent 替我开 Zoom 会议 — jacob_posel · 2026-07-25