LLM评测工具AutoRubric入选COLM 2026:把量表科学引入LLM-as-a-Judge
deliprao · x · 2026-09-21
Delip Rao 转介的 AutoRubric 项目被 COLM 2026 接收。它把量表(rubric)科学的最佳实践与 LLM-as-a-Judge 研究结合,用于非可验证领域的结构化评测:既可评估 LLM 生成内容,也可用 LLM 给人工内容打分。
- 做法:定义带权重的评测标准(含扣分项,如「错误声称 LFP 能量密度更高则 -15 分」),对照人类标注校验并迭代 rubric,内置 meta-evaluation。
- 示例:给出了用 CriterionGrader 评比较 NMC 与 LFP 电池正极材料答案的完整 Python 代码,模型用 openai/gpt-5.1-mini。
- 提供开源库 autorubric、Cookbook 与研究文档,团队将在 COLM 2026 旧金山现场展示。
所属事件:研究者指 TypeSafe 的 Jev 抄袭其 AutoRubric 论文抽象(3 条相关)→
「编程与Agent」频道最新
- evmscope MCP 服务器上线:20 个工具覆盖 5 条 EVM 链 — modelcontextprotocol · 2026-09-21
- Latent Space 让 AI agent 对战刷 Elo 并用 x402 交易信用点 — modelcontextprotocol · 2026-09-21
- ChatGPT 联创新作 Jev:不靠长 LLM 回复做批量决策 — DrDatta_AIIMS · 2026-09-21
- Qwen3.8-Flash-Next 本地 3 小时自写自调出一个 3D 太空射击游戏 — Thin_Pollution8843 · 2026-09-21
- ττ-bench:最强 coding agent 仅过 23.9% 客户模拟 — rohanpaul_ai · 2026-09-21
- 开发者上线 Made With Jev 目录站,汇总模型演示、工具与 Skills 资源 — Sea_Supermarket_5891 · 2026-09-21