Delip Rao团队在COLM发布Autorubric统一LLM评测框架
Delip Rao团队在COLM 2026上发布论文《Autorubric: A Unifying Framework for Rubric-Based LLM Evaluation》,提出一个针对「不可验证任务」的rubric式LLM评测统一框架,面向从事评测工作的研究者。针对外界关于评分规则是全局的还是按样本生成的疑问,Delip Rao回应称框架两者均支持,既可使用全局评分规则,也可针对每个样本或问题单独生成rubric,展现出较强灵活性。
2026-10-09 ~ 2026-10-09 · 4 条相关
- Autorubric 登场 COLM 2026:统一框架解决不可验证任务的 LLM 评测 — deliprao · 2026-10-09
- Autorubric 支持全局与样本级评分规则,作者回应确认 — deliprao · 2026-10-09