LLM 评测不可靠?新框架提升 30% 人类一致性
dair_ai · x · 2026-08-30
构建 LLM 评判员(LLM-as-a-Judge)具有挑战性。新研究提出了一个基于真人对话的参考基准,包含 3 万余轮专家生成的回合和 3.6 万条人类标注。结果显示,面对专家级判断时,经典的自动指标和无参考的 LLM 评判方法都显得不可靠。研究者提出的「混合评判员」框架通过组合多种评估信号,将与人类评估的相关性提升了约 30%。
「研究」频道最新
- NeurIPS 2026 资源感知 Agent 研讨会征稿截止 — lupantech · 2026-09-01
- 讨论拟人化描述 AI 的利弊与隐喻价值 — AndrewLampinen · 2026-09-01
- UCLA 张恺伟分享 AI for Math 进展与经验 — kaiwei_chang · 2026-09-01
- Fal H3 Max 实现超实时无限视频生成,Agent 基础设施快速迭代 — Latent Space · 2026-09-01
- M1 Max 30秒生成新药分子,LiteMol模型演示低成本药物发现 — CatAstro_Piyush · 2026-09-01
- 用回滚实验证明 Agent 真学习而非运气 — go_kul_07 · 2026-09-01