Pairscore:让 LLM 打分多项比独立评估更能校准不确定性
yeewhye · x · 2026-10-03
作者 haritv 将参加 COLM 2026、Simons Institute 可信 AI 研讨会及前沿数据峰会,展示 Pairscore——一种改进 LLM 口头化不确定性(verbalised uncertainty)的简单方法。核心发现:让模型一次对多个候选项打分,比让模型独立逐项评估或做两两比较、排序,能得到更好的校准效果。作者还介绍 Paperena,用于应对论文洪流的 AI 辅助研究工具。
「研究」频道最新
- DeepMind 研究员谈 LLM 数学突破:符号与神经网络的边界之争 — AndrewLampinen · 2026-10-03
- GraphRAG 六种架构模式实战指南:从 Text-to-Cypher 到稀疏图省钱方案 — nilukush · 2026-10-03
- 一次航班写出最小化 on-policy 蒸馏配置,聚焦训练工程化实现 — bclavie · 2026-10-03
- Schmidhuber 甩出三篇论文回应质疑:创造力形式理论早有伏笔 — SchmidhuberAI · 2026-10-03
- Projection sampling:让 SFT 学新能力而不遗忘旧技能的数据变换框架 — burkov · 2026-10-03
- Grok 4.7 在 Cursor 里算出球面巡检最短航线的数值候选解 — xiaosun86 · 2026-10-03