UCSC 提出预测驱动平滑估计,让分域 AI 评测用更少标注更准
UCSantaCruz · hf · 2026-09-22
UC Santa Cruz 团队针对 AI 系统分域评测(不同基准任务类型、部署智能体的对话类型等)中标注样本有限导致估计不准的问题,提出基于小区域估计 (small area estimation) 的完整工作流。
- 估计:提出 prediction-powered smoothing (PP-S),对每个域的 prediction-powered 估计拟合贝叶斯模型;扩展版 PP-TS 借助报告分类体系跨域借力。
- 验证:推导出一个近似无偏的基于设计的交叉验证评分,用于在直接估计量与平滑估计量之间选择。
- 实验:在两个每个结果均可观测的评测集上验证——一个带可验证评分的精选基准,以及由人工评级的部署智能体真实流量。提出的估计量在点估计和区间估计上都优于直接估计量,覆盖率接近名义水平。
- 结论:同样抽样预算下,该评分的选择效果与独立验证样本相当,且对所选估计量误差的估计精确得多。
「研究」频道最新
- 学者质疑数学「开放」叙事:NSA 曾秘藏差分密码分析 17 年 — lpachter · 2026-09-22
- 博主发布群论×深度学习几何博客,含可交互「实验室」球面可视化 — CatAstro_Piyush · 2026-09-22
- Qonto 开源 FAQ 检索新基准:更贴近真实产品问答场景 — espadrine · 2026-09-22
- 播客深谈前沿 AI 未来:机器人、中国模型差距与开源安全 — natolambert · 2026-09-22
- 罗福莉复盘小米 MiMo-V2.6:单步生成 2.5 万条 Agent 轨迹 — bookwormengr · 2026-09-22
- 机器人公司破局之道:先部署再用协同感知补能力短板 — broodsugar · 2026-09-22