斯坦福论文:50 个样本即可评测音频大模型,HUMANS 基准开源
stanfordnlp · x · 2026-09-16
Stanford NLP 团队发布论文《Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment》,研究大型音频模型(LAM)的高效评测方法。
- 分析了 10 种子集选择方法、18 个音频模型、40 项任务,发现仅用 50 个样本(占数据 0.3%)即可与完整基准得分达到 0.93 以上的 Pearson 相关。
- 收集了 776 条真实语音助手对话的人类偏好评分,发现无论子集还是完整基准,与人类满意度的相关性都只有 0.85。
- 在精选子集上训练回归模型后,与人类偏好的相关性提升至 0.98,超过了随机子集和完整基准——「质量胜过数量」。
团队开源了回归加权子集,作为兼顾基准表现与用户偏好的高效评测代理(HUMANS benchmark)。
「研究」频道最新
- ChatGPT 联合发明人 stealth 两年后发布新模型 Jev:宣称快 20-200 倍、便宜 40-400 倍 — sedielem · 2026-09-16
- Latent Spacecraft 项目:用乔伊斯小说解读大脑与 GAN 的潜在空间 — begusgasper · 2026-09-16
- 对照实验:六边形架构反拖慢 Agent,扁平代码 6 项任务中 4 项更快 — kristiyanstoyanovAI · 2026-09-16
- CMU/MIT/斯坦福团队整理 Awesome-Loop-Models,综述论文在路上 — jiank_uiuc · 2026-09-16
- ARCADIA 论文结合单细胞测序与空间蛋白质组学解析组织环境 — elhamazizi · 2026-09-16
- 14 天长任务对比:人类越做越强超线性扩展,Agent 陷入对数曲线 — AlexGDimakis · 2026-09-16