斯坦福论文:50 个样本即可评测音频大模型,HUMANS 基准开源

stanfordnlp · x · 2026-09-16

Stanford NLP 团队发布论文《Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment》,研究大型音频模型(LAM)的高效评测方法。

团队开源了回归加权子集,作为兼顾基准表现与用户偏好的高效评测代理(HUMANS benchmark)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →