HUME 论文:人类在文本嵌入任务上表现优于 LLM

Muennighoff · x · 2026-08-20

新论文 HUME 提出了一个文本嵌入的人类评估框架。研究在 16 个 MTEB 数据集上测量了人类表现,发现人类平均得分为 77.6%,略低于最佳嵌入模型的 80.1%,但在低资源语言上模型表现不佳。此外,研究还用 9 个 LLM 作为标注器进行基准测试,发现尽管 LLM 具有可扩展性优势,但其表现(76.1%)仍低于人类(81.2%)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →