HUME 论文:人类在文本嵌入任务上表现优于 LLM
Muennighoff · x · 2026-08-20
新论文 HUME 提出了一个文本嵌入的人类评估框架。研究在 16 个 MTEB 数据集上测量了人类表现,发现人类平均得分为 77.6%,略低于最佳嵌入模型的 80.1%,但在低资源语言上模型表现不佳。此外,研究还用 9 个 LLM 作为标注器进行基准测试,发现尽管 LLM 具有可扩展性优势,但其表现(76.1%)仍低于人类(81.2%)。
「研究」频道最新
- 哈佛 MIT 发布 AI 生成数据估计与推断研究 — JeremyNguyenPhD · 2026-08-20
- Papers with Code 上线论文可视化,Excalidraw MCP 一句话生成交互图 — NielsRogge · 2026-08-20
- Epoch AI 发布交互式网络漏洞趋势探索工具 — scaling01 · 2026-08-20
- 复现 Recirculation 机制:零权重修改提升 GSM8K 17% — savvyRL · 2026-08-20
- 时间序列预测作为语言生成任务的相关专利获批 — flosalim · 2026-08-20
- 逆向工程揭示模型如何改变神经活动逃避监控 — Stefania_druga · 2026-08-20