腾讯发布 ElephantBench,探测长尾知识下的 LLM 认知盲区

tencent · hf · 2026-08-31

腾讯发布 ElephantBench,旨在评估大语言模型是否保留长尾事实的多种冲突叙述。该基准通过基于图的管道生成可验证的多叙述问题,揭示了模型在长尾知识下普遍存在的认知不完整性。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →