腾讯发布 ElephantBench,探测长尾知识下的 LLM 认知盲区
tencent · hf · 2026-08-31
腾讯发布 ElephantBench,旨在评估大语言模型是否保留长尾事实的多种冲突叙述。该基准通过基于图的管道生成可验证的多叙述问题,揭示了模型在长尾知识下普遍存在的认知不完整性。
「研究」频道最新
- 整理编程语言与机器学习 YouTube 学习歌单 — Aiden_Tech_Ai · 2026-08-31
- 盘点 30 个涵盖编程 AI 设计的免费学习网站 — Aiden_Tech_Ai · 2026-08-31
- 研究指出长时智能体安全无法由短时轨迹保证 — rohanpaul_ai · 2026-08-31
- AI 微调作者风格能骗过检测器,引发版权担忧 — TuhinChakr · 2026-08-31
- 如何看待模型:偏好、倾向与 RL 的拉伸作用 — voooooogel · 2026-08-31
- StepGuard:通过平衡学习实现 Agent 步级防护 — AI45Research · 2026-08-31