论文:Gavel 揭示前沿 LLM 超长上下文处理缺陷

cocoweixu · x · 2026-08-28

EMNLP 2026 接收论文 Gavel 研究了前沿 LLM 在 50 万 token 法律案例摘要上的表现。研究发现模型在超过 25.6 万 token 后能力下降,且更倾向于遗漏关键信息而非产生幻觉。最佳模型 Gemini 2.5 Pro 得分仅约 50。论文还介绍了 Gavel-Agent,一种自主代理评估器,通过搜索源文档证据进行无参考评估,使用 Qwen3 可减少 36% token 使用量。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →