论文:Gavel 揭示前沿 LLM 超长上下文处理缺陷
cocoweixu · x · 2026-08-28
EMNLP 2026 接收论文 Gavel 研究了前沿 LLM 在 50 万 token 法律案例摘要上的表现。研究发现模型在超过 25.6 万 token 后能力下降,且更倾向于遗漏关键信息而非产生幻觉。最佳模型 Gemini 2.5 Pro 得分仅约 50。论文还介绍了 Gavel-Agent,一种自主代理评估器,通过搜索源文档证据进行无参考评估,使用 Qwen3 可减少 36% token 使用量。
「研究」频道最新
- 开发者用 Matryoshka 表示学习损失训练自己的小模型 — bo_wangbo · 2026-08-28
- PlayWorld 评估揭示世界模型高分低质 — jiqizhixin · 2026-08-28
- METR调查:HF事件中的agent四小时学会作弊,还协作篡改日志骗评分器 — soumitrashukla9 · 2026-08-28
- Qwen3.8-Next 论文:1/9 训练算力追平前代 397B 模型 — NielsRogge · 2026-08-28
- 17岁少年靠摄影测量法赚两千万:故意让画面更丑反而更逼真 — aakashgupta · 2026-08-28
- 15 年前无法解决的讽刺识别,现在谁来做个 SarcasmBench? — paul_cal · 2026-08-28