研究发现新类长上下文任务难度随语料二次方增长,颠覆 LCLM 架构共识
xiye_nlp · x · 2026-09-29
研究者 Prasann Singhal 发布线程,探讨长上下文架构能否在科学文献中「找出所有矛盾」——答案是还不能。
- 团队定义了一类新的「高复杂度」任务:其难度随语料库规模二次方增长,而非常见的线性增长
- 这一发现颠覆了长上下文语言模型(LCLM)研究中若干常见设计决策,包括 block-sparse attention 和混合模型等架构选择
- 核心问题:跨海量文献找全部矛盾,本质是组合式比对任务,现有长上下文架构并非为此设计
「研究」频道最新
- AWS 工程师手搓 2B「系统一」决策模型,登顶仅 24 小时被反超 — ShadajL · 2026-09-29
- JevBench 测试用例扩至六倍,旋转私测集严打 benchmaxxing — airesearch12 · 2026-09-29
- 在家用 4 张 V100 直播后训练 80B 模型:96 小时蒸馏 3340 条数据 — jjusko20 · 2026-09-29
- 研究称抹香鲸对话中主动交换元音,交流或更具组合性 — begusgasper · 2026-09-29
- NVIDIA 研究员 ICRA'26 演讲:人类数据是机器人基础模型最可扩展的数据源 — yukez · 2026-09-29
- Prime Intellect RL 栈升级:支持多智能体系统训练与评估 — willcb · 2026-09-29