NVIDIA 论文:上下文从 4K 涨到 128K,长任务模型准确率暴跌 62.8%
dair_ai · x · 2026-10-02
NVIDIA 发布针对长时间运行 agent 的论文,提出 Long-Transduction 评测设定:要求模型在数千个输出上持续读取、更新并输出依赖状态的结果,并独立变化三个因素来定位长任务出错原因。
核心发现:
- 在七个开源权重模型上,上下文从 4K 扩到 128K 时准确率下降 62.8%;
- 仅改变输入格式就导致 36.5% 的下降;
- 单步操作变难导致 39.9% 的下降。
这说明即使模型标称支持 128K 上下文,任务进行越久、状态越多,错误率越高——agent 在处理长表格或账本中途「丢位置」的现象可以归因到这些具体因素。
所属事件:NVIDIA 论文:任务越长 AI 越马虎,128K 长任务准确率降 62.8%(2 条相关)→
「编程与Agent」频道最新
- 开发者:不敢让 AI Agent 直连个人邮箱,需审批门禁 — tomchapin · 2026-10-03
- 用 Claude 搭线下房产抢单流水线,卡在数据补全与外联安全 — italimade · 2026-10-03
- OpenClaw 发布 v2026.9.8:支持 GPT-6.1 Sol,43 个 PR 修复内存与启动问题 — heyneighbor · 2026-10-03
- 开发者感慨:用 AI 做提效元工具,从 bash 脚本变成完整应用 — devenbhooshan · 2026-10-03
- 开源 AI 科研助手 K-Dense BYOK 发布论文:本地运行+防篡改实验记录 — RexDouglass · 2026-10-03
- 谷歌论文:验证者干净上下文跑证明,探索者可放手试错 — solyarisoftware · 2026-10-03