NVIDIA 论文:上下文从 4K 涨到 128K,长任务模型准确率暴跌 62.8%

dair_ai · x · 2026-10-02

NVIDIA 发布针对长时间运行 agent 的论文,提出 Long-Transduction 评测设定:要求模型在数千个输出上持续读取、更新并输出依赖状态的结果,并独立变化三个因素来定位长任务出错原因。

核心发现:

这说明即使模型标称支持 128K 上下文,任务进行越久、状态越多,错误率越高——agent 在处理长表格或账本中途「丢位置」的现象可以归因到这些具体因素。

所属事件:NVIDIA 论文:任务越长 AI 越马虎,128K 长任务准确率降 62.8%(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →