NVIDIA 论文:任务越长 AI 越马虎,128K 长任务准确率降 62.8%

NVIDIA 发布新论文,测试 7 个开源模型在加数字、排序列表等简单重复任务上的长程可靠性,并提出 Long-Transduction 评测设定,要求模型在数千个输出上持续读取并更新依赖状态。结果显示,即使任务全部处于上下文窗口内,模型也会随任务变长而变得马虎:当上下文从 4K 增至 128K 时,长任务平均准确率下降 62.8%,凸显长时间运行 agent 的可靠性隐患。

2026-10-02 ~ 2026-10-02 · 2 条相关