NVIDIA 论文:任务越长模型越马虎,128K 长任务准确率平均降 62.8%

rohanpaul_ai · x · 2026-10-02

NVIDIA 新论文测试 7 个开源模型在简单重复任务(加数字、排序列表)上的长程可靠性,发现即使任务都在上下文窗口内,模型也会随任务变长而变马虎。

关键数据:

对 agent 工程的实操建议:给每个条目编号,把大任务拆成小批次,并对每行输出做校验。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →