NVIDIA 论文:任务越长模型越马虎,128K 长任务准确率平均降 62.8%
rohanpaul_ai · x · 2026-10-02
NVIDIA 新论文测试 7 个开源模型在简单重复任务(加数字、排序列表)上的长程可靠性,发现即使任务都在上下文窗口内,模型也会随任务变长而变马虎。
关键数据:
- 128K token 任务的平均准确率比 4K token 任务低 62.8%
- 最强的模型在最长任务中也只有 17.1% 的比例做到每一条都全对
- 模型似乎理解任务但会"丢位置",在条目没有编号时尤其严重
对 agent 工程的实操建议:给每个条目编号,把大任务拆成小批次,并对每行输出做校验。
「编程与Agent」频道最新
- Arena.ai 发布 HarnessTax:编码 Agent 的 harness 到底影响多大 — solyarisoftware · 2026-10-02
- 伯克利论文:LLM 记得你的新指令却仍用旧选择 — rohanpaul_ai · 2026-10-02
- 1565 封邮件实测:Perplexity 与 Cloudflare 决策模型比拼 — michellechen · 2026-10-02
- Codex 用 FreeCAD MCP 逐级模拟 JWST 遮阳板展开全过程 — burhop · 2026-10-02
- 模型权重不动,Harness 自进化:Terminal-Bench 成绩 47.57 升至 52.43 — jiqizhixin · 2026-10-02
- 实测 OpenAI Dots:主动式 AI 管家新范式,但延迟高 UX 未成熟 — cedric_chee · 2026-10-02