MINTEval 入选 NeurIPS:LLM agent 难跟上持续变化的环境
EliasEskin · x · 2026-10-02
MINTEval 评测基准被 NeurIPS 2026 接收,考察 LLM agent 与记忆系统在长程、持续变化环境(Wikipedia 页面、Git 仓库等)中的表现。基准特征:
- 平均 86 次上下文更新与新旧信息干扰,5 类难题(含长程回溯、跨多处目标推理)
- 4 个真实领域:状态追踪、多轮对话、Wikipedia 修订、GitHub 提交
- 平均 13.88 万 token/实例(最高 180 万),人工验证 QA 准确率 95.6%
结论:模型普遍难以追踪变化、召回精确细节、整合相互冲突的更新。模型常混淆新旧信息,记忆系统倾向插入冗余条目,检索经常无法恢复正确信息,根源在于检索与记忆构建能力的局限。
「编程与Agent」频道最新
- Comfy Agent 上线 Comfy Cloud:AI 自动规划、搭建并修复工作流 — cpaik · 2026-10-02
- 自建 Agent Harness:真正决定成败的往往不是模型 — ghumare64 · 2026-10-02
- 对着 Claude Code 权限弹窗怒喊:我全允许,Bash(*)! — Daniel_Farinax · 2026-10-02
- Prime Intellect 开放后训练全栈:Extropic 借此定制 RL 模型 — beffjezos · 2026-10-02
- 用 Agent Platform Memory Bank 打造有记忆的智能体 — rseroter · 2026-10-02
- 8 个开源 AI Agent 工具盘点:从操作电脑到自动抓取网站数据 — Aiden_Tech_Ai · 2026-10-02