新基准 CL-Bench:评估前沿 AI 的持续学习能力
tokenbender · x · 2026-08-13
论文提出了 Continual Learning Bench (CL-Bench),这是首个旨在评估 LLM 智能体能否通过序列经验真正提升能力的高质量基准。
- 涵盖领域:包含软件工程、信号处理、疾病预测、数据库查询、策略游戏和需求预测等 6 个领域,任务设计要求系统发现潜在的共享结构。
- 实验发现:当前前沿模型在持续学习上仍有不足,经常过拟合于近期观察或无法跨实例复用知识。此外,专门的记忆系统并未解决该问题,甚至表现还不如简单的上下文学习 (ICL)。
所属事件:伯克利推出 CL-Bench:评估大模型持续学习能力(2 条相关)→
「研究」频道最新
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- AI 假记忆:为何模型越用越错,真记忆需遗忘 — PrajwalTomar_ · 2026-08-24