靠重读输入就能刷满分,新框架ECC重新定义LLM记忆评测

cindy_x_wu · x · 2026-09-02

Shmuel Berman 指出当前 LLM/VLM 记忆评测的漏洞:系统只要在回答每个问题时重新读一遍输入,就能拿到 100% 的准确率——“如果人类这么做,我们会说它记性差极了”。

因此仅看 accuracy 无法衡量真实记忆能力。团队提出 ECC 评测框架,从三个维度超越准确率:

该测试旨在解决“重读输入刷分”问题,为记忆增强研究方向提供更合理的度量方式。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →