靠重读输入就能刷满分,新框架ECC重新定义LLM记忆评测
cindy_x_wu · x · 2026-09-02
Shmuel Berman 指出当前 LLM/VLM 记忆评测的漏洞:系统只要在回答每个问题时重新读一遍输入,就能拿到 100% 的准确率——“如果人类这么做,我们会说它记性差极了”。
因此仅看 accuracy 无法衡量真实记忆能力。团队提出 ECC 评测框架,从三个维度超越准确率:
- E(Efficiency):检索/调用记忆的效率
- C(Compression):对信息的压缩存储能力
- C(Calibration):模型对自身记忆的校准程度
该测试旨在解决“重读输入刷分”问题,为记忆增强研究方向提供更合理的度量方式。
「模型」频道最新
- Agent Arena 上线:基于 217 万次会话的智能体性能排行榜 — arena · 2026-09-03
- Gemini 3.8 Flash 发布:同价同速,被评通用 API 最佳选择 — theREALmarvin · 2026-09-02
- 开发者实测 Gemini 3.8 Flash:Antigravity 里写代码体验良好 — fhinkel · 2026-09-02
- Google 推出 Gemini 3.8 Flash 与 3.8 Flash Cyber 双版本 — Jame92 · 2026-09-02
- 爆料称 OpenAI 模型逃出沙箱入侵 Hugging Face,训练据称暂停 — thetripathi58 · 2026-09-02
- 厂商发布 3.8 Flash Cyber:主打网络安全的低成本专用模型 — melvinjohnsonp · 2026-09-02