RealCompanion 发布:120 天真实对话基准揭示 AI 记忆盲区
Quislab · hf · 2026-10-06
Hugging Face 上发布 RealCompanion 基准,测试 AI 伴侣对真实用户的长期理解。核心设计:
- 数据来自 10 段真实的人与 AI 伴侣关系,共 27,218 条消息、跨度最长 120 天,而非合成生成的人物与问题
- 每条标注均附推理链,逐步对照原对话核验
- 提供画像、人格、聊天真值与问题集四个派生文件
三个关键发现:
- 所需的过去信息「很少且很远」:近因窗口能覆盖 95.9% 探针所需消息,而需要记忆的探针仅 2.2%;供给全部记录证据带来的收益 96% 来自根本不需要证据的消息
- 没有现成检测器能在真实消息上判断何时需要调用记忆;人工标注会泄露线索,把同样消息标成记忆可使使用率提升 10-14 个百分点
- 三个 agent 系统重建人格的 F1 相同,成本却相差 31 倍
「研究」频道最新
- 光遗传学诺奖之争:被遗忘的真正发明人潘卓华 — _onionesque · 2026-10-06
- Kyutai 用何恺明团队 Drifting 方法训练 100M 端侧 TTS,WER 低于 1% — serrjoa · 2026-10-06
- 谷歌SHIFT按查询自动构建多智能体系统,准确率领先最强基线7.2点 — google · 2026-10-06
- 新研究诊断LLM数学短板:发现能力是最大瓶颈,可定向修复 — TexasAMUniversity · 2026-10-06
- RealtimeWAM:一步生成+异步推理,机器人动作模型提速25倍 — NanyangTechnologicalUniversity · 2026-10-06
- OmniConfess免训练缓解全模态幻觉,附3,540例新基准 — Huiqiang Rong · 2026-10-06