单轮全过、整体 7.4% 翻车:多轮记忆丢失如何评测
Swimming_You_6475 · reddit · 2026-10-11
作者分享跨 4 个产品团队、12800 个 5 轮旅行会话(共 64000 轮)的评测发现:单轮相关度 97.6%,纸面很干净,但约 7.4%(947 个会话)会重新推荐用户早已拒绝的行程——因为压缩后的会话状态在第 4 轮前丢掉了「拒绝」这一信息,单轮评分完全看不到这种失败。
讨论重点:
- 会话级评分(session-level)可验证「拒绝」是否贯穿整个会话;轨迹评分(trajectory scoring)可在重新推荐发生时即时捕捉
- 难点:如何区分真正的偏好反转(合法的重新考虑)与丢失会话状态导致的失败,而不一刀切判为失败
- 作者向社区提问:大家如何区分真实偏好变化与跨轮状态丢失?
「编程与Agent」频道最新
- 开发者让 Grok 代理代读代回邮件,公开征集测试来件 — DanielLockyer · 2026-10-11
- 17 轮实测 Haiku 15 次输出格式崩坏,被指不敌 Luna — zeeg · 2026-10-11
- ToolUniverse 集成 2900+ 科研工具,助 AI Agent 跑蛋白质设计 — marinkazitnik · 2026-10-11
- 观察:个人智能体玩家都按赢家通吃押注,多人协作或成终局 — manosaie · 2026-10-11
- 把 e2e 测试搬上云端 VM:9 分钟 2 美分替代本地卡顿 — kevinkern · 2026-10-11
- Unblocked 用关系型上下文引擎替 RAG,实测省一半 token — AI Engineer · 2026-10-11