减少反复澄清:CAPA 基准测试评估 AI 编码助手跨会话记忆
HKUST · hf · 2026-08-03
现有 AI 编码助手在处理包含歧义的用户指令时,往往需要反复询问以进行澄清。香港科技大学团队提出了跨会话个性化歧义适应任务,并发布了基准测试 CAPA。
- 核心思路:利用用户历史会话中已解决的歧义作为记忆,帮助 AI 在新会话中自动识别并适应用户特定的歧义模式,从而减少不必要的提问。
- 基准构成:CAPA 包含 600 个编码会话,覆盖 60 个均衡的用户-歧义组合,通过受控的三阶段生成管线注入 6 种歧义机制。
- 评估与方法:团队在无历史和同用户历史条件下评估了 12 个最新 LLM,并提出了一种轻量级的推理时方法——同用户历史门控(same-user history gating)。CAPA 为开发能更好理解用户意图、减少重复澄清的长期编码助手奠定了基础。
「编程与Agent」频道最新
- Agensis Works 大更新:直接 SDK 支持 Claude、Codex,优化 ACP 连接 — jasonkneen · 2026-08-03
- 开源项目Trading Skills:用Claude打造全语音交易助手 — tom_doerr · 2026-08-03
- MiniMax-H3 ComfyUI 模板:5 分钟极速部署视频生成 — _FriedEgg_ · 2026-08-03
- 让AI使用简明技术英语,开发者分享优化输出提示词技巧 — DanielLockyer · 2026-08-03
- 开源教育技能库:165个循证教学技能集成到Claude、Codex等 — tom_doerr · 2026-08-03
- 用 GPT 辅助开发 3D 射击游戏,线下试玩破百人 — WranglerObvious5932 · 2026-08-03