APM-Bench 发布:549 会话考流式视频助手的跨会话持久记忆
Jianguo Huang · hf · 2026-09-30
新基准 APM-Bench 针对流式视频个人助手提出跨会话持久记忆评测,将真实交互重新建模为多会话生命轨迹,包含 549 个会话、104 条轨迹、2719 个候选问题,覆盖客观与开放式两类题型。
核心挑战:现有基准多聚焦单条连续视频,忽略真实交互的间断性。持久记忆需可存储、选择性保留、适时注入且保持高效;当存储有限导致证据缺失时,助手还应主动承认证据不足。
评测发现:对通用视频模型与多种专用流式记忆系统在不同记忆协议下系统评测后,存在明显的效用-延迟-存储三方权衡——现有方法尚无法同时做到可靠长期召回、低开销和有效的跨会话主动辅助。
「研究」频道最新
- Astribot 发布 Lumo-2 技术报告:三阶段对齐训练,支持无动作标签学习 — CyberRobooo · 2026-09-30
- 全开源 VLA 模型 MolmoAct2 入选 CoRL 2026 Spotlight,性能比肩 π0.5 — jmin__cho · 2026-09-30
- 图像实验室登顶机器人榜:FLUX 3 Action 可微调上桌面机械臂 — lmoroney · 2026-09-30
- MIT 用拉曼光谱+AI 条码无创识别衰老「僵尸细胞」 — MacrinePhD · 2026-09-30
- Anil Seth 发文反对 AI 意识可能,大批回应随文合集刊出 — anilkseth · 2026-09-30
- 因果推断入门长文:跑模型前必须先懂的假设清单 — Nasereliver · 2026-09-30