南大 OneStreamer:4B 模型刷新全部八项流式视频理解基准
NJU · hf · 2026-10-02
南京大学团队推出流式视频交互模型 OneStreamer,统一感知、记忆与主动响应。核心设计:
- PHCM(主动分层字幕记忆):生成带时间戳的局部细节字幕与已完成事件摘要,推理时用模型自产记录替代回看历史视觉特征,兼顾实时感知与可复用事实记忆。
- PSTL(主动状态转换学习):在所有输出锚点保留监督并筛选代表性状态转换/持续 token,仅监督 27.5% 的标注状态 token 即超过密集监督。
- OneStreamer-1M:配套流式数据合成管线,构建超百万条记录的训练集。
4B 模型在全部八个流式视频理解基准上取得对比方法中最佳成绩,消融证明保留生成字幕可提升历史 QA 而不损害实时感知。
「多模态」频道最新
- AI 做商业级视频不手动改,但一条要互动改约 10 次 — AlchainHust · 2026-10-02
- Suno 推出 Speech 公测:配音与背景音乐可同步生成 — The Verge AI · 2026-10-02
- 免费也能生成视频:muse spark 1.3 在 opencode 实测表现不错 — light_2earth · 2026-10-02
- 创作者展示移动端视频特效界面:点按换特效、滑动换着色器 — TinfoilTricorn · 2026-10-02
- UniEvo-VL 让图像模型自我纠错,GenEval 从 74.7% 提到 80.8% — mark_k · 2026-10-02
- AI 生成「劳勃叛乱」粉丝预告片,网友直呼却更惋惜权游烂尾 — dioscuri · 2026-10-02