京东开源JoyAI视频编辑模型,实现24帧实时流式修改
新智元 · wechat · 2026-08-07
京东开源 JoyAI-Video-Edit 模型,成为视频编辑赛道首个同时做到「流式架构+实时速度+可用质量」的模型。该模型在 720P 分辨率下推理速度达 30 帧每秒,支持任意时长的稳定流式编辑。
- 技术突破:采用 16B 参数多模态扩散 Transformer 架构,通过 SA-DMD 蒸馏方法将单帧迭代压缩至两步。结合「有界 KV 状态推理」限制记忆量,解决长视频自回归推理中的误差累积与画面漂移问题。
- 性能表现:在单张 B200 GPU 上端到端延迟仅 226 毫秒,吞吐量达 30.1 FPS。在 OpenVE-Bench 测试中总分达 3.60,不仅断层领先所有流式模型,甚至追平了 Runway Aleph 等主流离线商业模型。
- 应用场景:将「等渲染」的后期流程变为实时现场操作,可广泛应用于直播换装、实时风格化特效。此外,该模型还能将人手操作视频高效转换为机械臂训练数据,大幅缓解具身智能高质量物理交互数据稀缺的瓶颈。
「具身」频道最新
- 机器人自主制作暴风雪冰淇淋,五指灵巧手解决易碎杯身抓取难题 — Scobleizer · 2026-08-07
- 宇树科技被指依赖 MIT 开源代码,但其直销策略获赞 — kscottz · 2026-08-07
- 开源浏览器端 3D 机器人模型查看器:支持 URDF/MuJoCo — tom_doerr · 2026-08-07
- KiWear 智能戒指实测:化身万能遥控器,重塑 AI 交互 — 智东西 · 2026-08-07
- LeHome挑战赛亚军方案解析:VLA模型强化学习实战 — philfung · 2026-08-07
- 宇树科技传将以 90 亿美元估值 IPO — zephyr_z9 · 2026-08-07