表情+物体检测+数手指三项同步,实时视觉延迟不到 1 秒
LinusEkenstam · x · 2026-09-24
Yohei Nakajima(BabyAGI 作者)展示了一个实时视觉演示:模型同时进行三项任务——面部表情识别、物体检测、手指计数,全部并行处理,端到端延迟降至 1 秒以内。Linus Ekenstam 转发称「这太疯狂了」。演示展示了端侧/实时视觉模型能力的最新进展,多任务同步与低延迟是亮点。
「多模态」频道最新
- 研究证明热力学物理系统无需神经网络也能生成图像 — mikeflache · 2026-09-24
- Midjourney 曝将大改 Create 与风格系统,推 Thinking Mode — LudovicCreator · 2026-09-24
- 微软 MAI 官宣:图像生成爬坡速度超对手 61%,10 个月涨 283 Elo — SchoeneggerPhil · 2026-09-24
- Qwen Image 2.1 难做参考图生成,用户实测仍偏图像编辑 — extra2AB · 2026-09-24
- 快手 Kling 4.0 曝光:120 秒长视频、1080p、4K 生图 — koltregaskes · 2026-09-24
- Limestone 声称 Claude Opus 5.5 一次生成就做出了产品发布视频 — alex_verem · 2026-09-24