观点:当前AI视频处理成本过高,急需原生视觉工具
JoelMahon · reddit · 2026-08-01
作者指出,当前多模态大模型在处理视频时依然笨拙且昂贵,普遍采用按固定频率(如每秒1帧)抽取图片转为 token 的方式。这种方式完全不同于人类视觉的“中心聚焦+周边低成本运动检测”机制,导致算力浪费且效率极低。
作者认为,在等待 AGI 到来之前,业界应优先提升模型的原生工具调用能力和外层调度框架。例如,简单的物体追踪不应依赖昂贵的全量视频解析或临时手写 Python 脚本,而应内建为低成本的基础工具。他甚至建议模型可以自动沉淀用户验证过的临时工具,供全局复用,避免反复造轮子。
「漫话AGI」频道最新
- AI 擅长为数学猜想找反例?算力暴力搜索或重塑证明 — skdh · 2026-08-01
- Reddit 长文探讨:非编程类 AI 智能体用例为何大多不靠谱 — chkbd1102 · 2026-08-01
- AI Agents与闭包:当后台智能体成为常态 — rudrank · 2026-08-01
- 分析师称传统金融正加速向机器人货币与互联网转型 — LexSokolin · 2026-08-01
- 从苏格拉底到 AI:人类跨越千年的技术焦虑 — hrdblkman2 · 2026-08-01
- AI 将颠覆科研范式:未来做研究会更像永远的大一新生 — BlackHC · 2026-08-01