观点:当前AI视频处理成本过高,急需原生视觉工具

JoelMahon · reddit · 2026-08-01

作者指出,当前多模态大模型在处理视频时依然笨拙且昂贵,普遍采用按固定频率(如每秒1帧)抽取图片转为 token 的方式。这种方式完全不同于人类视觉的“中心聚焦+周边低成本运动检测”机制,导致算力浪费且效率极低。

作者认为,在等待 AGI 到来之前,业界应优先提升模型的原生工具调用能力和外层调度框架。例如,简单的物体追踪不应依赖昂贵的全量视频解析或临时手写 Python 脚本,而应内建为低成本的基础工具。他甚至建议模型可以自动沉淀用户验证过的临时工具,供全局复用,避免反复造轮子。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →