本地模型视觉追踪仅 3Hz,距实时智能体还有一年?

yacineMTB · x · 2026-09-08

Sentdex 引用 LearnOpenCV 的实测指出:用 GPT-6 Astra Ultra 追踪网球的完整工作流耗时 11 分 49 秒、共消耗约 787 万 tokens(含 752 万缓存输入),单靠 3 个并行 agent 标注球体就花了 8 分 35 秒。他估计当前本地模型(GLM 5.3 Flash、Qwen Next Flash、DSV4F-vision 等)做追踪+推理只能达到约 3Hz,距离以 10-30Hz、低于 200ms 延迟运行「Astra 级」智能体大约还差一年。核心启示:视觉智能体的瓶颈不在单帧智力,而在推理延迟与上下文 token 成本。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →