技术分析:V4-Flash 采用多裁剪机制构建融合视觉表示

teortaxesTex · x · 2026-08-22

针对 V4-Flash 模型的视觉处理机制进行了分析。该模型在长视距强化学习循环中,通过多裁剪和变换图像来形成对场景的统一理解,其极端图像压缩上限为每次瞥视 387 个 token。这种“中央凹视觉”方法使得模型能够“看”而不仅仅是“看见”,并深度融合了动作与视觉事件的概念。评论认为非实验版将更侧重视频序列的提取与推理。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →