DeepSeek 视觉模型实测:自主填表但存在位置偏移问题

teortaxesTex · x · 2026-08-22

测试者对 DeepSeek 新发布的视觉模型进行了表单填写测试,任务是基于截图自行定位并填充元素,不提供坐标或 DOM 结构。

测试过程与结果:

缺陷:

技术点评:评论指出该模型采用了“中央凹视觉”(Foveated Vision)策略,每次浏览最多使用 387 个 token,旨在“看”而非“看见”。预计非探索版将更偏向视频处理,提取序列并进行推理。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →