DeepSeek 视觉模型实测:自主填表但存在位置偏移问题
teortaxesTex · x · 2026-08-22
测试者对 DeepSeek 新发布的视觉模型进行了表单填写测试,任务是基于截图自行定位并填充元素,不提供坐标或 DOM 结构。
测试过程与结果:
- 任务:仅通过图像信息,识别表单字段并模拟点击/输入。
- 表现:模型能够探测位置、自我截图、放置元素并微调位置,最终填写了所有字段并在提交前进行了自我验证。
- 耗时与消耗:耗时 5 分 48 秒,输入 28.8 万 tokens,输出 3.8 万 tokens。
缺陷:
- 勾选框的标记位置落在框旁而非框内。
- 输入较长字符串时,字符框会出现漂移。
技术点评:评论指出该模型采用了“中央凹视觉”(Foveated Vision)策略,每次浏览最多使用 387 个 token,旨在“看”而非“看见”。预计非探索版将更偏向视频处理,提取序列并进行推理。
「多模态」频道最新
- ZastTranslate 发布:支持30语言的本地视频翻译与语音克隆 — cocktailpeanut · 2026-08-22
- Minimax H3 生成的一分钟滑冰视频惊艳全场 — cocktailpeanut · 2026-08-22
- Runway 推出 Ruby 模型支持视频转 HDR — Uncanny_Harry · 2026-08-22
- Text-to-CAD 演示:AI 生成完整装配动画 — jakedahn · 2026-08-22
- 观点:AI 时代音乐创作只需品味而非数年训练 — thisguyknowsai · 2026-08-22
- AI 生成警匪剧:侦探 Dick Snifford 首集上线 — venturetwins · 2026-08-22