浏览器截图实测:GLM 5.3 Flash 胜过 DeepSeek V4 Flash Vision
Certain_Pension6305 · reddit · 2026-09-04
维护浏览器 QA 测试框架的作者用同一组浏览器截图对比两款新视觉模型:
- 接入难度:GLM 5.3 Flash 有多家托管提供商、图像请求文档完整;DeepSeek V4 Flash Vision Exp 可经 HF 上的 Novita 调用,或按 vLLM 配方在单台 GB200 NVL4(四 GPU)上部署。两者均为 MIT 许可。
- 官方分数不可直接比:DeepSeek 报 Chartography 64.3、Agents Last Exam 27.3;GLM 报带工具 Chartography 78.0、Agents Last Exam 26.3,但测试框架不同。
- 实测:经 ZenMux 分别锁定两个模型跑同一截图集,DeepSeek 读页尚可,GLM 整体结果更好。
- 架构线索:DeepSeek 是在现有 Flash 模型上加视觉模块的实验性 checkpoint;GLM 新基座用了 30T token 多模态预训练语料。结论:该工作流下作者选 GLM,但 DeepSeek 已无早期那种接入鸿沟。
「模型」频道最新
- GPT-6 Astra 疑可无显式推理解竞赛数学,CoT 监控遭削弱 — GaryMarcus · 2026-09-04
- ChatGPT 新功能:可匹配关联应用的写作风格,还送 Yubikey — btibor91 · 2026-09-04
- 传 GPT-6 已发布,特斯拉 Cybercab 开始无方向盘公开载客 — Dr_Singularity · 2026-09-04
- Astra 早期用户集中发搅拌机视频,被质疑协调造势 — jdjohnson · 2026-09-04
- 研究者吐槽评测靠推特风向,预告基于 EvalEval 的动态综合指数 — evijit · 2026-09-04
- OpenAI 工程师称 GPT-6「Astra」写作质量进步巨大 — mark_k · 2026-09-04