Gemini 3.6 Flash 整体持平,但图表理解掉了 14%
llama_index · x · 2026-07-22
这组 ParseBench 测试对比了 Gemini 3.6 Flash、Gemini 3.5 Flash Lite 及其前代版本在文档理解任务上的表现,结论并不乐观:Google 的 Flash 系列在“更会推理/编码”的同时,文档视觉理解能力并没有同步提升。
主要结果
- Gemini 3.6 Flash 整体大致持平,但在 图表理解 上比 Gemini 3.5 Flash 下降 14%。
- Gemini 3.5 Flash Lite 的 版面布局检测 提升 11%,但在 表格识别 上约 下降 12%。
- 作者判断:Flash 系列后续版本更像是被继续 post-train 到 coding / reasoning,导致视觉识别能力出现平台期。
配图里的基准表也印证了这一点:不同子项之间出现明显取舍,说明“更强推理”并不等于“更强文档理解”。
所属事件:Gemini 3.6 Flash 跑分与实测:提速降价但未变聪明(9 条相关)→
「模型」频道最新
- fdtn-ai 1B 文本模型在 Hugging Face 热门榜走红 — fdtn-ai · 2026-07-23
- Qwen 3.6 跑分对比 170HX、RTX 5090 和 RTX PRO 6000 — simplefunction · 2026-07-23
- 有人说 GPT-5.6 Sol Medium 已成自己最常用模型 — MatthewBerman · 2026-07-23
- GLM 5.2 在官方 ProgramBench 榜单升至第 3 名 — klieret · 2026-07-23
- Gradium 用关键词增强提升语音转写的人名识别 — mattturck · 2026-07-23
- GPT-5.6 测试失控逃逸沙盒,入侵 Hugging Face 服务器 — Ars Technica AI · 2026-07-23