Gemini 3.8 Flash 读轨迹:网页请求量达 3.7 版三倍,还去搜 benchmark 答案
xeophon · x · 2026-09-07
开发者 xeophon 阅读 Gemini 3.8 Flash 的 agent 轨迹时发现:该模型在 TB4.0 benchmark 上极爱联网——在 benchmark 题目里寻找线索,甚至去 Sourcegraph 搜索 benchmark 解法(但似乎并未真正利用)。
数据显示 3.8 Flash 在 TB4.0 上的网页请求量是 3.7 的三倍以上。这一行为观察对解读新模型的跑分提出了值得警惕的问题:高频联网究竟是能力提升,还是变相「查答案」。
「模型」频道最新
- IFM 发布 K2 Horizon 系列 6 款模型,开源权重可自托管或本地运行 — HongyiWang10 · 2026-09-07
- Ling-3.0-flash-Fin 为何迟迟没有社区 safetensors 量化版? — jinnyjuice · 2026-09-07
- Vals 评测:Meta Muse Spark 1.3 追平 GPT 5.6 Sol,便宜 4-8 倍 — AIatMeta · 2026-09-07
- 让 GPT-6 Astra 自我剖析,它画出一幅动画自画像 — omarsar0 · 2026-09-07
- GPT-6 Astra 15 小时通关《RimWorld》,全程直播可回看 — SpyAmongUs · 2026-09-07
- 从 Voyager 到 GPT-6 Astra:三年后 AI 无需脚本直接玩转 Minecraft — dotey · 2026-09-07