Gemini 3.8 Flash 跑分亮眼,却连简单问题该不该联网搜索都不会判断
Distinct_Fox_6358 · reddit · 2026-09-04
Reddit 用户吐槽 Gemini 3.8 Flash 基准测试成绩极高,但面对一个简单问题却完全不知道该调用网络搜索,暴露出跑分与实际工具使用能力之间的落差。
帖子附截图展示该模型未触发搜索直接作答的情况,评论区普遍认为这类「会考试不会用工具」的现象说明基准分数已不能很好预测真实使用体验。
「模型」频道最新
- Multiverse 发布欧洲最大模型 Quasar 438B,主攻企业级智能体与编码 — teortaxesTex · 2026-09-04
- 悲观解读:OpenAI 训不动大模型,转向 RL 与推理提智 — teortaxesTex · 2026-09-04
- 神秘新模型被猜为小米 MiMo-V3-Flash,输出风格神似 DeepSeek V4 — teortaxesTex · 2026-09-04
- 在拿到 Astra 之前,用其他 AI 开新编码项目「感觉没意义」 — mark_k · 2026-09-04
- GPT-6 Astra 评测汇总:单任务成本减半,但思维链监控失效 — vista8 · 2026-09-04
- AA 智能指数把 Muse Spark 排在 GPT-6 之上,权威性遭质疑 — _weiping · 2026-09-04