Gemini 3.8 Flash 实测:数值推导强,边界用例与 checkpoint 表现拉胯

AnuranBuilds · x · 2026-09-03

PhyseraAI 在自家 TB 基准上评测 Gemini-3.8-Flash,分析 5 个随机任务后得出:

转发的 AnuranBuilds 补充了自家一致发现:Gemini 能完成任务,但 checkpoint 质量随机,在做基于 checkpoint/序列的工作时被 Qwen 3.8 27B 等更小模型大幅碾压。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →