Gemini 3.8 Flash 实测:数值推导强,边界用例与 checkpoint 表现拉胯
AnuranBuilds · x · 2026-09-03
PhyseraAI 在自家 TB 基准上评测 Gemini-3.8-Flash,分析 5 个随机任务后得出:
- 擅长推导并实现连贯的数值方法,能将自洽的数学模型转成可运行代码,尤其是存在可检验最优解时。
- 边界用例语义不一致:懂各个原语,但在规格存在交互性边界条件时组装顺序出错。
- 倾向于过度构建静态分析方案,却漏掉最难的覆盖用例。
- 长轨迹不代表更好结果,更多探索变成投机性范围膨胀。
转发的 AnuranBuilds 补充了自家一致发现:Gemini 能完成任务,但 checkpoint 质量随机,在做基于 checkpoint/序列的工作时被 Qwen 3.8 27B 等更小模型大幅碾压。
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03