Gemini 3.8 Flash 高配版 WeirdML v2 拿 84.8%,首超 Gemini 3.1 Pro
teortaxesTex · x · 2026-10-01
htihle 公布 Gemini 3.8 Flash (high) 在 WeirdML v2 基准上取得 84.8%,追平 GPT 5.5 (xhigh) 的水平而成本仅为其一小部分。这是首个在该基准上超过 Gemini 3.1 Pro(72.1%)的 Flash 版本。
关键改进在于对反馈的处理:不再像此前几代 Flash 那样反复坚持超时失败的臃肿 pipeline。作者还透露 Gemini 在 WeirdML v3 上与 K3 同簇(略高于它)、低于 V4.1,并猜测 V4.1 在 v2 上的成绩约在 79-81%。这可能是作者在 v2 上发布的最后一批结果,之后将专注 v2 与 v3 的交叉对比数据。
「模型」频道最新
- OpenAI 指控 Moonshot 相关人员主导提取其模型隐藏推理 — kimmonismus · 2026-10-01
- Burkov 周报第 180 期:小米开源 MiMo-V2.6、物理学家式剪枝 LLM 等 — burkov · 2026-10-01
- Perplexity 发布 pplx-embed-v2-context-9b,登顶 ConTEB 上下文嵌入榜 — perplexity_ai · 2026-10-01
- OpenAI 首次指控中国实验室蒸馏:4 天 1.6 万次请求窃取隐藏推理 — rohanpaul_ai · 2026-10-01
- KOL 观察:AI 领先权轮替快,网友对 OpenAI 的抱怨正重演 Anthropic 剧本 — haider1 · 2026-10-01
- 轻信 Gemini 报价,玩家给游戏服务器配音被反向收费 — Environmental_Ad3162 · 2026-10-01