匿名竞技场再更新:flash-next 超 3.5 max,Gemini 3.1 pro 掉队
Tall_Abrocoma_3533 · reddit · 2026-09-08
匿名竞技场(隐去模型名的盲测排行)又更新了一版,作者 highlights 了几个看点:
- flash-next 表现强于 3.5 max
- Gemini 3.1 pro 排名明显落后
- 前沿阵营模型这次都参与了测试
盲测排名往往能暴露官方跑分之外的真人偏好差距,具体完整榜单见原帖。
「模型」频道最新
- 网友指控 OpenAI 向知名数学家施压要求配合造假被拒 — S_Conradi · 2026-09-09
- Magic 公布下一步路线:长上下文 RL、潜在知识对齐,之后发布模型 — magicailabs · 2026-09-09
- 45 万美元训练出前沿级法律模型 Thomson,数据策展成关键杠杆 — schwarzjn_ · 2026-09-09
- 爆料称 Anthropic 将在 9 月底 IPO 前发布 Fable 级新预训练模型 — teortaxesTex · 2026-09-09
- 网友称 GPT-6 Astra 跨领域通用性跃升,堪比 AGI — brandon_galang · 2026-09-09
- 开源 OUI-1 发布:4B 参数在生成式 UI 基准拿到 71.7% 超 Gemma 31B — iamrobotbear · 2026-09-09