反向数据:Gemini 3.8 Flash 在 warden bench 上性价比垫底
zeeg · x · 2026-09-04
与好评形成反差,开发者 grichadev 实测发现 Gemini 3.8 Flash 在 warden bench 上表现不佳,按「成本/发现数」口径衡量是表现最差的模型。
他认为这是检验模型实际应用效果的试金石,并提到本想测试更擅长的 Flash cyber 版本,但该模型仍处于门控状态无法访问。
「模型」频道最新
- 爆料称 GPT-6 Astra ARC-AGI-3 得 98.6%,多项基准领跑 — yuwen_lu_ · 2026-09-04
- 研究者感叹:没料到 ARC AGI 3 分数能这么高 — rand_longevity · 2026-09-04
- Meta 长上下文 MRCR 被指刷分:1k 样本可从 60% 提到 90%+ — eliebakouch · 2026-09-04
- 曝 OpenAI 推 GPT-6 Astra:先供网安客户,Brockman 称「欢迎来到 AGI 时代」 — rohanpaul_ai · 2026-09-04
- OpenAI GPT-6 Astra 限量首发网安客户,定价 2.5 倍于前代 — rohanpaul_ai · 2026-09-04
- GPT-6 Astra 定价曝光:输入 $10/M,输出 $50/M,将弃用压缩技术 — koltregaskes · 2026-09-04