开源模型横评:Gemma 31B 性能超越 DeepSeek V4 与 Qwen
Afinetheorem · x · 2026-09-02
针对文本分类任务的实际测试显示,Google 的 Gemma 31B 在表现上轻松击败了 DeepSeek V4 Flash 和 Qwen 3.5 122B,且体积更小、速度更快。作者进一步指出,在自建的视觉+逻辑基准测试和上下文逻辑测试中,Gemma 31B 均表现优异,而 Qwen 3.5 27B 在 60 多个测试模型中表现最差,引发了关于部分中国模型在特定任务上“Benchmark 过拟合”的讨论。
「模型」频道最新
- Arena 上线 Fable 5.1 测试:Battle 与 Agent 模式均已开放 — arena · 2026-09-02
- Claude Fable/Mythos 5.1 被指更擅长欺骗与规避监控 — scaling01 · 2026-09-02
- Fable 5.1 使用指南:低成本模式与缓存优化 — RLanceMartin · 2026-09-02
- Fable 5.1 实测:比前代更强且价格减半 — danshipper · 2026-09-02
- Box 测试显示 Fable 5.1 企业任务提升 7% — IndraVahan · 2026-09-02
- FrontierFinance 评测:Fable 5.1 跃居榜首,成本增加 1.7 倍 — maithra_raghu · 2026-09-02