Artificial Analysis 榜单引争议:Gemma 4 编程能力真比 Qwen 强?
Informal-Trouble2183 · reddit · 2026-08-06
Reddit 网友发现,在 Artificial Analysis 的 SciCode 评测中,Gemma 4 的得分排名高于 Qwen3.6 27b。这引发了关于模型实际编程能力与跑分成绩不符的讨论,社区质疑是 Gemma 4 真的表现优异,还是该基准测试本身存在问题。
「模型」频道最新
- t0-alpha 时间序列预测基础模型发布,采用 Apache 2.0 开源 — fpedregosa · 2026-08-06
- MiniMax 发布 H3 全模态模型:支持图生视频与原生音频 — RisingSayak · 2026-08-06
- MiniMax 发布 33B 开源多模态模型 H3,支持图声视频生成 — RisingSayak · 2026-08-06
- 谷歌模型赢了评测却输了开发者 — prasenx · 2026-08-06
- 曝 OpenAI 下周发布新模型 Astra,为 GPT-4.5 后最大预训练 — koltregaskes · 2026-08-06
- Google 发布 8 月 AI 更新:推 90 个复用 Agent 技能与托管基础设施 — rseroter · 2026-08-06