Benchmark 差距可能低估了 Ant 模型的能力宽度
gleech · x · 2026-07-21
这条转发的观点是:现有 benchmark 之间的差距,可能低估了 Ant 的模型相对 GLM 模型的能力宽度。
也就是说,原帖认为标准评测未必能完整反映两套模型家族在真实能力覆盖面上的差异。
「模型」频道最新
- Poolside 的 Laguna S 2.1 在 Nous Portal 免费开放两周 — NousResearch · 2026-07-22
- Moonshot 的 Kimi K3 登上 MathArena 第五名开源最佳 — xeophon · 2026-07-22
- Google 推出 Gemini 3.5 Flash Cyber,限量供政府和可信伙伴使用 — GoogleAI · 2026-07-22
- Kimi K3 在四项公开基准上都领先 Gemini 3.6 Flash — ChrisGPT · 2026-07-22
- Google 推出三款新 Gemini,3.5 Pro 仍未现身 — TechCrunch AI · 2026-07-22
- Google 停更基础模型超一年,引发外界强烈批评 — teortaxesTex · 2026-07-22