私有基准实测:Xiaomi v2.6 Pro 被评两年最差,Grok 仅 Luna 水平
Afinetheorem · x · 2026-09-22
研究员 Afinetheorem 主张私有基准更有价值,因为公开基准太容易被针对性刷分,反而难以反映模型的"大体感"/通用智能。
在其私有基准上:小米 Xiaomi v2.6 Pro 是他两年来测过的最差模型,新 Grok 也只有 Luna 级别水平,与头部模型差距明显。该帖为个人实测观点,细节见配图。
「模型」频道最新
- Mimo V2.6 输出¥2 对决 Grok 4.7 输出¥40,模型发布只走两端 — op7418 · 2026-09-22
- Terminal-Bench 4.0 榜单更新,头部格局生变引关注 — ns123abc · 2026-09-22
- 腾讯混元把 770B 模型压进 214 GiB:四权重五比特 — TencentHunyuan · 2026-09-22
- xAI 修复 SDK 丢失推理内容的 bug,Grok 4.7 性能显著提升 — ns123abc · 2026-09-22
- Artificial Analysis 发布 TTS 全榜:xAI 87.6% 发音准确率居首 — ArtificialAnlys · 2026-09-22
- xAI 更新 SDK 后性能大增,冲进 Vals 榜单前十 — teortaxesTex · 2026-09-22