私有基准实测:Xiaomi v2.6 Pro 被评两年最差,Grok 仅 Luna 水平

Afinetheorem · x · 2026-09-22

研究员 Afinetheorem 主张私有基准更有价值,因为公开基准太容易被针对性刷分,反而难以反映模型的"大体感"/通用智能。

在其私有基准上:小米 Xiaomi v2.6 Pro 是他两年来测过的最差模型,新 Grok 也只有 Luna 级别水平,与头部模型差距明显。该帖为个人实测观点,细节见配图。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →