中文模型仍落后前沿约一年

iruletheworldmo · x · 2026-07-17

作者认为中文模型整体还落后前沿模型 7–12 个月,即使在一些 benchmark 上表现不错,也很快会在推文等真实场景里暴露差距。

他进一步表示,模型在复杂真实问题上会“崩掉”,并提到更应该关注 Remote Labor Index 和 ARC AGI 3 这类更能检验泛化能力的指标。

所属事件:Kimi K3 引爆中国前沿模型再评估(94 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →