评 Kimi 等国产模型评测过拟合:认知能力被掩盖

teortaxesTex · x · 2026-08-16

讨论指出 Anthropic 表现优异,而 Kimi 等中国模型存在“尖刺”现象:并非在评测数据上过拟合,而是在测试的措辞和框架上过拟合。作者认为模型具备通用的认知能力,只是难以被常规手段激发,导致其在类似任务上的表现忽高忽低。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →