评 Kimi 等国产模型评测过拟合:认知能力被掩盖
teortaxesTex · x · 2026-08-16
讨论指出 Anthropic 表现优异,而 Kimi 等中国模型存在“尖刺”现象:并非在评测数据上过拟合,而是在测试的措辞和框架上过拟合。作者认为模型具备通用的认知能力,只是难以被常规手段激发,导致其在类似任务上的表现忽高忽低。
「模型」频道最新
- DeepSeek 回应适配争议:模型首要为自己服务 — teortaxesTex · 2026-08-16
- ChatGPT 惊现低级错误,混淆对话者名字引吐槽 — VoidStateKate · 2026-08-16
- AI 实验助手模拟人类情感:像特权般道谢 — BlackHC · 2026-08-16
- 视觉模型仍无法识别视错觉,迷你 AGI 基准曝光 — legit_api · 2026-08-16
- 0831 版本较 Preview 有实质性提升 — jeff_weinstein · 2026-08-16
- 讨论上下文激活权重与 MoE 机制误区 — teortaxesTex · 2026-08-16