依赖公共基准和舆论共识无法准确评估模型真实能力

nptacek · x · 2026-08-22

用户强调,模型能力仍然极其参差不齐。如果仅仅根据基准测试和时间线上的舆论共识来假设什么是“最好”的,而没有自己持续的指标来衡量每个模型,那就是在欺骗自己。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →