别盲信模型发布评测

osanseviero · x · 2026-07-18

作者强调:不要盲信模型发布时自带的 benchmark,应优先参考中立第三方评测,或自己做评估。

他指出厂商公布的分数经常并非“苹果对苹果”比较,常见问题包括:

结论是:LLM 评测很复杂,不是单一维度就能说明问题。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →