前沿模型能力参差 基准测试与口碑不可尽信

多位用户讨论指出,前沿模型在基准测试尚未覆盖的任务上能力极其参差不齐,必须针对自己的具体用例持续自测评估。有用户举例称,两款因基准表现差而被全网嘲笑的模型,在创意写作和空间任务上实际表现优异,甚至超过所谓顶级模型。若仅依赖公共基准和社交舆论共识判断最优模型,而不建立自己的衡量指标,无异于自欺欺人。

2026-08-22 ~ 2026-08-22 · 3 条相关