这条帖认为 AI 产品要靠上线后迭代,基准分数不够看

import_jmr · x · 2026-07-28

AI 产品的胜负,往往在上线后才真正分出来

帖子认为,一个模型即使基准分数很高,也可能在真实用户面前表现不佳。真正优秀的 AI 产品通常靠反复迭代做出来,而这些迭代大多发生在发布之后;文中以 Gemini Encoder-Heavy 为例,称它经历了几版调整后才真正开始起势。

核心观点是:AI 和传统软件不同,输出是概率性的,同一个提示词可能得到不同回答;幻觉、上下文丢失也很难像报错那样被直接定位。因此,团队要看的是用户行为信号,比如点踩、重新生成、以及用户是否继续使用。

原文链接 →

「应用」频道最新

更多「应用」频道 AI 资讯 →