这条帖认为 AI 产品要靠上线后迭代,基准分数不够看
import_jmr · x · 2026-07-28
AI 产品的胜负,往往在上线后才真正分出来
帖子认为,一个模型即使基准分数很高,也可能在真实用户面前表现不佳。真正优秀的 AI 产品通常靠反复迭代做出来,而这些迭代大多发生在发布之后;文中以 Gemini Encoder-Heavy 为例,称它经历了几版调整后才真正开始起势。
核心观点是:AI 和传统软件不同,输出是概率性的,同一个提示词可能得到不同回答;幻觉、上下文丢失也很难像报错那样被直接定位。因此,团队要看的是用户行为信号,比如点踩、重新生成、以及用户是否继续使用。
「应用」频道最新
- Templafy 把 AI 演示文稿 Agent 做成浏览器免费版 — nikola_mr64990 · 2026-07-28
- Granola 推出 Apple Watch 应用,手表记事已超 iPhone — soleio · 2026-07-28
- Black Forest Labs 推出可生 20 秒带音频视频的 FLUX 3 — emmanuelvivier · 2026-07-28
- OpenAI 推出面向企业流程的实时语音智能体平台 — emmanuelvivier · 2026-07-28
- Apple 起诉 OpenAI 商业秘密,后者或将于 2027 年推 ChatGPT 手机 — emmanuelvivier · 2026-07-28
- Gemini 用户逼近 10 亿,Google 正把助手做成大众产品 — emmanuelvivier · 2026-07-28