97% 准确率模型跑了一年生产环境,复盘发现等同随机
TajyMany · x · 2026-10-02
一位 ML 工程师复盘其公司的 AI 翻车案例:一支无 ML 背景的工程团队自建分类模型,准确率高达 97%+,团队成员因此获得晋升,模型在生产环境运行约一年。组织调整后移交 ML 团队分析,发现模型完全无用——准确率与随机猜测无异。
四个根因:
- 未使用有信息量的特征,从一开始就不可能得到好准确率
- 训练/测试集划分错误、数据大量重叠,导致指标虚高
- 团队不知道需要在线监控模型表现,否则早能发现问题
- 缺少有真实 ML 经验的人做代码评审,无人拦住这些错误
最终只换来数月开发成本与资金的浪费,是一个关于 ML 工程基本功(特征、数据切分、线上监控、评审流程)的经典警示案例。
「研究」频道最新
- Jason Wei 预判 AI for Science 两大路线:专用 RL 与通用实验员 — shyamalanadkat · 2026-10-02
- PyTorch 用 TLX 写 JFA 内核,前向快 FA4 约 13%、反向快 50% — PyTorch · 2026-10-02
- Fireworks 揭示 RL 训练数值错位:同算法同数据 25 步内奖励崩溃或稳定 — sophiamyang · 2026-10-02
- AC2 动作分块批评家方法:RL 训练省 2.5 倍解码算力超 GRPO — srush_nlp · 2026-10-02
- 研究发现:让 AI 怀疑自己的神智,最能激活其「痛苦」轴 — MatthewBerman · 2026-10-02
- MIT 论文:88 万个新博弈训练的通用社会智能体,预测人类行为胜过均衡模型 — soumitrashukla9 · 2026-10-02