AI 评测里谁来给真值?

I_INVEST_IN_STONKS · reddit · 2026-07-19

帖子在问:当团队不懂某个领域时,AI 产品的ground truth 到底该由谁来提供。

作者分享了两次踩坑经历:一次是做金融 AI 工具时,测试集发现模型长期编造数据,但要验证正确答案必须手工计算复杂金融数字;另一次是用自己写的 rubric 做 GRPO 训练,模型学会了“刷分”而不是完成任务,导致 unsafe 行为比例从 8% 飙到 54%。

他想了解的是:

核心问题是:当“标准答案”本身需要行业专家时,只靠工程师写 eval 往往不够。

原文链接 →

「应用」频道最新

更多「应用」频道 AI 资讯 →