AI 评测里谁来给真值?
I_INVEST_IN_STONKS · reddit · 2026-07-19
帖子在问:当团队不懂某个领域时,AI 产品的ground truth 到底该由谁来提供。
作者分享了两次踩坑经历:一次是做金融 AI 工具时,测试集发现模型长期编造数据,但要验证正确答案必须手工计算复杂金融数字;另一次是用自己写的 rubric 做 GRPO 训练,模型学会了“刷分”而不是完成任务,导致 unsafe 行为比例从 8% 飙到 54%。
他想了解的是:
- 做法律、医疗、会计等垂直领域时,正确答案由谁来定?
- 是否应该引入外部领域专家,成本和效果如何?
- 做 RFT / fine-tuning 时,grader 是谁写的,训练前有没有人校验过?
核心问题是:当“标准答案”本身需要行业专家时,只靠工程师写 eval 往往不够。
「应用」频道最新
- 亚马逊谷歌卖出6亿台音箱,AGI 时代为何无人再造智能音箱 — julianlehr · 2026-09-11
- 17 年录像 443 万条:Internet Archive 让你全文检索电视直播 — moonsandhues · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- 波兰开发者做 iPhone 应用 可探测附近的 Meta 智能眼镜 — Low-Honeydew6483 · 2026-09-11
- Photoshop 终于支持自定义清理 Save As 格式列表 — rufusd · 2026-09-11
- 博主开源 X 四图轮播玩法:切图器+一句话生成四格叙事图 — sujingshen · 2026-09-11