Claude 写的欺诈检测器 F1=0.87?修正数据泄漏后跌到 0.70
hugobowne · x · 2026-09-29
hugobowne 与 twiecki 等让 Claude 构建一个欺诈检测器,暴露了 AI 生成代码的评估陷阱:
- 表面成绩很好:Claude 交付的代码可运行,F1 达 0.87、ROC AUC 0.99——但数字是假的。
- 两个致命错误:交易数据被随机按时间切分(未来信息泄漏进训练集),并使用了作者预先埋下的一个代理欺诈标签的特征,评估完全无法反映模型对新交易的泛化能力。
- 修正后成绩大跌:改为按时间留出验证集并移除泄漏特征后,F1 降到 0.70,而最关心的强关联交易召回率仅 0.21。
- 方法论要点:验证时应检查数据切分方式是否匹配模型实际使用场景、特征在预测时是否真实可得、以及模型在关键交易子集上的表现。Agent 可以帮忙跑这些检查,但判断证据是否成立的责任在人。他们为此写了一套验证 playbook。
「编程与Agent」频道最新
- OpenAI 工程师恳求开发者:别开 Codex Voice 会话却不发音频 — SIGKITTEN · 2026-09-29
- Yacine 放话:别写单元测试了,纯浪费 CPU — yacineMTB · 2026-09-29
- 看着 Codex 自己操作我的电脑 — McDonaghMatthew · 2026-09-29
- Nature 论文 Paper2Agent 把研究论文转成可交互 AI 代理 — james_y_zou · 2026-09-29
- 用 Opus 复刻 Terraria 惹争议:有人直指这是「AI 赋能盗版」 — AIandDesign · 2026-09-29
- 手写汇编竟比 Rust 更快?科技圈爆发性能之争 — mgill25 · 2026-09-29