做 eval 别用合成数据:多塞真实用户怪案例才有效
cephaloform · x · 2026-09-19
darrenangle 发推提醒开发者:eval 质量的关键在于覆盖更多边缘案例、更多真实用户遇到过的奇怪输入,而不是堆合成数据。他直言 synthetic slop(合成垃圾数据)没用,「把用户真实遇到的东西放进 eval,你就能拥有一切」。这是一条简短但实用的 agent/模型评测工程建议。
「编程与Agent」频道最新
- TypeSafe 公开 Jev 1.13 九大失败模式及规避清单 — hackgoofer · 2026-09-19
- 开发者吐槽 AI 编码助手:要三行修复,给 400 行代码加 17 个测试 — burny_tech · 2026-09-19
- 用 Pace Layers 解读 AI 焦虑:慢层被资本逼着快跑 — dbreunig · 2026-09-19
- Muse 开放连接器平台:开发者 API 可接入个人 AI 助手 — alexandr_wang · 2026-09-19
- AWS 把 DRAM 当Agent稀缺资源:AgentCore 运行时按需驻留、超售降本 — bookwormengr · 2026-09-19
- shadcn-labs 开源 pdfcn:React 组件一键生成精美 PDF — tom_doerr · 2026-09-19