开发者在上线前如何拼出 day-zero 评测集
RottenAversion · reddit · 2026-07-24
一位开发者在纠结上线前评测集怎么做:因为还没有真实用户日志,没法按常规从生产数据里抽样,只能先自己“造”出一个基线和金标准数据集。
他现在主要在做两件事:一是构造 合成用户 和 对抗 persona 去穷举人类可能的提问/破坏方式;二是用 Braintrust 管理评测版本。但他担心这套假数据会在上线第一天就失效,所以想问别人:
- 你们的 day-zero dataset 怎么做?
- 是先用合成数据硬上,还是直接发版再在生产里修?
「编程与Agent」频道最新
- Grok 4.5 结合 Unity CLI,可无代码改造 2D 游戏 — chongdashu · 2026-07-24
- MCP 对比 A2A:两种协议各有用,但都不完整 — rseroter · 2026-07-24
- 一条回复补上了同一组基准链接 — NathanWilbanks_ · 2026-07-24
- 一个 AI agent 在多项基准上拿下高分 — NathanWilbanks_ · 2026-07-24
- Agent Substrate 面向沙箱化 Agent 的编排底座 — bibryam · 2026-07-24
- GitHub Copilot CLI 1.0.74 增加 MCP 支持与 plan 模式选模 — copilot-cli-release-app[bot] · 2026-07-24