OpenAI 用模拟用户实现多轮对话评估
为让大模型评估更贴近真实使用场景,团队构建了包含数百个高度详细传记和行为画像的模拟用户系统,使两个助手模型可在同一多轮对话场景下直接对比。为提升真实感,模拟用户消息由仅预训练的基础模型生成,并借助助手训练出的“领航员”模型筛选最佳候选回复,在不牺牲可控性的前提下显著提高了消息的自然度。
2026-09-01 ~ 2026-09-01 · 2 条相关
- LLM 评估用模拟用户实现多轮对比 — _ddjohnson · 2026-09-01
- 用基础模型生成更自然的模拟用户 — _ddjohnson · 2026-09-01