用仿真 persona 做 12 轮盲测:对比 Fable 5.1 与 Opus 5.5

every · x · 2026-09-23

作者团队设计了一种有趣的模型对比方法:先测试 persona,再模拟出一个「dan」形象,让模型在 12 轮讨论中对他在真实生活中真正坚持立场的问题做 held-out 测试。对比对象为 Fable 5.1 与 Opus 5.5(在 Kieran Klaassen 的 Cozy Island 环境下进行)。这种用真实持方做 held-out 评估的思路对 agent/persona 工程有参考价值。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →