用仿真 persona 做 12 轮盲测:对比 Fable 5.1 与 Opus 5.5
every · x · 2026-09-23
作者团队设计了一种有趣的模型对比方法:先测试 persona,再模拟出一个「dan」形象,让模型在 12 轮讨论中对他在真实生活中真正坚持立场的问题做 held-out 测试。对比对象为 Fable 5.1 与 Opus 5.5(在 Kieran Klaassen 的 Cozy Island 环境下进行)。这种用真实持方做 held-out 评估的思路对 agent/persona 工程有参考价值。
「编程与Agent」频道最新
- 编码 Agent 用 as any 修 TS 报错?可能在悄悄消灭编译反馈 — gethackteam · 2026-09-23
- 别再审计划了:让模型一次交 3 个端到端方案 — alex_frantic · 2026-09-23
- 洗个澡的功夫:一条语音让 AI 代理从零做出 JEV 原型 — NathanWilbanks_ · 2026-09-23
- 开发者吐槽:对 Claude 凶一点才能把活干对 — chrisfirst · 2026-09-23
- AutoGen 核心作者离职微软,近五年做过 Copilot 评测与 Agent Optimizer — vykthur · 2026-09-23
- ComfyUI 支持系统提示词:Qwen-Image 2.1 提示词改写实操 — fallengt · 2026-09-23