Owain Evans 团队:Claude 的助手人格更像精英名校人类
morqon · x · 2026-09-16
Owain Evans 分享的模型人格研究发现:模型在微调中采纳的助手特质,更多来自与'助手'相似的人类角色——而模型内部把助手表征为更像精英名校出身的人类,而非普通背景者。他补充质疑:这是否因为模型更信任名校者的观点?团队认为不是,因为 Slocum et al 2025 等研究表明微调中的信念采纳并不取决于信息来源。tenobrus 调侃这是'研究 Claude 上的是哪所常春藤'。
「研究」频道最新
- AI Evals FAQ 更新至 48 问:新增敏感数据、大 trace、LLM 裁判等实操问答 — HamelHusain · 2026-09-16
- NVIDIA 在 Hugging Face 发布 6-DoF 姿态估计基础模型 FoundationPose — _akhaliq · 2026-09-16
- 3 周精读斯坦福 CS329A 九讲:生成器已跑赢验证器 — le_james94 · 2026-09-16
- DeepSeekMath-V2 把验证做成产品:验证算力随生成器一起扩展 — le_james94 · 2026-09-16
- RLVR 不教新能力?DeepSeekMath 数据:RL 提升 Maj@K 不提升 Pass@K — le_james94 · 2026-09-16
- Math-Shepherd 用 rollout 替代 80 万人标注,GSM8K 升至 84.1% — le_james94 · 2026-09-16