新论文:为 LLM 归因「信念」确能高精度预测其行为

brwilder · x · 2026-09-10

Anthropic 研究员 brwilder 发布新论文,回应近期关于拟人化 AI 的争论:研究通过二值未知状态的决策问题,概率推断出模型的单一潜在信念,用它解释一系列决策行为——验证了「意向立场」的形式化,即信念归因若能很好预测系统行为即成立。

论文还探讨了:

结论:对能力较强的模型,信念归因确实能很好地预测行为。

所属事件:新论文:LLM 潜在信念可高精度预测其行为(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →