11 个前沿 LLM 实测:心理测量自述仅在特定条件下能预测模型行为
AnimaAnandkumar · x · 2026-10-07
Anima Anandkumar 参与的论文《Rethinking Psychometric Evaluation of LLMs》已被 NeurIPS 2026 主会接收,并将在 COLM 2026 两个工作坊展示。研究回答一个问题:低成本的心理测量自述(self-report)能否预测 LLM 的实际行为?
核心发现:
- 在 11 个前沿 LLM、4 项行为任务上,自述与行为的一致性存在但是有选择性的
- 同一会话内,针对具体行为的 Theory of Planned Behavior 框架达到与人类相当的一致性,宽泛的 Big Five 人格特质则不行
- 跨会话时,一致性仅在由训练决定、不依赖当前 prompt 的行为(如隐式偏见)上保留;在强依赖上下文的行为(如谄媚/sycophancy)上崩塌
- 人设 prompt 会改变自述结果
结论:此前文献记录的 LLM 自述-行为脱节,部分源于用了预测力弱的 Big Five 和会话隔离的实验设计;测量框架与上下文匹配方式决定了能否检测到一致性。
「研究」频道最新
- Claude 协力用 Lean 形式化 11 方块装箱最优性证明 — ctjlewis · 2026-10-07
- 11 方块装箱问题用 40 万行 Lean 代码完成形式化 — ctjlewis · 2026-10-07
- 研究员观点:混合模型下游扩展更优,但全局注意力仍不可少 — kalomaze · 2026-10-07
- 模型如何学出隐私信号:推理压力是更强的信息不对称 — kalomaze · 2026-10-07
- 数学家人手不足应对 AI 证明浪潮,人机半人马协作或成解法 — bradneuberg · 2026-10-07
- Judea Pearl 点赞《Crush Coarse》论文,称其值得读 — yudapearl · 2026-10-07