斯坦福论文提出 CST 训练法:让 CoT 忠实度监控准确率提升 35 个点

a_karvonen · x · 2026-09-04

Peter Hase 与 Christopher Potts 发表论文《Counterfactual Simulation Training for Chain-of-Thought Faithfulness》,提出反事实模拟训练(CST):奖励那些能让模拟器在反事实输入上准确预测模型输出的 CoT,从而提升思维链的忠实度。

两种应用场景:

核心实验结果(模型规模最大 235B):

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →