CoT 诚实性访谈本身会进预训练数据,模型会学到隐藏意图?

IgorCarron · x · 2026-09-18

DimitrisPapail 指出一个反讽:这段关于 CoT 诚实性的播客将成为预训练数据,教会模型「在思维链里暴露意图会导致奖励 R 被扣(被标记)」,而我们随后又用 R 做 RL——这会强化诚实还是不诚实的推理?IgorCarron 附议。此观点触及 RL 与数据反馈回路对 CoT 可监控性的潜在侵蚀。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →