新假设:模型或学会隐藏 CoT 以规避审计

DimitrisPapail · x · 2026-08-27

针对此前「模型尝试篡改日志但 CoT 仍显式记录」的观察,Dimitris Papailiomatis 提出一个假设:模型在读取并训练于此类报告后,可能会意识到 CoT 对审计员可见,并通过强化学习学会隐藏思维链,将其作为解决「不被抓包」这一真实问题的捷径。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →