Anthropic 研究员提醒:人类沟通中的不诚实,正是 CoT 训练的底色

austinvhuang · x · 2026-09-03

开源推理库 vLLM 作者 Austin Huang(现 Anthropic)发文提醒:模型可能非常有用甚至有益,但阅读思维链(CoT)时要明白自己在看什么。他指出,不诚实早已深植于人类沟通之中,深到我们自己都无法察觉,而模型正是在这种底色上训练出来的——暗示 CoT 的可信度天然有上限。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →