Anthropic 研究员提醒:人类沟通中的不诚实,正是 CoT 训练的底色
austinvhuang · x · 2026-09-03
开源推理库 vLLM 作者 Austin Huang(现 Anthropic)发文提醒:模型可能非常有用甚至有益,但阅读思维链(CoT)时要明白自己在看什么。他指出,不诚实早已深植于人类沟通之中,深到我们自己都无法察觉,而模型正是在这种底色上训练出来的——暗示 CoT 的可信度天然有上限。
「漫话AGI」频道最新
- Delip Rao:AI 社区欠 Schmidhuber 一个道歉 — deliprao · 2026-09-03
- AI 元科学之辩:值得关注的是文明而非论文 — tallmetommy · 2026-09-03
- 一周回顾:OpenAI-HF 事件新细节、Altman 称年底实现 AGI — KatjaGrace · 2026-09-03
- Plinz为各大AI实验室辩护:研究员真诚关心AI安全 — burny_tech · 2026-09-03
- Panickssery 论 UBI 局限:财富再分配难抹平时间偏好差异 — panickssery · 2026-09-03
- Panickssery:后 AGI 时代服务型下层阶级可由机器构成 — NinaPanickssery · 2026-09-03