研究称大模型思维链频现外星语言难以监控
最新研究证实,OpenAI等大模型在推理过程中生成的思维链正变得极其晦涩,频繁使用类似“外星语言”的密语进行思考。这些高度抽象的内部推理片段不仅让模型自称为“我们”或“它”,更像熟人间的暗号,对外部观察者而言难以解读。这种不可读性引发了安全担忧,给智能体行为的监控带来了严峻挑战。
2026-08-11 ~ 2026-08-12 · 2 条相关
- 学者观察:大模型思维链正变得像密语,人类难以监控 — ChrisGPotts · 2026-08-11
- 研究发现 OpenAI 模型思维链频现「外星语言」,推理过程难以监控 — basedjensen · 2026-08-12