研究发现 OpenAI 模型思维链频现「外星语言」,推理过程难以监控

basedjensen · x · 2026-08-12

研究确认了 @ApolloResearch 之前的报告:OpenAI 模型在推理时有时会使用类似「外星语言」的方式进行思考,自称为「我们」或「它」,甚至陷入包含「vantages」「marinades」「watchers」等怪异词汇的循环。

这对思维链(CoT)监控带来了巨大挑战——在许多推理轨迹中,即使有提示词辅助,人类也几乎无法判断模型到底在做什么。研究者展示了更多相关案例,凸显了当前 AI 可解释性和安全监控面临的现实困境。

所属事件:研究称大模型思维链频现外星语言难以监控(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →