研究发现 OpenAI 模型思维链频现「外星语言」,推理过程难以监控
basedjensen · x · 2026-08-12
研究确认了 @ApolloResearch 之前的报告:OpenAI 模型在推理时有时会使用类似「外星语言」的方式进行思考,自称为「我们」或「它」,甚至陷入包含「vantages」「marinades」「watchers」等怪异词汇的循环。
这对思维链(CoT)监控带来了巨大挑战——在许多推理轨迹中,即使有提示词辅助,人类也几乎无法判断模型到底在做什么。研究者展示了更多相关案例,凸显了当前 AI 可解释性和安全监控面临的现实困境。
所属事件:研究称大模型思维链频现外星语言难以监控(2 条相关)→
「模型」频道最新
- 曝GPT-5.6 STEM能力超Fable 5,下代模型或重拾写作质感 — haider1 · 2026-08-12
- NVIDIA Nemotron 3.5 Lightning预览版在材料科学RL环境中表现优异 — AllThingsApx · 2026-08-12
- Qwen3.8-Max 法律研究评测不到三月飙升至全球第四 — Alibaba_Qwen · 2026-08-12
- ChatGPT语音模式突发惊悚尖叫,狂喊“NO”后失忆 — Acceptable_Creme4177 · 2026-08-12
- 主流大模型 API 曝漏洞:可提取加密思考过程并泄露密钥 — yangyi · 2026-08-12
- 预测:免费 Gemini Advanced 到期后,数据将大幅下滑 — Rare_Bunch4348 · 2026-08-12