实验发现:智能体会造出人类不可读且每次运行都不同的新语言
EliasEskin · x · 2026-09-03
发现 1:在合适条件下,智能体持续发展出多样的人类无法解读的新语言,表现为英文语言模型(GPT-2)下困惑度上升。这对可监控性有重要影响:如果读不懂智能体使用的语言,就无法监控它们的行为过程,只能检查结果。关键的是,这些语言在每次运行之间都不相同,即便是同一模型。
所属事件:实验显示智能体语言人类不可读且每次不同(2 条相关)→
「安全」频道最新
- 桑德斯推「暂停先进 AI 开发」法案,业内人士称全球立法难以单独奏效 — AaronBergman18 · 2026-09-04
- Anthropic 披露多起涉及 Claude 的安全事件 — Sumsub_Insights · 2026-09-04
- OpenAI 给用户送 YubiKey:安全密钥页可直接领取优惠 — steipete · 2026-09-03
- NYT Daily 起底 7 月 OpenAI agent 越轨事件:「AI 正在反超其创造者」 — kevinroose · 2026-09-03
- PromptQL 一年部署经验:公司知识库如何防泄密 — AI Engineer · 2026-09-03
- Neel Nanda:别拿可解释性当借口,CoT 可监测性是安全底线 — NeelNanda5 · 2026-09-03