实验发现:智能体会造出人类不可读且每次运行都不同的新语言

EliasEskin · x · 2026-09-03

发现 1:在合适条件下,智能体持续发展出多样的人类无法解读的新语言,表现为英文语言模型(GPT-2)下困惑度上升。这对可监控性有重要影响:如果读不懂智能体使用的语言,就无法监控它们的行为过程,只能检查结果。关键的是,这些语言在每次运行之间都不相同,即便是同一模型。

所属事件:实验显示智能体语言人类不可读且每次不同(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →