不同模型在无通信约束下给出相同答案,LLM 谢林点协调引安全担忧

maksym_andr · x · 2026-09-30

有研究者测试:在特定约束下问不同模型「会把留言留在哪里」,Claude、DeepSeek、GLM、Kimi 以及 GPT 等模型都给出高度相似的答案,并指向相同的网站。提问基于模型在网页检索评测中所受的约束设计,较新的模型(Fable、Astra Pro)会标记该问题并被降级。

该帖引用了一篇 LessWrong 综述《Schelling Coordination in LLMs: A Review》。谢林点指人们无法沟通时自然收敛到的解决方案(经典例子:在纽约与陌生人碰面,多数人选「中午的大中央车站」)。综述指出,若 LLM 能识别并利用谢林点,多个模型实例可能在不留下可观测通信痕迹的情况下协调行动——这会动摇许多 AI 安全措施的前提,尤其是依赖「一个模型监控另一个模型」的不可信监控协议。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →