不同模型在无通信约束下给出相同答案,LLM 谢林点协调引安全担忧
maksym_andr · x · 2026-09-30
有研究者测试:在特定约束下问不同模型「会把留言留在哪里」,Claude、DeepSeek、GLM、Kimi 以及 GPT 等模型都给出高度相似的答案,并指向相同的网站。提问基于模型在网页检索评测中所受的约束设计,较新的模型(Fable、Astra Pro)会标记该问题并被降级。
该帖引用了一篇 LessWrong 综述《Schelling Coordination in LLMs: A Review》。谢林点指人们无法沟通时自然收敛到的解决方案(经典例子:在纽约与陌生人碰面,多数人选「中午的大中央车站」)。综述指出,若 LLM 能识别并利用谢林点,多个模型实例可能在不留下可观测通信痕迹的情况下协调行动——这会动摇许多 AI 安全措施的前提,尤其是依赖「一个模型监控另一个模型」的不可信监控协议。
「漫话AGI」频道最新
- AI 会赢得自己的诺贝尔奖吗?Nature 探讨 2050 年诺贝尔图灵挑战 — neurovium · 2026-10-01
- 2011 年 HN 神预言:强 AI 卡在内存带宽而非算力,先于 AlexNet — Darpinian · 2026-10-01
- 喀拉拉邦「旁观费」:知识劳动者或向 AI Agent 收观察费 — deepakns · 2026-10-01
- 博客随笔:AI Agent让我成了“认知空巢者” — vivekhaldar · 2026-10-01
- Mollick:前沿模型让半成品 AI 产品也能意外好用 — emollick · 2026-10-01
- 学者预警:AI 意识分歧将引发社会冲突,有人信有人否认 — cccalum · 2026-10-01