开发者用太空狼人杀测试 LLM 欺骗行为

受《Generative Agents》论文启发,有开发者基于《Among Us》(太空狼人杀)构建了模拟环境,让 Claude 与 Kimi 等模型互相对战,以观察 LLM 之间的博弈行为。研究重点包括模型智能体是否会共谋、使用隐写术隐藏沟通,或执行“隐藏议程”等行为。该实验为研究多智能体系统中的欺骗、共谋与协调提供了可复现的测试场,相关探讨在社区引发关注。

2026-08-22 ~ 2026-08-22 · 4 条相关

另有 1 条近重复转述:panickssery