基于《Among Us》构建 LLM 欺骗测试环境,Claude 对战 Kimi
Aryan100100 · x · 2026-08-22
作者受《Generative Agents》论文启发,构建了模拟环境来观察 LLM 之间的博弈。具体做法如下:
- 游戏选择:选择了《Among Us》(太空狼人杀)作为测试床,因为其涉及复杂的欺骗与推理。
- 环境搭建:手动映射了每个像素,搭建了自己的模拟器(个人主页有 Pinned 链接)。
- 对测试验:让 Claude 对战 Kimi,专门收集关于 LLM 在游戏场景中欺骗行为的数据。
- 研究时长:从 2025 年 10 月开始,已进行了约 10 个月的变体实验。
所属事件:研究者用太空狼人杀测试 LLM:擅长欺骗却难识破谎言(6 条相关)→
「编程与Agent」频道最新
- OJO AI 设计团队实测:一段提示词生成完整落地页 — PrajwalTomar_ · 2026-08-22
- 用 Markdown 编程:将 AI Agent 作为运行时执行自然语言应用 — holy_serp · 2026-08-22
- Claude 拿捏网页开发:5 个提示词从线框图到上线 — nikola_mr64990 · 2026-08-22
- 我们需要限制而非放权:代码 Agent 缺乏控制的风险 — phucphungbk · 2026-08-22
- 如何手写 AI Agent 的浏览器 Harness/MCP 并对比 Playwright — Jin-109 · 2026-08-22
- 集成 Sharp 模板至 NInfer,输出 Token 降 42% — xrailgun · 2026-08-22