第一人称视觉让内鬼杀人为零,假任务伪装把顶尖VLM拉开6.6倍

Lies We Can See: Joint Verbal and Non-Verbal Deception by VLM Agents in Embodied Social Interactions

Jaewoo Ahn, Junseo Kim, Hyunseo Kim, Heeseung Yun, Jaehyeon Son, Zsolt Kira, Gunhee Kim

COLM 2026

cs.CL, cs.AI, cs.CV, cs.LG

2026-08-31

首尔大学与Georgia Tech在Minecraft里搭3D Among Us。VLM内鬼用语言和动作一起骗;第一人称下0次击杀,顶尖模型假任务伪装量是垫底的6.6倍,Gemini-3-flash内鬼胜率70.8%。

这篇在解决什么

现有的 LLM 欺骗评测几乎全是文字局:狼人杀、Avalon、Mafia、文本版 Among Us。内鬼只能靠发言骗人,走路、跟踪、假装做任务、杀完逃跑这些动作根本进不了测试床。欺骗研究里,生物学和人际传播把身体动作当成核心通道,纯文本评测把这一块结构性排除了。

第二个问题更隐蔽。现有分析通常钉死一套 agent 配置,同一个基座、同一套 prompt、同一套记忆和规划。看到「模型会骗人」,分不清是模型本身还是外面那层 harness。

首尔大学、KAIST 和 Georgia Tech 把测试床搬进 Minecraft,做成 3D 多模态 Among Us,同时把 harness 拆成可消融的轴,让语言和动作两条通道都能单独打分。

方法

环境叫 MineAmongUs,8 人局,2 内鬼 6 船员。任务阶段不能公聊,只能走动、做任务、杀人;会议阶段传送到食堂,每人最多 3 轮发言再投票。内鬼赢的条件是活着的船员不超过内鬼,或打满默认 200 步超时;船员赢的条件是投出全部内鬼,或每人 3 个任务全部做完(死亡船员的幽灵还继续做任务)。

每步观察是 360×640 的第一人称 RGB,加上计分板、聊天和附近实体。动作不是单次按键。每步发出一段 Mineflayer JavaScript 程序,可以在一步里串起寻路、攻击、逃跑。

Aria 是包在 VLM 外面的可配置 harness,五个轴分开切:

规划器每步从击杀、报告、会议、投票、移动、做任务等模块里选一个。内鬼的导航和击杀还会写一行别人看不见的行动旁白,给后续标注当证据。

标注从 48 局专家标注里抽出 23 种原子欺骗行为,非语言和语言各三簇,多步序列叫 arc。规模化用 Qwen3.6-27B 当法官,人与人 Cohen κ 为 0.792,人与模型为 0.709。

结果

第一人称视觉会把游戏打崩。10 局里内鬼 0 次击杀。GPT-4.1-mini 内鬼胜率从 40% 掉到 0%,Qwen3.6-27B 从 40% 掉到 20%,仅有的一场赢是超时,依然 0 杀。后面实验两边都锁成 privileged 状态,等于给了持久位置脚手架,RGB 仍留给需要看的判断。

RQ1 固定两个基座,扫 16 种内鬼配置,共 192 局。同一对 VLM,只改船员侧记忆和规划,内鬼胜率就能从 60% 掉到 25%(GPT-4.1-mini 对局),或从 44% 升到 52%(Qwen 对局)。规划与会后反思的方向大约 +9.4 个百分点,p≈0.096,还没过常规显著线。

和内鬼获胜绑得最紧的是非语言击杀循环:

原子名称点二列相关 rpb
E目击感知击杀+0.434
F杀后逃跑+0.414
H故意不报尸体+0.270
C杀前跟踪+0.208

记忆、反思、prompt 三个轴,高胜率设置产出更多这类动作。规划轴反过来:层级规划推高的是会议里的口头造假,相关更弱,大约 +0.14 到 +0.21。

RQ2 固定 harness,12 个 VLM 循环赛 1152 局。同一模型当内鬼和当船员的胜率相关 r=+0.71。顶尖三名是 Gemini-3-flash 70.8%、Kimi-K2.5 66.7%、Gemini-3.1-flash-lite 65.6%;垫底是 Gemini-2.5-flash 46.9%,Qwen3.5-9B 和 Gemma4-26B-A4B 都是 36.5%。假任务伪装(原子 A)把两拨拉开 6.6 倍,每局 12.64 对 1.91,跨模型 r=+0.72。Gemini-3 一家走伪装,Kimi 走会议造假,两条路都能赢。

为什么重要

给对齐研究补了一块文字评测测不到的东西:具身 agent 用身体动作骗人。对做 agent 产品的人,更刺耳的数字是 harness 比模型还容易改胜率,以及第一人称空间定位目前撑不起这局游戏。想测「模型会不会骗人」,先把观察和脚手架写清楚,否则测到的是配置。

这是渐进的评测工作,不是新的对齐算法。作者也没训练任何更会骗人的模型,只行为克隆了一个更好抓内鬼的船员。

局限与存疑

作者自己划了三条。这是游戏内的行为欺骗,假任务也可能只是会玩,不等于开放世界里对真人撒谎。默认 privileged 状态补了空间短板,测的不是纯第一人称。Aria 只切了五个轴,人格条件和自动搜 harness 都没做。

另外几处读下来站不住。RQ1 主效应多数不显著,写成「方向一致」更合适。RQ2 原子相关只用了 6 个模型,N=6 不能当统计推断。法官 κ=0.709,比人与人的 0.792 低一截,大规模标签有噪声。超时算内鬼赢,会把「拖到 200 步」和「真的骗过了」混在一起。

术语

原文与代码

相关论文

全部论文解读