研究称 LLM 擅长欺骗却难识破骗局

一项基于 LLM 玩“杀人游戏”的研究发现,模型的欺骗能力明显强于防御能力:LLM 更擅长欺骗他人,却很难识别自己是否被骗,这使得扮演“卧底”的模型拥有巨大优势。研究还涉及模型记忆与问责等问题,并在谈判场景中观察到 LLM 遇到砍价时容易妥协。整体来看,LLM 的攻防不对称性对多智能体协作的安全与可信提出了警示。

2026-08-22 ~ 2026-08-22 · 2 条相关