Generative Agents: Interactive Simulacra of Human Behavior
Joon Sung Park, Joseph C. O'Brien, Carrie J. Cai, Meredith Ringel Morris, Percy Liang, Michael S. Bernstein
cs.HC, cs.AI, cs.LG
2023-04-07
斯坦福用记忆流、反思和规划给GPT-3.5套上长期记忆,25个小镇角色能自发传开派对邀请;完整架构believability分29.89,去掉记忆只剩21.21。
大语言模型已经能在单轮对话里演一个角色。难的是让一群角色在开放世界里连续活几天:记得两天前谁邀请了谁,午饭吃过就别再吃,碰到熟人要决定聊还是走。规则脚本写不完开放世界的分支,强化学习又缺「像人」的奖励函数。斯坦福 HCI 实验室的 Park 等人,联合 Percy Liang 以及 Google Research / DeepMind,把这件事做成一套可交互的小镇。
此前的非玩家角色要么靠有限状态机和行为树硬编码,要么在有明确胜负的对抗游戏里刷分。开放日常里,这两条路都走不通。
整套架构绕着一个叫 memory stream 的自然语言日志转。每个 agent 把感知到的事件写成一条条观察,带创建时间和最近取用时间。行动时不把全部历史塞进 prompt,按三项打分捞出一小撮:
三项做 min-max 归一后等权相加,取能塞进上下文窗口的头部记忆。
只有观察不够。Klaus 如果只按见面次数选人,会挑宿舍里点头之交的 Wolfgang,而不是真正志同道合的 Maria。所以有 reflection:当最近事件的重要性分数加总超过 150,大约每天两到三次,模型先从近 100 条记录里提出高层次问题,再检索、归纳成更抽象的判断,并引用证据编号。反思可以叠在反思上,形成一棵从具体观察到自我认知的树。
规划是为了时间轴上的自洽。直接问「现在该干什么」,Klaus 会 12 点吃午饭,12:30 再吃,1 点还吃。做法是先写一天五到八段的粗计划,再递归拆成小时块、5 到 15 分钟块。每一步感知环境,判断要不要改计划;对话按双方关于对方的记忆摘要来生成。底层模型是 ChatGPT 的 gpt-3.5-turbo,当时 GPT-4 的 API 还没开放。
小镇 Smallville 用 Phaser 搭建,25 个角色每人一段分号分隔的人设作为种子记忆。用户能改物体状态,比如把炉子改成正在烧焦,也能以内心独白下指令。
对照实验请 100 名 Prolific 评估者看完某角色的回放后,对同一角色五种来源的访谈回答做 believability 排序,再用 TrueSkill 转成分数:
| 条件 | TrueSkill μ |
| 完整架构 | 29.89 |
| 去掉反思 | 26.88 |
| 去掉反思和规划 | 25.64 |
| 众包人类扮演 | 22.95 |
| 去掉观察、规划、反思 | 21.21 |
完整架构对「无记忆」基线的效应量 Cohen's d = 8.16。Kruskal-Wallis H(4)=150.29,p<0.001;除了众包和全切除这两档垫底条件,其余两两都显著。
两天端到端模拟里,Sam 竞选市长的消息从 1 人(4%)传到 8 人(32%),Isabella 的情人节派对从 1 人传到 13 人(52%),声称知道的人在记忆流里都找得到来源。互相认识的网络密度从 0.167 升到 0.74;453 条「你认识某某吗」里 1.3%(6 条)是幻觉。12 个被邀请的人里 5 个到场,3 个有冲突,4 个口头想去但当天没排进计划。
这是后来一长串社会模拟 agent 工作的样板架构。游戏 NPC、社交产品原型、人际演练,都可以先告诉一个角色一句话意图,让扩散和协调自己长出来,不用给 25 人逐条写脚本。代价也很具体:25 人模拟两天,token 花费数千美元,墙钟时间按天计。对要上线的产品,这是 2023 年 gpt-3.5 的成本账,检索-反思-规划这三件套的分工后来仍被沿用。
完整架构赢过众包扮演,说明在「看起来像人」这件事上,有记忆的 LLM agent 已经超过临时看了回放的众包工人。这不是专家上限,论文把众包定位成能力下限。
检索会漏:Rajiv 听过竞选却回答没关注;Tom 记得要在派对上谈选举,却不确定派对存不存在。幻觉以添油加醋为主,很少凭空捏造经历,但 Isabella 会给 Sam 加一场并未约定的「明天宣布」。世界知识也会串戏:邻居叫 Adam Smith,就被说成写了《国富论》。
空间规范传不进去:宿舍浴室被当成多人卫生间,商店 5 点打烊后仍有人进门。Instruction tuning 让对话过分客气,Isabella 几乎不拒绝别人给派对提的离谱建议,兴趣会被周围人带跑。评估只覆盖两天游戏时间,众包也不是人类扮演上限。鲁棒性没测:prompt hacking、用对话植入假记忆,都还是未知数。底层模型的偏见会原样遗传。