83 亿合成人格当模拟用户,MatrAIx 用 LLM 替真人评测 AI 产品

MatrAIx: Simulating the World with 8.3 Billion Persona Agents

Xiaomin Li, Yuexing Hao, Jianheng Hou, Jintao Huang, Qianfeng Wen, Shirley Huang, Yifan Liu, Xiaoyi Liu, Yilan Fan, Yijun Wang, Koutian Wu, Ruoqi Gao, Muhammad Ahmed Mohsin, Jing Tang, Brihi Joshi, Heming Liu, Zheyuan Deng, Zonglin Di, Sankalp Jajee, Jiuyao Lu, Zhiwei Zhang, Saksham Kapoor, Ishan Gupta, Yunhan Zhao, Chanwoo Park, Yucheng Lu, Bing Hu, Weihang Xiao, Aravind Mohan, Hanwen Xing, Runyu Zhang, Mihir Kulshreshtha, Yuanda Xu, Qianyu Zhu, Dianzhuo Wang, Yuxin Xiao, Bowen Jiang, Yongye Su, Wenhao Chai, Zuxin Liu, Lawrence Yunliang Chen, Xuandong Zhao, Ethan Ye, Shivam Patel, Jason Xie, Alex Martin Richmond, Weixiang Ding, Emre Okcular, Diya Mathew, Ziheng Wang, Rana M. Shahroz Khan, Zhejian Peng, Fang Wu, Fan Nie, Xinyang Han, Yubin Kim, Jiawei Zhang, Zhenting Qi, Huangyuan Su, Xu Pan, Abinitha Gourabathina, Hyewon Jeong, Hemanth Neelgund Ramesh, Kumail Alhamoud, Kimia Hamidieh, Zidi Xiong, Samuel Schmidgall, Pengrui Han, Yepeng Huang, Yongheng Wang, Bowen Yang, Alex Gu, Yuchu Wang, Akshay Paruchuri, Brenna Li, Hejie Cui, Jiayuan Ding, Chaosheng Dong, Jiahao Wang, Yixuan He, Chi Wang, Pamela Bhattacharya, Tianyi Peng, Paul Pu Liang, Mitchell Gordon, Yilun Du, Marinka Zitnik, James Zou, Prasanna Tambe, Philip Torr, Emily Fox, Asu Ozdaglar, Dawn Song

cs.AI

2026-08-05

MatrAIx 用 1,290 个维度合成 83 亿条人格,驱动 Opus 4.8/GPT 5.5/Haiku 4.5 扮用户在调查、聊天、网页、App 四类环境评测产品,人格行为 91.5% 与设定一致。

这篇在解决什么

给一个 AI 产品做用户评测,传统办法是招真人。真人贵、慢、样本难做大,而且不同背景的用户提需求、和系统互动、判断结果的方式差得很远,一两个焦点小组覆盖不了。离线 benchmark 倒是便宜可复现,但它的指标是预先定义好的,把人的多样性整个抽象掉了。

MatrAIx 想填的就是这个缝:用大模型扮演一批设定各异的人格,在调查问卷、聊天、网页、App 里替你把产品跑一遍,看不同人群会怎么反应。论文反复用的例子是,一箱汽水涨 2 美元后,不同收入和消费动机的人还买不买。

方法

整套设施分三块。

第一块是 Persona 8B,83 亿条人格记录,每条用 1,290 个类别维度描述,分成五组:背景(238,人口学、语言、学历、职业)、心理(210,人格、价值观、动机)、能力(331,跨领域专长)、行为互动(124)、生活方式(387)。记录来自两条路。

合成那条走 DAG 采样:每个维度是一个节点,有向边表示一个维度要条件依赖另一个来采(开发者更可能懂编程)。节点的采样概率是「先验 × 兼容性 × 边际匹配」三项乘积,这样相关属性不会脱钩。

真人那条把六个来源映射进同一套 schema:维基百科传记(323,438 条)、亚马逊评论(97,915)、Stack Overflow 开发者调查(113,120)、PRISM 对齐(1,487)、综合社会调查(63,532)、志愿问卷(355),没有来源支撑的维度留空。

真正放出来的是 100 万条的 coreset:599,847 条真人落地加 40 万条合成。作者承认,因为多数真人记录只来自单一来源,它们给的是边际分布,撑不起全部 1,290 维的联合覆盖。所以那个 83 亿,是合成侧按 DAG 组合展开的数字,经过质量筛选后落到公开版的只剩 40 万条合成。

第二块是 Playground,四类环境:Survey(问卷,做概念测试、价格敏感度)、AI Chatbot(和助手或客服对话,还能人为注入延迟来测满意度和继续意愿)、Web(浏览器和 computer-use agent 操作网站)、App(Docker/Linux/macOS/iOS 里的原生应用)。

第三块是 Applications,1,010 个任务模板,覆盖 25 个以上领域(Commerce 207、Software 156、Finance 161、Healthcare 168、其余 318)。按环境拆是 621 Survey、371 Chatbot、12 Web、6 App。每个任务定义成可执行的研究:选定一个人格群、跑完、记录指标并由 verifier 核验。1,010 是模板数,不是全跑过,论文实际执行了 8 个代表任务。

结果

18,189 次评测,8 个任务(每种环境两个),人格 agent 用三个模型驱动:Claude Opus 4.8、GPT 5.5、Claude Haiku 4.5。被测的助手或产品固定,只换人格背后的模型。

验证项结果
人格依从度(400 次受控实验,10 个行为属性 × 4 环境)366/400 = 91.5%;40 个格子里 33 个达到 4/5 成功,App 最弱 6/10
抽取质量(100 条真人落地,6 人评分)均值 4.135/5;Opus 4.8 在 93.8% 比较中与人均差不超过 1 分,GPT 5.5 为 79.2%
OpenBB 任务信任度分组(三个模型)Cramér's V = 0.228-0.363,q < 10⁻⁸;三模型对四档信任度排序完全一致
备餐聊天案例(每模型 1,000 人格)平均 7.1 轮对话;空巢老人执行意愿 66%,转行者 46%

第三行是关键的「能不能复现已知关联」检验:人格背景能稳定区分出不同信任度的子群,且不同模型结论一致。备餐案例展示了另一面,人格维度能解释下游行为差异。

为什么重要

对做 AI 产品和应用的人来说,这是一个可规模化的「合成用户测试」设施:上线前或不愿花钱请真人面板时,先用几百到上千个人格把价格敏感度、功能可发现性、延迟容忍、留存、推荐这些指标在不同人群上跑一遍,问题能更早暴露在特定用户群上。

要诚实定位。这是一篇基础设施论文,不是一个刷榜模型。它的验证是自洽的:检查人格 agent 有没有按设定行为(91.5%),以及能不能复现一个已知关联(信任度),并没有直接证明「模拟出来的购买意愿等于真实人群的购买意愿」。所以更合适的用法是当假设生成器,先发现值得追问的子群差异,再拿真人研究去确认。

局限与存疑

作者自己把话说清楚了:用到真实人群或重要决策前,真人研究仍是必要的;模拟评测不需要一个完美的人类行为模型也能有用。他们另点名两点:结论依赖驱动人格的模型,重要发现要换模型交叉验证、并回溯到底层交互;真人落地记录偏单源,边际分布不等于联合覆盖。

读完几处要留意。App 环境明显是短板,人格依从只到 6/10,且 1,010 个任务里只占 6 个,驱动真实应用远比填问卷难。OpenBB 那个验证虽然是已知关联,但「模型之间一致」更多说明几个 LLM 内化了同一套刻板关联,不一定等于刻画的现实分布。还有几处完整性例外,备餐任务的 GPT 5.5 那一组只有 43/370 与群组清单吻合,说明大规模跑通时执行一致性还没完全稳。社群讨论里「精准模拟全人类行为」的说法要谨慎看,论文给的是「人格按设定行为 91.5%」,不是「复现了全人类」。

术语

原文与代码

社区讨论

相关论文

全部论文解读