EMNLP 论文:LLM 模拟对话远比真人更「配合」,难复现冲突行为
peizNLP · x · 2026-09-12
Ryo Kamoi 等人的论文被 EMNLP 2026 接收,研究 LLM 模拟人类社交对话的可靠性。作者指出真实人类对话充满不一致与非协作行为(误解、打断等),合格的 LLM 模拟应能以接近真实频率复现这些行为。
团队提出 CoCoEval 评估框架:
- 在 turn 级别检测 10 类不一致/非协作行为
- 附带一个覆盖协作与冲突场景的职业对话模拟 benchmark
用 CoCoEval 对比真人对话与 GPT-4.1、GPT-5.1、Claude Opus 4 的模拟对话,发现:
- 在普通 prompt 下,LLM 模拟对话的不一致与非协作行为远少于真人
- 这对用 LLM 替代人类被试做社会科学研究的做法提出警示
「漫话AGI」频道最新
- Polymarket 押注 71%:今年内 AI 实验室将宣布再解一道千禧年难题 — Polymarket · 2026-09-12
- 前 Anthropic/OpenAI 研究员称 AI 会自我复制难拔插头,遭网友算账打脸 — basedjensen · 2026-09-12
- 菲尔兹奖得主邓煜放话:AI 若能解出全部数学题就转行写言情小说 — Polymarket · 2026-09-12
- Manifold 上「AI 2030 年前灭绝人类」仅 5%,作者论预测市场对末日风险的局限 — j_foerst · 2026-09-12
- 对冲基金大佬 Ole Lehmann:AI 正在大规模削减招聘,动荡期将至 — MattGarciaEth · 2026-09-12
- Timnit Gebru 称 AI 灭绝论是转移视线,DeepMind 前研究员反驳 — Turn_Trout · 2026-09-12