让多个 LLM 像开会一样定行程,2B 模型连共识都达不成

AI Tour Meeting: Group Travel Planning by LLM Agents

Daisuke Kikuta

cs.AI, cs.CL, cs.MA

2026-07-21

一个多智能体旅游规划框架,让人格化 agent 讨论加投票达成共识;2B 模型撑不住协商,4B 起才能 100% 达成共识。

这篇在解决什么

让多个 LLM agent 像一个旅行团开会一样,讨论出一份大家都点头的小组行程。难点不是单点规划,而是多人偏好冲突下的群体决策:有人想爬山,有人想逛街,怎么达成一致而不让某个人全程被牺牲。现有单 agent 规划器解决不了这种「带对立偏好的协商」,而一般的 agent 框架也很少把「共识」当成一个要显式达成的终止条件。

方法

每个 agent 带一套完整人格(Name、Background、Personality、Preference、Goal、Role、Tone、Explanation-style 八个字段),人格决定了它在讨论里替谁说话、看重什么。流程分两段:先讨论(conversation),再投票(voting),循环到达成共识为止。讨论阶段每个 agent 可以 search(查信息)、ask(向别人提问)、reflect(反思自己立场),也可以 propose(提方案)、satisfied(表示满意)、pass(跳过本轮);投票阶段则 accept、reject、score。轮转规则给了五种(Round-robin 轮流、Inviting 邀请发言、Facilitating 主持引导、Random 随机、Parallel 并行),决定谁下一个发言;投票规则也给了五种(Majority 多数、Unanimous 全员一致、Single-decider 单人裁决、Most-pleasure、Least-misery),决定什么算「通过」。整套是一个可配置的多智能体协商框架,行程、人格、动作、规则都能替换。

结果

关键是模型能力门槛:

模型完成率共识达成
Qwen3.5-2B82%58%(掉链子)
4B / 9B / gpt-oss-20b / gpt-5.4-mini100%100%

偏好冲突越尖锐,讨论轮次越多、共识越难、被牺牲的人越多:aligned、mixed、conflicting 三档,轮次 10.3 / 12.1 / 25.9,共识率 100 / 100 / 94%,受害者(victim,即全程偏好被忽略的人)比例 0.7 / 1.3 / 11.3%。冲突档共识率掉到 94%、受害者冲到 11.3%,说明再好的框架也压不住尖锐对立。两个结构性发现也值得记下:后发言的人接受率更高(信息越充分越容易点头),人数 M = 3 / 5 / 10 都能 100% 达成共识(规模本身不是瓶颈,模型能力才是)。

为什么重要

它给「多智能体群体决策」提供了一个可复现的测试床,并量化了「模型要多大才撑得住协商」这个实用问题,答案是 2B 不行、4B 起步。对做多 agent 系统的人,这套人格、讨论、投票的脚手架可以直接搬去别的协商任务。但本质是一个模拟工具,不是某个能力突破。

局限与存疑

这是六篇里最薄的一篇:它是个框架加一组消融,没有和外部强基线正面比。任务域窄,只有旅游规划,结论能不能外推到更复杂的协商存疑。而且许可证是 NTT 专有协议,不是开放许可,复现和商用都要先看清条款。

术语

原文与代码

相关论文

全部论文解读