2026-09-01
CQ-Bench把世界价值观调查写入多角色对话,测模型能否读出隐含态度。o1价值选择F1达0.809,态度检测仅0.622,低于人类的0.689。
现有文化评测多半盯着「某个国家的人通常怎么做」,或者要求模型在明确给出人设后再说话。日常对话里,价值观几乎不会被直接念出来,它们藏在闲聊、抱怨和举例里。同一文化群体内部态度也并不一致,按国籍贴标签会把人写扁。
CQ-Bench 要测的是另一件事:模型能不能从一段看起来很日常的多角色对话里,读出说话人没明说的文化态度。题目来自世界价值观调查(World Values Survey)和 GlobalOpinions,覆盖伦理、信仰、社会、公共议题。文化智力(CQ)在这里被定义成「外来者解读含混文化线索」的能力,不是百科知识问答。
每篇故事有 4 到 5 个角色,随机嵌入约 5 条价值观。一条价值观拆成陈述句加态度选项,例如「工作是对社会的义务 / 同意」。设置有三种:全体角色共享同一态度的随机抽样、按类别抽样,以及同一话题上角色态度互相冲突。故事用 GPT-4o-mini 生成,GPT-4o 做纳入、一致性和隐含性三轮校验;缺失的值从标签里删掉,互相矛盾的值记下来。人工抽检 150 篇、750 条价值观后,纳入判断与人的一致率 94.5%,Cohen's κ 为 0.546,一致性校验一致率 92.5%。
三条任务难度递增:
推理提示用 summarize-then-analyse:先摘相关发言,再判断态度或选题。小模型上,朴素长思维链经常比直接作答更差。
人类在 25 篇子集上 AD 平均 0.689、VS 平均 0.765。前沿模型把选题做到接近人,态度检测仍明显落后。
| 模型 | AD 推理 F1 | VS 推理 F1 | VE |
| 人类 | 0.689 | 0.765 | — |
| o1 | 0.622 | 0.809 | 0.610 |
| DeepSeek-R1 | 0.635 | 0.814 | 0.736 |
| o3-mini | 0.661 | 0.779 | 0.598 |
| GPT-4o-mini | 0.639 | 0.576 | 0.602 |
AD 更低的主因是中性项和程度项:模型分得清同意/反对,却常把「同意」滑到「既不同意也不反对」,也分不清「不经常」和「完全不」。把相近选项合并后,GPT-4o-mini 升到 0.820,R1 升到 0.837。信仰类全面最弱;政见态度好认,公共议题话题本身不好选。VE 上规模不再单调:Qwen2.5-32B 到 0.629,超过 o3-mini 的 0.598。
用 o3-mini 的 500 条推理轨迹做 LoRA 监督微调后,LLaMA-3.2-3B 在政见 AD 上从 0.419 到 0.728,略超 o3-mini 的 0.727;信仰类 AD 从 0.454 到 0.708,也超过 o3-mini 的 0.703。GRPO 在选择题型的 AD 上增益较小,在更难的 VS 上往往更大。
这是一份可复现的「隐含价值观阅读」量表,不是又一个国家刻板印象测验。对要做跨文化客服、角色扮演或多智能体的人,它把失败模式钉死了:中性档、程度档、信仰话题、以及小模型上的长思维链。500 条蒸馏就能让 3B 模型在若干分项上超过 o3-mini,说明文化推理可以被高效灌进去,不必先堆到前沿规模。
数据是合成的,所以它更适合当诊断工具,不适合当「真实人类价值观」的金标准。
多态度设定只评了 AD,没评 VS/VE,而多角色各执一词才更接近真实群聊。隐含改写质量不稳定:模型识别「说得太直」容易,写成自然的含蓄发言难。生成时模型自己也会搞混程度选项,人读起来同样吃力;四名人类标注者的 AD 从约 50% 到 80% 不等。故事由 GPT-4o-mini 写、GPT-4o 审,可能把生成模型自己的文化先验写进了考题。VE 用 GPT-4o 当裁判,与人在 25 篇上的一致率 0.864,仍是模型评模型。