混合思考MLLM非思考接口坏模式触发率最高差48.6点

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang

cs.CV

2026-08-13

2415条多模态题显示混合思考MLLM非思考模式坏回复触发率一律更高,最大差48.64点;PatternRL把8B相对纯正确率RL的触发率再压14.35点。

这篇在解决什么

混合思考多模态大模型把「多想一会儿」和「马上答」做成同一套权重上的两个开关。思考模式多花测试时计算,非思考模式压延迟。产品上省事,但两条路交到用户眼前的那段字,标准不该打折:别把草稿漏出来,别原地复读,别前后打架,别套一层推理腔却没有证据。正确率优化管不到这些。

中科院自动化所和腾讯把这个缺口叫 response-pattern alignment。他们拿25组开源、闭源、稠密和 MoE 配置,在同一套图文题上配对跑思考和非思考。非思考的坏模式触发率全部更高,最大差距48.64个百分点,出在 Kimi-K2.6 上。正确率再高,接口一切换,回复形态就会塌。

方法

先做诊断集 PatternEval。从视觉感知与定位、OCR 与结构化图、多模态知识推理三类任务里筛出2415条图文题,九个细类。构图故意堆容易出坏回复的难例,测的是加压条件下的条件稳健性,不是线上故障率。评的是用户最终看到的那段;若接口把推理通道和最终回答分开,推理通道不计入。

四类坏模式:

正确率用 Qwen3-Max 按源数据集标准判。坏模式用 Seed-2.0-Pro 看图打四维0/1,任一维为1就算 Trigger。四类标签不互斥,且有 CoT 优先归属:已经算进泄漏的证据不再重复记矛盾或表演式。评委本身在2500条人工标注校准集上选过。CoT 和复读表面线索多,好判;矛盾和表演式推理要做跨句一致性和视觉接地,F1明显更低。

训练侧先用三家评委全票一致的约5.2万条样本,把 Qwen3.5-27B 做成 PatternRM,只看文本、直接预测四维标签,宏 F1 为71.3%。再接到 GRPO 上得到 PatternRL,数据是约4.42万条多模态数学、逻辑和文档理解题。奖励以 boxed 答案对错为主,PatternRM 抽60%的 rollout 打辅助罚分:CoT 和复读各0.05,矛盾和表演式各0.02,合计封顶0.1。答错永远是0,答对落在0.9到1之间。基线 BaseRL 同一套数据和 verifier,不加这项罚分。4B训600步,8B训400步。

结果

25组配置全部是非思考 Trigger 更高。17组 Δpat 超过20个百分点。CoT 泄漏是主因。50行模型×模式的边际触发率:CoT 12.75%、复读8.49%、表演式4.72%、矛盾2.74%。有优先归属,不能当独立患病率。

模型非思考 Trigger思考 TriggerΔpat
Kimi-K2.649.63%0.99%48.64
Qwen3.5-397B29.32%4.23%25.09
Seed-2.0-Pro6.94%3.13%3.81
GPT-5.55.04%0.78%4.26

Qwen3.5 从4B到397B,思考模式 Trigger 从22.19%降到4.23%,非思考在27B之后卡在28%到33%,跨模式缺口不再随规模缩小。更长的回复更容易中招:非思考 Pearson r=0.64,思考 r=0.84。最长六分位里,答对的非思考回复 Trigger 仍约56%。

设置AccTrigger
Qwen3-VL-8B 非思考49.37%36.77%
BaseRL50.57%44.33%
PatternRL50.71%29.98%

只追正确率的 BaseRL 把坏模式推得更狠。PatternRL 相对 BaseRL,4B和8B的非思考 Trigger 分别降13.08和14.35点,PatternEval 正确率变动不到1点。十项通用榜上8B均分从 BaseRL 的79.59落到78.89,4B从77.89落到76.02,小模型代价更明显。

为什么重要

部署混合思考接口的人如果只看准确率,会系统性低估非思考路径的产品事故。漏思维链、复读、装推理,用户一眼就能看见。PatternEval 是加压诊断集,数字不能直接当线上故障率;但它说明规模和正确率都填不平这条缺口。PatternRL 是一条可接到现有 GRPO 上的补丁,8B比4B更能同时保住正确率和回复形态。

局限与存疑

PatternRL 没有把失败消掉:8B非思考 Trigger 仍有29.98%,相对思考模式的15.98%还差14点。论文写明,坏模式可能在 SFT 阶段就已经写进权重,只靠 RL 辅助奖励不够。4B在数学推理上掉得更明显,短而干净的轨迹对小模型可能太挤。PatternRM 不看图,多模态接地的矛盾和表演式推理会漏;评委对这两类标签 F1 本就不高,训练信号有噪声。更根本的是,这是条件稳健性测试,不是部署分布估计。

术语

原文与代码

相关论文

全部论文解读