腾讯发布混合思维 MLLM 基准,对齐响应模式

tencent · hf · 2026-08-24

腾讯发布研究指出,混合思维多模态语言模型在思考模式与非思考模式之间存在响应模式错位问题。研究提出了一个诊断基准,并采用模式特定的强化学习惩罚机制来对齐不同模式下的行为,从而提升模型表现。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →