Tencent Benchmarks Hybrid-Thinking MLLMs for Response Alignment

tencent · hf · 2026-08-24

Tencent addresses response-pattern misalignment in hybrid-thinking MLLMs between thinking and non-thinking modes. The work introduces a diagnostic benchmark and applies pattern-specific reinforcement learning penalties to align model behaviors.

Original post →

More from Research

Research channel →