Falcon Perception 引入 GRPO 强化学习后训练

Falcon Perception 发布基于 GRPO 强化学习后训练的更新版本,针对自回归感知模型在最大似然训练下难以优化密集目标检测与分割的痛点,显著提升了 referring expression 能力。RL 训练中仅采样训练语言头与中心头,尺寸与掩码保持冻结,但通过感知链的级联效应,冻结部分也随之改善。

2026-08-22 ~ 2026-08-23 · 2 条相关