vivo AI Lab 提出置信度感知强化学习,手语翻译三项指标登顶

量子位 · wechat · 2026-09-09

vivo AI Lab 投稿量子位,针对自动手语翻译中模型“看懂却译错”的问题提出 CAPO-SLT:强化学习阶段所有正优势词元共用同一裁剪上限,导致高置信的语言先验被过度强化、低置信但值得探索的词被压制。CAPO 按旧策略对每个词的置信度动态设置更新上限(基础上限 0.2,最大放宽到 0.3),并对负优势词元限制损失幅度,不改动视觉编码器与奖励函数。

方法先以 ST-GCN 对全身姿态关键点(面部/身体/双手)做监督初始化,再用 BLEU-1、BLEU-4、ROUGE-L 与 BERTScore 组成句级奖励做强化学习微调。在 CSL-Daily 上仅用姿态输入即超过 Geo-Sign(三项指标提升 2.93/1.26/0.64)与 Uni-Sign(提升 4.96/3.07/3.67),并拿到含 Pose+RGB 方法在内的表中最佳;How2Sign 上取得 41.4 BLEU-1。消融显示相较 DAPO 三项指标提升 0.30/0.50/0.67,训练中策略熵更稳定。

典型案例:不加 CAPO 时“我分别介绍这几位同事”被译成“我是一个由几个人组成的团队”,加入后译文恢复语义忠实。局限包括美国手语侧增益较温和、奖励仍依赖参考译文的重叠指标。论文已发表于 OpenReview。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →