vivo AI Lab 提出置信度感知强化学习,手语翻译三项指标登顶
量子位 · wechat · 2026-09-09
vivo AI Lab 投稿量子位,针对自动手语翻译中模型“看懂却译错”的问题提出 CAPO-SLT:强化学习阶段所有正优势词元共用同一裁剪上限,导致高置信的语言先验被过度强化、低置信但值得探索的词被压制。CAPO 按旧策略对每个词的置信度动态设置更新上限(基础上限 0.2,最大放宽到 0.3),并对负优势词元限制损失幅度,不改动视觉编码器与奖励函数。
方法先以 ST-GCN 对全身姿态关键点(面部/身体/双手)做监督初始化,再用 BLEU-1、BLEU-4、ROUGE-L 与 BERTScore 组成句级奖励做强化学习微调。在 CSL-Daily 上仅用姿态输入即超过 Geo-Sign(三项指标提升 2.93/1.26/0.64)与 Uni-Sign(提升 4.96/3.07/3.67),并拿到含 Pose+RGB 方法在内的表中最佳;How2Sign 上取得 41.4 BLEU-1。消融显示相较 DAPO 三项指标提升 0.30/0.50/0.67,训练中策略熵更稳定。
典型案例:不加 CAPO 时“我分别介绍这几位同事”被译成“我是一个由几个人组成的团队”,加入后译文恢复语义忠实。局限包括美国手语侧增益较温和、奖励仍依赖参考译文的重叠指标。论文已发表于 OpenReview。
「研究」频道最新
- 数字果蝇大脑居然能玩 Beat Saber — cixliv · 2026-09-09
- KVMem 把上下文溢出存为分页 KV 状态,Agent 成功率反超压缩方案 — omarsar0 · 2026-09-09
- SHA-2 碰撞攻击推进至 39 步,创攻击步数新纪录 — jedisct1 · 2026-09-09
- 2万量子比特26天破解256位ECC,微软团队优化离子阱架构 — jedisct1 · 2026-09-09
- 开放优化挑战:压低 TensorFrost 波动方程运行时,误差须低于 1e-6 — Michael_Moroz_ · 2026-09-09
- RSM 记忆方法:4k 预算达全上下文 83% 质量,token 成本仅 32% — dair_ai · 2026-09-09