阿里 PAI 提出探索引导的提示词脚手架,优化多模态强化学习训练
alibaba-pai · hf · 2026-09-15
阿里 PAI 团队发布多模态强化后训练框架,核心观察是「不是所有训练提示词都同等有用」。
- 探索潜力评分:动态评估每个 prompt 对模型探索的价值
- 脚手架式改写:对有潜力的 prompt 进行 scaffolded 改写,提升其在 RL 后训练中的信号
- 效果:显著改进多模态语言模型的强化学习训练效率与效果
属于 RL 训练数据课程化方向的工作,prompt 筛选与改写思路也可迁移到其他后训练场景。
「研究」频道最新
- 用 RL 训 Kimi 基座模型设计变压器: unseen 规格达标率 93% — simonguozirui · 2026-09-15
- 铃木健联合任天堂创业家族在京都设立人工生命研究机构 ALife Institute — Hidenori8Tanaka · 2026-09-15
- 开源 GNSS 工具库 libgnss++:借日本 CLAS 校正实现厘米级定位 — rsasaki0109 · 2026-09-15
- OpenResearch 登顶 GitHub 热榜:把 Claude Code 变成科研智能体 — TheMoonMidas · 2026-09-15
- 斯坦福 SISL 新论文:无观测似然模型下的不确定性规划 — StanfordAILab · 2026-09-15
- Jarvis Bench 把语音评测拆成两问:真人盲测揭示模型自然度短板 — rohanpaul_ai · 2026-09-15