HuatuoGPT-3 仅 27B 在 HealthBench 达 70.1,超越 GPT-6 Astra

CUHKSZ · hf · 2026-10-07

港中深团队发布 HuatuoGPT-3,探索从基座模型出发的 纯 RL 领域适配,绕开主流 SFT+RL 流水线。论文指出纯 on-policy RL 有冷启动问题,混合策略 RL 存在两大失效模式:梯度饥饿(早期对教师输出中有信息量的 token 学习过慢)与教师分布锚定(过时教师输出拖累后期提升)。

为此提出 OnePO:自适应目标演化强化低概率有信息 token 的学习,并在策略超过教师后通过 Teacher Retirement 丢弃教师输出。医疗适配上仅用 2 万样本即在 HealthBench 达 67.2,比 SFT+RL 和纯 RL 分别高 2.7 和 7.4 分;扩展出的 27B 模型达 HealthBench 70.1、HealthBench Professional 71.4,超过 GPT-6 Astra 等前沿模型。模型与代码已开源。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →