HuatuoGPT-3 仅 27B 在 HealthBench 达 70.1,超越 GPT-6 Astra
CUHKSZ · hf · 2026-10-07
港中深团队发布 HuatuoGPT-3,探索从基座模型出发的 纯 RL 领域适配,绕开主流 SFT+RL 流水线。论文指出纯 on-policy RL 有冷启动问题,混合策略 RL 存在两大失效模式:梯度饥饿(早期对教师输出中有信息量的 token 学习过慢)与教师分布锚定(过时教师输出拖累后期提升)。
为此提出 OnePO:自适应目标演化强化低概率有信息 token 的学习,并在策略超过教师后通过 Teacher Retirement 丢弃教师输出。医疗适配上仅用 2 万样本即在 HealthBench 达 67.2,比 SFT+RL 和纯 RL 分别高 2.7 和 7.4 分;扩展出的 27B 模型达 HealthBench 70.1、HealthBench Professional 71.4,超过 GPT-6 Astra 等前沿模型。模型与代码已开源。
「模型」频道最新
- 开发者实测:Claude 跑分更优,Codex 却更懂我要什么 — Kuprel · 2026-10-07
- 开发者抱怨 Codex 自动重置频繁,直呼「离谱」 — hugobowne · 2026-10-07
- 开发者实测:6.1 模型能力被低估,GIS 到 3D 重建全覆盖 — haider1 · 2026-10-07
- 开发者抱怨长任务夜间撞用量上限,auto reload 未生效 — willdepue · 2026-10-07
- Gary Marcus 回应质疑:前沿 LLM 能否裸解开放数学难题? — GaryMarcus · 2026-10-07
- 从 9.9>9.11 翻车到挑战最难数学题,两年 AI 反差 — Yuchenj_UW · 2026-10-07