FreedomIntelligence 发布 27B 医疗模型 HuatuoGPT-3

jacek2023 · reddit · 2026-09-25

FreedomIntelligence 发布 HuatuoGPT-3-27B,基于 Qwen3.8-27B 构建的医疗大模型,采用 OnePO(One-stage Policy Optimization)方法:跳过领域 SFT,用单阶段强化学习适配医学,教师回复仅作临时引导并随模型进步逐步撤除。同步开源训练代码、20K 医疗 RL 数据集 OnePO-Medical-20K 和 8B 的 rubric 评分器,此前一周已发布 9B 版本。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →