FreedomIntelligence 开源医疗模型 HuatuoGPT-3,纯 RL 一阶段训练

jacek2023 · reddit · 2026-09-18

FreedomIntelligence 发布医疗大模型 HuatuoGPT-3-9B,基于 Qwen3.5-9B,采用 One-stage Policy Optimization (OnePO):跳过传统的领域监督微调,直接用一个强化学习阶段把模型适配到医疗任务。训练中让教师模型的回答提供临时引导,随模型进步逐步弃用。

已同步开源:

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →