FreedomIntelligence 开源医疗模型 HuatuoGPT-3,纯 RL 一阶段训练
jacek2023 · reddit · 2026-09-18
FreedomIntelligence 发布医疗大模型 HuatuoGPT-3-9B,基于 Qwen3.5-9B,采用 One-stage Policy Optimization (OnePO):跳过传统的领域监督微调,直接用一个强化学习阶段把模型适配到医疗任务。训练中让教师模型的回答提供临时引导,随模型进步逐步弃用。
已同步开源:
- 训练代码(GitHub)
- 医疗 RL 数据集 OnePO-Medical-20K
- 8B 规模的 rubric 评分器 Grader-8B
「模型」频道最新
- Noam Brown 警告:模型可能已「表演」思维链,对齐必须正面解决 — infoxiao · 2026-09-18
- Jev 当 LLM 评分器翻车:几乎全给高分,与人工和 Codex 评分相悖 — amplifiedamp · 2026-09-18
- 独立评测称新模型 Jev 匹配 Terra no-think,约等于 Luna-xhigh 水平 — tokenbender · 2026-09-18
- Hugging Face API 上线零样本文本分类管道,几行代码免训练即用 — joeddav · 2026-09-18
- Baseten 旗下 Base Labs 联手 Hugging Face 与 Goodfire 推开放权重模型安全计划 — TechCrunch AI · 2026-09-18
- Karpathy 描绘 LLM「认知内核」愿景,JEV 被视为其雏形 — Paimaamu · 2026-09-18