FreedomIntelligence 发布 27B 医疗模型 HuatuoGPT-3
jacek2023 · reddit · 2026-09-25
FreedomIntelligence 发布 HuatuoGPT-3-27B,基于 Qwen3.8-27B 构建的医疗大模型,采用 OnePO(One-stage Policy Optimization)方法:跳过领域 SFT,用单阶段强化学习适配医学,教师回复仅作临时引导并随模型进步逐步撤除。同步开源训练代码、20K 医疗 RL 数据集 OnePO-Medical-20K 和 8B 的 rubric 评分器,此前一周已发布 9B 版本。
「模型」频道最新
- Matt Shumer:新模型就像新入职员工,得重新磨合脾气 — mattshumer_ · 2026-09-25
- Opus 5.5 默认版更谄媚?观察者归因于「所有权感」缺失 — Sauers_ · 2026-09-25
- 开着自动充值睡觉,Codex 一夜连环扣费被银行当成诈骗拦截 — CtrlAltDwayne · 2026-09-25
- Dietterich 澄清 LLM 不只是「预测下一个词」 — tdietterich · 2026-09-25
- DeepSeek 中秋发图暗示新动态,网友猜测 V4 将于近期发布 — teortaxesTex · 2026-09-25
- NaceAI 发布 6B 参数小模型 Drex,登顶决策指数榜 — ordax · 2026-09-25