开源 4B 模型在瑞典医学考试上逼近 o3 水平
AccomplishedCat4770 · reddit · 2026-07-26
4B 开源模型在瑞典医学问答上逼近 o3
作者拿瑞典医师执照考试的多选题做了实测,对比了多个小型开源权重模型在医学问答上的表现。
- 在 MedQA-SWE 上,GPT-4 2024 年做到 84%,而 o3 在 2025 年于一个较小、部分重叠的数据集上做到 88%。
- 通过对早期年份试题做 SFT,MedGemma-1.5-4B 在最终年份考试上达到了 60%,已经能过线。
- 但更晚发布的模型直接更强:Gemma4-E4B 和 Qwen3.5-4B 在不做后训练的情况下就达到 77%。
- 开启推理后,Qwen3.5-4B 还能进一步提升到 87%。
作者还观察到,推理长度不设上限时,部分样本会陷入反复循环、把上下文全占满却不给答案;借助 S-GRPO 论文里提出的 early-exit thinking 干预,在预定长度处强行结束思考链条,效果更实用。作者尝试了缩短推理轨迹的强化学习方案,但收益不大,可能是训练规模不够。
另一个有意思的细节是:即使输入是瑞典语,Qwen3.5-4B 的推理过程仍然用英语进行,但这似乎并不妨碍它取得高分,说明语言未必是此类任务的主要障碍。
「模型」频道最新
- Grok 4.5 测试显示,大任务拆成低多边形块更有效 — Daniel_Farinax · 2026-07-26
- 有人直言:不发开权重是商业选择,阻止别人发才是问题 — rdesh26 · 2026-07-26
- Kimi K3 预计明天开放权重,开源阵营再添一弹 — Hot_Example_4456 · 2026-07-26
- Claude使用截图曝光Max计划限额与1775美元积分消耗 — letandrewcook · 2026-07-26
- Claude Opus 5 在 WeirdML v2 得分 86.3%,仍输出七千多 token — xeophon · 2026-07-26
- ChatGPT 两小时提示词产出一篇论文式数学推导 — airkatakana · 2026-07-26