开源 4B 模型在瑞典医学考试上逼近 o3 水平

AccomplishedCat4770 · reddit · 2026-07-26

4B 开源模型在瑞典医学问答上逼近 o3

作者拿瑞典医师执照考试的多选题做了实测,对比了多个小型开源权重模型在医学问答上的表现。

作者还观察到,推理长度不设上限时,部分样本会陷入反复循环、把上下文全占满却不给答案;借助 S-GRPO 论文里提出的 early-exit thinking 干预,在预定长度处强行结束思考链条,效果更实用。作者尝试了缩短推理轨迹的强化学习方案,但收益不大,可能是训练规模不够。

另一个有意思的细节是:即使输入是瑞典语,Qwen3.5-4B 的推理过程仍然用英语进行,但这似乎并不妨碍它取得高分,说明语言未必是此类任务的主要障碍。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →