Medmarks 医疗基准更新:Gemma 4 31B 领跑 20-40B 开源模型
iScienceLuvr · x · 2026-09-21
Sophont 团队更新了开源医疗能力基准 Medmarks(含排行榜),新增 Gemma、Qwen、Muse、Nemotron 等最新中型开源模型的评测结果。
- 核心结论:在 20B-40B 参数区间,Gemma 4 31B 表现领先;Qwen 3.8 27B 在健康类任务上无法匹敌 Sonnet 级闭源模型。
- 基准规模:已评测 70 个模型、89 种配置,Medmarks-Verified 覆盖医学知识、专家级临床推理、医学计算与不确定性推理,数据集、提示词与评分代码全部公开可复现。
- 计分方式:采用相对胜率(win rate)而非绝对准确率,需在同一评测快照内比较。
- 定位:聚焦可在单张 5090 或高配 Mac 上本地运行的消费级开源模型。
所属事件:Medmarks 医疗基准更新:Gemma 4 31B 领跑中型开源模型(2 条相关)→
「模型」频道最新
- Evo 2 模型内部竟编码「生命之树」:激活流形对应物种演化关系 — burny_tech · 2026-09-22
- 内部实测:Grok 4.7 在 22 项知识工作中排第 3,成本低于 5 美元 — realsohamparekh · 2026-09-22
- Codex 代码泄露 GPT-6 Luna:已内置定价,疑似与 Sol 同期发布 — haider1 · 2026-09-22
- Alex Atallah:专用小模型涌现,Jev 时刻或重塑 AI 生态 — multiply_matrix · 2026-09-22
- 用 GPT Vision + Jev 搭颜值打分器:三步流程实测与踩坑 — huangyun_122 · 2026-09-22
- Opus 零样本一次生成 impressive SVG 动画,效果惊艳 — LightVelox · 2026-09-22