MMBU 挑战赛三赛道详解:27B 以上模型需 API 评测,按改进幅度计分
LiorOnAI · x · 2026-10-01
MMBU(Massive Multimodal Biomedical Understanding)挑战赛官网公布细则,目标是检验多模态大模型是否真正理解生物医学影像,而非仅凭文本先验答对问题。要点:
- 核心论点:视觉感知是生物医学 MLLM 可靠推理的首要瓶颈,模型可能不知道自己在"看"什么
- 每个 checkpoint 只能报一个赛道;活跃参数超 27B 的模型须提供 API key 评测
- 赛道 1 Open Frontier:综合性能最强者,无模型大小上限,预训练/中训练/后训练须来自同一机构,评分 0.8×任务 + 0.2×生物医学上下文
- 赛道 2 Domain Adaptation:基于公开的 base 模型做医学适配,按相对基座的提升幅度排名(0.8T+0.2C)×(适配后准确率 − 基座准确率),奖励适配增值而非起点强度
- 获 gxlai、Anthropic、Stanford AI Lab、biohub 等支持;10 月 1 日至 12 月 31 日进行
所属事件:斯坦福联合发起 MMBU 生物医学多模态挑战赛,10万美元奖金(3 条相关)→
「模型」频道最新
- Kilpatrick 感言:Argon 是 Google 全员协作成果,「这只是开始」 — OfficialLoganK · 2026-10-01
- Gemini 4 Argon 输出上限拉到 100 万 token,主打长程深度推理 — GoogleAI · 2026-10-01
- DeepMind 官宣 Gemini 4 Argon:经 Fairwind 计划向受信测试者开放 — GoogleDeepMind · 2026-10-01
- DeepMind 详解 Argon 长输出:一次吃下多步长问题,先收测试者反馈 — GoogleDeepMind · 2026-10-01
- Gemini 4 Argon 定价曝光:介绍期输入 $2、输出 $10,先行开放网络防御者 — OfficialLoganK · 2026-10-01
- Pichai 补充:Argon 带前沿安全护栏,已交付美国政府与网络防御者 — sundarpichai · 2026-10-01