前沿模型医学结论合成进步有限,最高 factual F1 仅 41.1
manoelribeiro · x · 2026-10-07
前沿模型在医学结论合成任务上进步甚微:最好的 GPT-6.1 Sol 也只达到 41.1 factual F1,多数模型集中在约 0.30–0.33,说明医疗领域的结论合成仍是难题。
所属事件:SciConBench 入选 NeurIPS:最强 AI 医学结论合成 F1 仅 0.337(10 条相关)→
「模型」频道最新
- Ollama 上架 Google EmbeddingGemma 2:740M 多模态嵌入模型 — ollama · 2026-10-07
- Reddit 用户吐槽 ChatGPT 频繁误判违规:"对不起,戴夫"式拒绝越来越多 — Crixusgannicus · 2026-10-07
- Runware API 上线两款内容审核模型,政策用自然语言描述即可 — aziz4ai · 2026-10-07
- Ethan Mollick 提醒 AI 实验室:先确保自家模型会用自家产品 — emollick · 2026-10-07
- OpenAI 推出 Decisions API 公测:比 GPT-6 Luna 快 10 倍替应用做决策 — OpenAIDevs · 2026-10-07
- Cloudflare 开源视觉决策模型 clef,速度惊艳引热议 — michellechen · 2026-10-07