Grok 4.6 登顶 MedAgentBench,临床智能体任务超 GPT-5.6 Sol

elonmusk · x · 2026-08-18

第三方评测机构 MedicalSphereAI 在 MedAgentBench(模拟电子病历环境下的临床智能体任务基准)上测得 Grok 4.6 以约 95.9% pass@1(3 次运行平均)夺得榜首,超越此前第一名 GPT-5.6 Sol 的约 94.7%,较 Grok 4.5 提升约 2.5 个百分点。在该基准中,模型作为自主智能体调用 FHIR API 完成涵盖 10 类任务的临床工作,且多次运行成绩稳定(95.3%–96.3%)。马斯克转发了这一结果。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →