Grok 4.6 登顶 MedAgentBench,临床智能体任务超 GPT-5.6 Sol
elonmusk · x · 2026-08-18
第三方评测机构 MedicalSphereAI 在 MedAgentBench(模拟电子病历环境下的临床智能体任务基准)上测得 Grok 4.6 以约 95.9% pass@1(3 次运行平均)夺得榜首,超越此前第一名 GPT-5.6 Sol 的约 94.7%,较 Grok 4.5 提升约 2.5 个百分点。在该基准中,模型作为自主智能体调用 FHIR API 完成涵盖 10 类任务的临床工作,且多次运行成绩稳定(95.3%–96.3%)。马斯克转发了这一结果。
「模型」频道最新
- Sakana AI 推出日版推理模型 Namazu,支持 26 万上下文 — SakanaAILabs · 2026-08-18
- 开发者吐槽:强模型会「自造复杂度」,agent 产码仍难维护 — aiamblichus · 2026-08-18
- Grok 4.6 登顶代理法律评测亚军,成本为 GPT-5.6 十三分之一 — XFreeze · 2026-08-18
- Grok 太快太上头:重度账户 24 小时烧掉 30% 额度 — Daniel_Farinax · 2026-08-18
- J-Space 驱动 DeepSeek V4 Pro 多项基准分暴涨 — ccerrato147 · 2026-08-18
- Qwen 3.8 medium think 对比 3.6:谁值得分配思考预算? — deathcom65 · 2026-08-18