OpenAI 称 GPT-6 Astra 刷新 HealthBench Professional 纪录
thekaransinghal · x · 2026-09-04
OpenAI 的 Karan Singhal 介绍 GPT-6 Astra 的医疗能力表现:
- Astra 在 HealthBench Professional 上创造新的 SOTA,该 benchmark 由真实临床医生任务构成,涵盖诊疗咨询、医疗文书撰写和医学研究
- 在最低推理档位下,Astra 的成绩就已超过 GPT-5.6 Sol 的最佳分数,且成本约为后者的一半
- 团队称该评测刻意设计得对自家模型有挑战性
这是 Astra 继通用能力之后首次公开的垂直领域成绩,医疗场景的性价比提升是主要卖点。
所属事件:OpenAI 发布 GPT-6 Astra,刷新 HealthBench 纪录(3 条相关)→
「模型」频道最新
- Claude Fable 5.1 发布,用户实测称网站生成质量冠绝各家模型 — repligate · 2026-09-04
- GPT-6 Astra 发布登顶 Terminal-Bench,领先两天前发布的 Claude Fable 5.1 — sandersted · 2026-09-04
- ARC-AGI-3 已被刷爆,gdb 呼吁尽快建立新基准 — kimmonismus · 2026-09-04
- Astra 模型卡:需显式推理时无法躲避 CoT 监控 — bookwormengr · 2026-09-04
- OpenAI 研究员 roon:Astra 几周内就会过时 — Tolopono · 2026-09-04
- Codex 与 Claude 上线推理档位热切换,不破坏提示缓存 — altryne · 2026-09-04