GPT-6 Astra 医学专家基准得 87.4%,两年从 42.8% 近乎饱和
toshv · reddit · 2026-09-11
Reddit 用户在 MedXpertQA(专家级医学知识基准)上测试 GPT-6 Astra,得 87.4%,超过 OpenAI、Google 等所有已测模型。两年前 GPT-4o 在该基准仅 42.8%,如今已接近饱和。作者公布了按器官系统分类的可筛选结果页面(natomy.com/med-evals),并接受指定其他模型的测试请求。这是目前该基准少见的最新模型横评。
「模型」频道最新
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11
- 用户切回 GPT-5.6:省用量且体感更快 — CtrlAltDwayne · 2026-09-11
- 开发者观点:好的封装下模型差异很小,Grok 4.6 够用 — gnukeith · 2026-09-11