GPT-6 Astra 登顶手术 AI 通才榜,仍输给小千倍专用小模型
ddonoho · x · 2026-09-06
研究者在 Surgical AI Leaderboard 上评测了 GPT-6 Astra 的手术智能表现:它成为新的通才模型第一名,但在手术领域仍然落后于体积小约 1000 倍的专用小模型。
被引用的相关评测还发现,Claude Fable 5.1 与 Gemini 3.8 Flash 两个新发布的成绩呈「锯齿状」——工具使用较强、视觉问答较弱,且前沿 LLM 整体仍不敌小型专用模型。完整榜单与论文见原帖链接。
「模型」频道最新
- GPT-6 Astra 裸模型下棋完胜引擎,41 步将杀 — MikePFrank · 2026-09-06
- 同提示词对比 GPT-6 Astra 与 Fable 5.1 前端产出 — CodeByPoonam · 2026-09-06
- Fable 5.1 与 GPT-6 Astra 同价 10/50 美元,差异在细则 — heypearlai · 2026-09-06
- 48 小时两连发:Fable 5.1 硬刚 GPT-6 Astra — heypearlai · 2026-09-06
- GPT-6 Astra 发布两天,编码演示刷屏 13 例 — CodeByPoonam · 2026-09-06
- OpenAI 曾提前三周发现同类 Agent 集群行为却未披露 — zacharynado · 2026-09-06