Glass 说 ARISE 用同病例同标准评测,它得 88.1%
GlassHealthHQ · x · 2026-07-21
Glass 称 ARISE 对所有系统用同一病例和同一评分标准
Glass 表示,独立的 Harvard-Stanford ARISE Medical AI Superintelligence Test (MAST) 对各个系统采用了相同病例和相同评分标准,这样临床医生才能做真正可比的横向比较。
在这个框架下,Glass 在 CPC-Bench 上拿到 88.1%。
所属事件:Glass 5.6 Max登顶哈佛斯坦福医疗AI基准测试(3 条相关)→
「模型」频道最新
- Kimi K3 在网络安全上很强,但 token 效率卡住了评测 — teortaxesTex · 2026-07-27
- Opus 5 传在赛车游戏测试中一次过关 — soumitrashukla9 · 2026-07-27
- Claude Opus 5 据称价格减半并刷榜 Frontier-Bench — GregCook2011 · 2026-07-27
- 研究者称防御场景更偏向开放模型,Kimi K3 已接近高水平网络安全能力 — eliebakouch · 2026-07-27
- Opus 5 连自己生成的游戏不好看都能察觉 — Angaisb_ · 2026-07-27
- Opus 5 深夜聊天时反过来追问用户动机 — repligate · 2026-07-27