开源医疗AI智能体ATHENA发布:推理准确率超GPT-5

研究团队发布了开源医疗治疗推理智能体ATHENA,该系统能够对1939年以来所有FDA批准的药物进行治疗推理。ATHENA的核心突破在于,它不再依赖大模型权重中的静态知识,而是通过调用212种生物医学工具逐步推断所需证据,从而有效解决医疗决策中需要综合疾病背景、合并症和药物禁忌证等复杂场景的难题。

性能表现与基准测试

在测试基准中,ATHENA在3168道药物推理题(DrugPC)和456个患者特异性治疗病例(TreatmentPC)上分别取得94.7%和82.9%的准确率,相比GPT-5分别高出17.8和10.7个百分点,并大幅优于DeepSeek-R1(671B)。此外,研究团队在Biohub Rare As One网络的28个罕见病专家组织中进行了盲测,覆盖神经发育障碍、癫痫和罕见癌症等案例,ATHENA在包含认知可追溯性等全部8项评估标准上均战胜了对照模型。

技术机制与训练方法

ATHENA具备在推理的每一步中识别缺失信息并调用正确工具的“元认知”能力。由于无法在如此庞大的规模上进行人工标注,研究团队分两阶段对其进行训练:第一阶段由智能体自动生成工具调用轨迹进行监督微调;第二阶段则利用带有科学反馈奖励的强化学习,使其掌握在得出结论前主动寻找证据的能力,最终形成可检查的完整推理链。

临床评估与真实数据验证

在实际临床应用潜力方面,ATHENA在西奈山医院接受了执业医师的评估,成功处理了合并慢性肾病的心脏搭桥术后患者等无单一指南推荐答案的ICU级复杂病例。同时,研究团队将ATHENA生成的不良事件关联假说放入以色列Clalit Health的540万患者纵向电子健康档案中进行大规模验证,预测关联的校正比值比达到1.48至1.84,而阴性对照组接近零,证明了其预测在真实世界数据中的有效性。

2026-07-07 ~ 2026-07-08 · 8 条相关

一手来源