Cura 1T:万亿参数医疗模型,人在环自进化循环拿下五项医疗评测第一

Cura 1T: Specialized Model for Agentic Healthcare

actAVA AI, :, Haolin Chen, Leon Qi, Steve Brown, Deon Metelski, Tao Xia, Joonyul Lee, Qixuan Wang, Kevin Riley, Frank Wang, Weiran Yao

cs.AI

2026-07-16

万亿参数医疗模型,基座 Kimi-K2.6,用人在环自进化循环把失败轨迹转成定向数据;六组医疗评测五组第一,域外推理不掉队。

这篇在解决什么

医疗场景对模型的要求是分裂的:病人问诊要照着医生指南说话,临床推理要啃文字和影像题,病历操作要多轮诊断里正确调用 EHR 工具。这三件事失败的姿势各不相同,而通常的做法是把医疗数据一股脑喂进去做一轮更新,补上一类能力的同时往往把另一类原本做对的能力带崩。Cura 1T 想要的就是一个模型同时扛住这三摊,且不能靠堆通用数据硬撑。

方法

核心是一个「人在环自进化循环」,由一个 LLM 训练 agent 自动跑五步,每轮只针对一个目标能力:

要点是把「数据配方」当搜索对象,而不是搜超参。每轮人确认后才往下走,崩了就回退。最终模型是从所有已完成能力循环累积下来的混合数据训出来的。基座是 Kimi-K2.6,一万亿参数,256K 上下文,LoRA rank 32。

结果

六组医疗评测里五组第一:

评测基座 Kimi-K2.6Cura 1T最强对照
MedAgentBench(EHR 工具)0.8830.940Claude Opus 4.8 0.937
HealthBench Professional0.5030.662未给
HealthBench Hard0.2220.368未给
MedXpertQA 总0.5690.655GPT-5.5 0.675
AgentClinic 总0.7540.796Claude Opus 4.8 0.794

唯一没拿第一的是 MedXpertQA 多模态(0.722,GPT-5.5 是 0.771)。域外没掉:AIME、GPQA-Diamond、τ²-Bench 都跟前沿模型持平,Retail/Telecom 还超了公开成绩。

为什么重要

给医疗做专门模型这条路上,多数人卡在「一调就崩」。这篇的价值不在万亿参数,在于那个把失败轨迹反过来喂训练的循环,它把模型迭代从「再加点医疗数据」变成了「针对具体失败定向补」。对做垂直领域模型的团队,这套人审加自动精修的循环是可直接抄的工作流。LoRA 训练说明它没动全参,迭代成本可控。

局限与存疑

作者自己说得很直:算力和数据受限,结果被当前训练 regime 封顶;行为覆盖还得扩,长程 agent 任务还没碰,全参更新留给以后。更关键的是,benchmark 分数高不等于能上临床。作者明确写 Cura 1T 是研究模型不是医疗服务,不能替代医生。LoRA rank 32 能不能撑住更深的能力也存疑。另外医疗评测本身的前沿基线(几个 0.7x 的 GPT/Claude)是按公开报告对齐的,具体设置未必一致,直接比要打个折扣。

术语

原文与代码

相关论文

全部论文解读