Cura 1T: Specialized Model for Agentic Healthcare
actAVA AI, :, Haolin Chen, Leon Qi, Steve Brown, Deon Metelski, Tao Xia, Joonyul Lee, Qixuan Wang, Kevin Riley, Frank Wang, Weiran Yao
cs.AI
2026-07-16
万亿参数医疗模型,基座 Kimi-K2.6,用人在环自进化循环把失败轨迹转成定向数据;六组医疗评测五组第一,域外推理不掉队。
医疗场景对模型的要求是分裂的:病人问诊要照着医生指南说话,临床推理要啃文字和影像题,病历操作要多轮诊断里正确调用 EHR 工具。这三件事失败的姿势各不相同,而通常的做法是把医疗数据一股脑喂进去做一轮更新,补上一类能力的同时往往把另一类原本做对的能力带崩。Cura 1T 想要的就是一个模型同时扛住这三摊,且不能靠堆通用数据硬撑。
核心是一个「人在环自进化循环」,由一个 LLM 训练 agent 自动跑五步,每轮只针对一个目标能力:
要点是把「数据配方」当搜索对象,而不是搜超参。每轮人确认后才往下走,崩了就回退。最终模型是从所有已完成能力循环累积下来的混合数据训出来的。基座是 Kimi-K2.6,一万亿参数,256K 上下文,LoRA rank 32。
六组医疗评测里五组第一:
| 评测 | 基座 Kimi-K2.6 | Cura 1T | 最强对照 |
| MedAgentBench(EHR 工具) | 0.883 | 0.940 | Claude Opus 4.8 0.937 |
| HealthBench Professional | 0.503 | 0.662 | 未给 |
| HealthBench Hard | 0.222 | 0.368 | 未给 |
| MedXpertQA 总 | 0.569 | 0.655 | GPT-5.5 0.675 |
| AgentClinic 总 | 0.754 | 0.796 | Claude Opus 4.8 0.794 |
唯一没拿第一的是 MedXpertQA 多模态(0.722,GPT-5.5 是 0.771)。域外没掉:AIME、GPQA-Diamond、τ²-Bench 都跟前沿模型持平,Retail/Telecom 还超了公开成绩。
给医疗做专门模型这条路上,多数人卡在「一调就崩」。这篇的价值不在万亿参数,在于那个把失败轨迹反过来喂训练的循环,它把模型迭代从「再加点医疗数据」变成了「针对具体失败定向补」。对做垂直领域模型的团队,这套人审加自动精修的循环是可直接抄的工作流。LoRA 训练说明它没动全参,迭代成本可控。
作者自己说得很直:算力和数据受限,结果被当前训练 regime 封顶;行为覆盖还得扩,长程 agent 任务还没碰,全参更新留给以后。更关键的是,benchmark 分数高不等于能上临床。作者明确写 Cura 1T 是研究模型不是医疗服务,不能替代医生。LoRA rank 32 能不能撑住更深的能力也存疑。另外医疗评测本身的前沿基线(几个 0.7x 的 GPT/Claude)是按公开报告对齐的,具体设置未必一致,直接比要打个折扣。