医疗智能体实测:最贵模型反而错最多

Ubunta · x · 2026-08-05

作者耗时两周构建用于真实世界证据(RWE)的医疗 AI 智能体,并在相同队列生成任务上对比了 5 个前沿模型。结果显示,最贵的模型(Opus 5)消耗的输入 token 最多,且在规划和工具调用上的报错率最高;而 Sonnet 4.6 在多步工作流中表现最稳定且高效。

作者强调,在受严格治理的医疗场景中,模型本身只占问题的一半。确定性验证、访问控制和可观测性等工程基建才是决定成败的另一半。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →