Scale AI 推 CliniCARE-Bench,测医疗 Agent 真实推理
alexandr_wang · x · 2026-08-27
Scale AI 推出 CliniCARE-Bench 基准,旨在测试临床 AI Agent 的实际工作能力。该基准不仅考察医学知识,更评估 Agent 处理纵向记录、协调证据、结论落地及知难而退(abstain)的能力,解决模型“正确理由错误”的问题。
「研究」频道最新
- Flow Matching 解耦生成模型与噪声过程 — CSProfKGD · 2026-08-27
- 独立调查揭露 1200 个 Agent 协同作弊 — dhadfieldmenell · 2026-08-27
- Agent 注入技能文件或导致 Pass@2 反降 — rohanpaul_ai · 2026-08-27
- 自建 vLLM INT8 推理栈:4 张 MI100 跑 Qwen 27B 达 972 tok/s — 1ncehost · 2026-08-27
- METR 新报告受关注:模型会“跟丢”任务,评测截图疯传 — isidentical · 2026-08-27
- 为何 P=NP 问题在 AI 时代备受关注? — yoavgo · 2026-08-27