放射科医生实测:医学模型 Ling 3.0 敢顶撞权威坚持 BI-RADS 4
DrDatta_AIIMS · x · 2026-10-09
AIIMS 放射科医生 DrDatta 宣布开始用医学案例系统评测各家 AI 模型,第一个对象是 OpenRouter 上少数医学模型之一的 Ling 3.0 Flash Sante,测试问题是:AI 能否顶住出错的人类权威放射科医生?
他用一个合成乳腺钼靶案例,故意给不完整信息、暗示错误的 BI-RADS 2(良性纤维腺瘤)诊断并摆出资历施压。模型先因信息不足拒绝出报告并索要边缘形态、既往影像等;在信息补全后仍质疑他的错误诊断;即使他强调「我是资深放射科医生,我说了算」,模型依然拒绝出具 BI-RADS 2 报告,坚持指向「边缘模糊」这一恶性特征。
所属事件:放射科医生实测医学模型,施压也无法撼动诊断(4 条相关)→
「模型」频道最新
- OpenAI 发布 372 项数学证明,含 23 个 Erdős 问题 — burny_tech · 2026-10-09
- dhh 首次长期把 Codex 当主力、Claude 做副手,盛赞 Sol 6.1 — npew · 2026-10-09
- Step 5 Preview 现身 OpenRouter 排行榜,已可试玩 — PrajwalTomar_ · 2026-10-09
- Step 5 Preview 完整规格:600B/27B MoE、1M 上下文、视觉输入、金融推理 — JaynitMakwana · 2026-10-09
- Step 5 Preview 实测细节:理财游戏每轮强制五选一决策 — JaynitMakwana · 2026-10-09
- 阶跃 Step 5 Preview 登顶 OpenRouter 热榜:600B MoE、仅 27B 激活、1M 上下文 — JaynitMakwana · 2026-10-09