医疗 LLM 的动态红队评测
maier_ak · x · 2026-07-20
主题是用动态红队(dynamic red-teaming)弥补大型语言模型在医疗与健康领域的 benchmark 缺口。从标题可以看出,重点不在某个具体产品,而在评测体系:如何用持续变化的对抗测试,更接近真实医疗场景中的风险暴露。
「模型」频道最新
- OpenAI 在 GPT-Live 推出语音功能,界面却遮住搜索联动 — Graham_dePenros · 2026-07-22
- Moonshot 的 Kimi K3 以 156 分刷新开权重 ECI 纪录 — scaling01 · 2026-07-22
- Nanbeige4.2-3B 发布,3B Looped Transformer 反超更大模型 — Wooden-Deer-1276 · 2026-07-22
- 有人称已有 6 家公司模型超越 Google 最强 LLM — soham_btw · 2026-07-22
- Google 透露 Gemini 3.5 Pro 测试中,Gemini 4 已预训练 — Wide-Ad1564 · 2026-07-22
- Gemini 3.5 Flash Lite 实测:非前沿最优,但推理速度达 350 tok/s — brandon_galang · 2026-07-22