健康时间序列基准显示 LLM 仍落后传统机器学习
yang_yuzhe · x · 2026-07-22
这条在推荐一篇关于 LLM 在健康时间序列上的推理评测 论文,作者认为里面有不少非直觉但重要的发现。
- 论文强调:医疗/健康领域的评测已经落后于模型进展。
- 它不只和 LLM 比,而是把 SOTA 传统机器学习方法 当成更现实的基线;在这些场景里,传统方法往往更便宜、也更可解释。
- 论文把这个 benchmark 设计成一个可持续扩展的 “living ecosystem”,允许按标准方式贡献新内容。
- 一个有意思的结论是:信号越少见,LLM 表现越差,呈现出反向相关。
- 论文还指出了若干 LLM 明显薄弱的健康任务区域。
「研究」频道最新
- Meta 发现:量化推理模型常在答对后又开始怀疑 — rohanpaul_ai · 2026-07-22
- 机器人操作要先会移动,再用标准化基准评测 — YuXiang_IRVL · 2026-07-22
- 综述梳理多模态 LLM 的弱项:看懂 meme 和漫画 — Tuo Liang · 2026-07-22
- Karpathy 提出后,四支团队独立做出 LLM Wiki 模式 — garrytan · 2026-07-22
- LightInteraction 不重训加速交互视频世界模型 2.59 倍 — 新智元 · 2026-07-22
- DA-Nav 让机器人学会长程导航纠偏,成功率达 98.15% — 新智元 · 2026-07-22