SciConBench 用滚动新综述面板区分模型真实进步与数据泄露
manoelribeiro · x · 2026-10-07
该基准在固定核心集与每月滚动更新的新发表综述面板上评测模型,回答三个问题:模型合成科学结论的能力是否在进步、能否合成最新结论、进步是真实还是靠数据泄露。方法可扩展到健康以外的其他科学领域。
所属事件:SciConBench 入选 NeurIPS:最强 AI 医学结论合成 F1 仅 0.337(10 条相关)→
「研究」频道最新
- Scott Alexander 公开信回应 Pinker:通用智能因子真实存在,AI 能力将持续攀升 — Astral Codex Ten · 2026-10-07
- 论文:扩散 Transformer 生成早期即可读出大量图像信息 — kwangmoo_yi · 2026-10-07
- 合成细胞为何五代即衰:答案是它无法分解自身「垃圾」 — NikoMcCarty · 2026-10-07
- LLM 数值线性代数综述:从 QR 算法到支撑大模型的矩阵方法 — Abdelkader Baggag · 2026-10-07
- 哈佛发布智能体血液生物标志物发现工具:隐私不出域,AUC 中位提升 4.18 点 — Harvard · 2026-10-07
- 斯坦福研究:多用户各派一个 agent,团队效果反而不如单个 agent — rohanpaul_ai · 2026-10-07