CMU 团队发布 SMDD-Bench:502 个药物设计 RL 长程任务
willcb · x · 2026-10-03
CMU 教授 Niloofar Gheini(mire)团队转向 AI 分子设计与药物发现一年后,联合 PrimeIntellect 发布了 SMDD-Bench 与配套环境。
- 规模与构成:502 个小分子设计任务,以 RDKit、ADMET-AI 和 Boltz-2 为闭环评测工具,已上架 PrimeIntellect 的 Environments Hub,可用 prime-rl 直接训练。
- 动机:RL 需要数学和编码之外的长程任务;药物设计还涉及长程规划、探索和从不完美反馈中学习等开放问题。
- 两个发现:1) harness 优化在科学任务上作用极大,当前瓶颈更多在模型能力而非知识;2) 自动化 harness 优化在某些场景有效、某些场景不行。
这是把 RL/agent 评测扩展到科学领域的一次代表性尝试。
「研究」频道最新
- 基因组级 ORF 筛选发现 NKX2-5,让老年小鼠恢复视力 — anshulkundaje · 2026-10-03
- Hutter Prize 迎 20 年最大进展:一月内三获奖项共提升近 10% — mhutter42 · 2026-10-03
- AI2 发布 4B 模型 MolmoMotion,按语言指令预测 3D 点轨迹 — rsasaki0109 · 2026-10-03
- 宇树开源 UnifoLM-WLA-1.0:6B 单模型驾驭人形机器人 64 项任务 — WebAssemblyMan · 2026-10-03
- 数学家 Kontorovich 认错:AI 自主形式化数学从笑话变成现实 — AlexKontorovich · 2026-10-03
- 新论文:训练LLM主动说出“我在被评测”,口头化评估意识 — xuanalogue · 2026-10-03