ValsAI 发布 MysteryMechanism:测试智能体能否重新发现封闭数学机制
burny_tech · x · 2026-09-17
AI 评测机构 ValsAI 发布新基准 MysteryMechanism,聚焦 AI for Science 的核心难题:新科学发现难以验证、因而难以衡量。该基准要求智能体通过有界实验(bounded experiments)重新发现被密封的数学机制,以可验证的方式衡量科学发现能力。
结果显示前沿模型之间差距显著:Astra 的成绩比 Sol 高出约 20 个百分点,基准在头部模型间切分 sharply。
「漫话AGI」频道最新
- Unconv AI CEO 称 AI 末日论是「财务动机」的恐慌营销 — NaveenGRao · 2026-09-17
- Jeff Dean 发布 60 分钟 AI 工程大师课:从零造 LLM 到一人调度 100 个 agents — goyalshaliniuk · 2026-09-17
- Patrick Collison 调侃:AI 读学术论文毫无障碍,人类却被验证码和付费墙挡住 — anshulkundaje · 2026-09-17
- Alpha School 遭集中批评,支持者称负面文章时机可疑 — RachelVT42 · 2026-09-17
- 评论:芯片管制拦不住中国追近 AI 差距,唯有持续做出更好的技术 — VraserX · 2026-09-17
- 用前沿 AI 像「化身状态」?网友称今年已快成召唤外星人 — arpitingle · 2026-09-17