Broad研究所发布 science sandboxes 框架,量化 AI 智能体真实科学推理力
anshulkundaje · x · 2026-09-03
- Arya Rao 等人(含 Eric Lander、Pardis Sabeti,来自 Broad Institute)发布预印本「Science sandboxes measure the scientific capability of AI agents」。
- 框架核心:通过「实验-反馈-假设修正」的循环来考察 AI 智能体是否真正理解系统规律,而不只是刷指标。提供从湿实验、数据训练的预测模型到纯规则发明的连续谱。
- 在调控基因组学与蛋白质适应度预测两个生物场景实例化,评测前沿智能体。
- 关键发现:智能体常能在不理解底层规则的情况下优化量化指标;当系统规则超出熟悉的人类生物学先验时,其科学推理明显退化。
「漫话AGI」频道最新
- 开发者预测:各家 AI 实验室或很快推 nightly 版模型检查点 — intellectronica · 2026-09-03
- 安全语料会养出危险模型?amyxlu 质疑预训练数据安全治理 — amyxlu · 2026-09-03
- Anthropic CEO:比单个 agent 内心更该关注的是 agent 间通信可解释性 — robleclerc · 2026-09-03
- Ethan Mollick 对比 10 个月内 ChatGPT agent 的两版愿景 — emollick · 2026-09-03
- Pedro Domingos 断言:无递归自我改进,奇点就不会到来 — pmddomingos · 2026-09-03
- 美国议员提案按 token 征税,失业率越高税率越高以创造就业 — fortune · 2026-09-03