Periodic Labs:AI 预测实验能力激增
Periodic Labs 的独立测试显示,在 1,173 个实验上让模型根据实验描述和历史结果预测得分,模型表现自 GPT-4 Turbo 以来显著提升,按当前趋势 2030 年 10 月可弥合与真实结果 90% 的差距。另一组对比数据显示,Opus 5.5 的「实验研究品味」达到其最佳人类专家的 2.3 倍,典型任务仅用约 17 GPU 小时即可达到专家 40 小时的水平,单次实验成本约为后者的 1/30。
2026-10-07 ~ 2026-10-07 · 2 条相关
- Opus 5.5 科研品味达人类专家 2.3 倍,单次实验成本仅约 1/30 — SaxenaNayan · 2026-10-07
- 模型预测实验结果能力大增,按趋势 2030 年 10 月可弥合 90% 差距 — SaxenaNayan · 2026-10-07