Epoch AI 与 Anthropic 研究一致:AI Agent 距自主科研仍很远
The Decoder · rss · 2026-10-11
Epoch AI 与 Anthropic 的独立研究得出相同结论:当前最强 AI agent(如 GPT-5.6 Sol、Claude Fable 5)虽能执行实验,但远未达到自主科研水平。
- 得分最高的 Sol 也仅达到人类参考分数的 15%,且所用方法都是研究者已知的老方法
- 模型最大短板是无法批判性地审视自己的结果,缺乏科学性的自我质疑
- 研究认为 agent 常高估自己的成果,真正的创造性思考仍然缺位
两家机构独立得出一致判断,为「AI 科研自动化被夸大」这一观点提供了有力佐证。
「漫话AGI」频道最新
- 「人类进步要被人类理解力卡住吗」:AI 制药争论引爆对齐分歧 — inductionheads · 2026-10-11
- AI 破解近 400 道数学难题,数学家坦言「墙上的字已无法忽视」 — emax · 2026-10-11
- Sam Altman 演示 AI 自生成 UX,signull 断言传统软件时代已终结 — signulll · 2026-10-11
- Ben Todd 反驳「减速就是监管俘获」论:完全说不通 — ben_j_todd · 2026-10-11
- 客服坐席成首批被 AI 取代的白领岗位,就业冲击图引热议 — tristanbob · 2026-10-11
- Reddit 讨论奇点后各职业将如何变化(附职业清单图) — rockyrudekill · 2026-10-11