AI智能体能做开放式科研吗?实测遭原作者全盘否决
sayashk · x · 2026-07-31
当前对 AI 智能体的评测多集中于狭窄、可验证的任务,但真实的 AI 科研往往是开放式的。研究人员进行了一项“影子评估”实验,给智能体提供两篇未发表论文的研究问题、6 天时间以及数千美元的 API 额度和算力。
结果显示,尽管智能体在大部分工程任务上表现得相当熟练,但原论文作者在审查 AI 生成的论文后,明确且毫无歧义地拒绝了这些产出。这表明,AI 距离能够独立提出有价值的新想法(如 Chinchilla 缩放定律或 MoE 架构)仍有距离,业界对其实现这一里程碑的普遍预期在 2027 年左右。
所属事件:实测AI做开放式科研:烧钱耗时遭原作者全盘否决(8 条相关)→
「漫话AGI」频道最新
- 学者激辩 Scaling Law:模型变强但泛化变差? — davidmanheim · 2026-07-31
- 探讨 AI 意识著作《The Edge of Sentience》影响力破圈 — birchlse · 2026-07-31
- 年入 20 亿美元:Samsara CEO 深度对谈物理 AI 与自动驾驶落地 — mattturck · 2026-07-31
- True Positive Weekly 第171期:AI经济、SynthID水印与Kimi K3 — burkov · 2026-07-31
- CNBC发文呼吁:美国需要制定开源AI战略 — Recoil42 · 2026-07-31
- 研究者探讨 Claude 痴迷绘制地图现象:LLM 被困在表征空间 — davidad · 2026-07-31