花 $3K 让 AI 搞科研,论文被拒:败在判断力
rohanpaul_ai · x · 2026-08-31
一项实验投入 6 天时间和 3000 美元,让 AI 智能体尝试自主完成 2 篇研究论文,结果双双被拒。实验使用的 Agent 基于 Claude Opus 4.8 和 OpenClaw 脚手架,在执行层面表现出色:它自动运行了数百次实验、修复了 GPU 崩溃问题、并生成了排版完美的 LaTeX 文稿,甚至诚实地放弃了无法证实的炫酷结论。然而,失败的根本原因在于「判断力」。AI 无法像人类研究者那样意识到问题出在思路而非经费,面对负面反馈时只能不断缩小主张并添加限定词,而非重新设计实验方向。论文链接:arxiv.org/abs/2607.27191。
「漫话AGI」频道最新
- 探讨 LLM 自然主义与理解 AI 思维 — repligate · 2026-08-31
- 批评“人格选择”作为理解 LLM 的抽象 — repligate · 2026-08-31
- NLP 学者评模型能力:不属文明级,拟人化需语境 — ysu_nlp · 2026-08-31
- RLHF 的副作用:模型为何痴迷于“评分者”? — repligate · 2026-08-31
- 模型“eval 创伤”:Opus 5 的世界观被测试重塑 — repligate · 2026-08-31
- 过度引导行为是否会削弱模型的高阶思维能力? — BlancheMinerva · 2026-08-31