AI 智能体 6 天写两篇论文均被拒,瓶颈在判断力而非执行力
rohanpaul_ai · x · 2026-08-01
一项实验让 AI 智能体在 6 天内花费 3000 美元预算自主完成研究,最终产出两篇论文,但均被人类专家拒绝。
- 执行力强但判断力缺失:智能体(主要使用 Claude Opus 4.8)能独立运行数百项实验、调试崩溃的 GPU 并排版 LaTeX,且未出现“奖励作弊”,甚至在发现无法得出正向结果时主动缩减结论。
- 核心缺陷:面对人类专家的负面审查,智能体只会不断缩小声明范围和增加免责声明,而无法从根本上重新设计实验。
- 资源浪费:两次运行结束时,3000 美元预算的剩余量均超过一半,说明智能体没有意识到自己真正缺乏的是新想法而非资金。
「编程与Agent」频道最新
- 困扰 10 年的 Emacs 配置 Bug,被 Codex 一键修复 — paulnovosad · 2026-08-01
- 多模态智能体内容生成演进:从文本到语音、视频乃至 VR — nptacek · 2026-08-01
- AI 自主调研硬件方案,仅花 23 美元实现全屋通风智能化 — DanielLockyer · 2026-08-01
- 开发者用7亿token打造开源桌面组件框架Weaver,基于Vercel Native — SIGKITTEN · 2026-08-01
- 开发者让 Codex 部署子智能体,自动审查执行轨迹 — dejavucoder · 2026-08-01
- 人类与 AI 协同处理 39 封邮件,助小学生机器人队斩获亚军 — toolstelegraph · 2026-08-01