「影子评估」实验:Claude Opus 4.8 撰写的 NeurIPS 论文被原作者双双拒稿
CurieuxExplorer · x · 2026-09-05
Singularity Hub 报道了一项对「智能爆炸」预期的冷思考:递归自我改进(AI 构建更强的自己)可能比想象中更难。
- 背景:LLM 在写代码、生成数据、跑实验等 ML 研究日常上进展迅速,Sakana AI 的 AI Scientist-v2 甚至有论文通过 ICLR 同行评审,引发 AI 临近自我改进的猜测
- 影子评估(shadow evaluations):研究者拿未发表的高质量 ML 论文中的研究问题让 AI agent 求解,再由原作者评分
- 结果:Claude Opus 4.8 尝试两篇 NeurIPS 2026 投稿论文的问题,均被原作者拒绝——普林斯顿的 Sayash Kapoor 评价其「离顶会质量相去甚远」
- 结论:AI 在真正开放式的原创研究问题上仍表现乏力,智能爆炸假设面临实证挑战
「漫话AGI」频道最新
- 对齐思路再进一步:让 agent 明白犯错可被系统兜底 — tokenbender · 2026-09-05
- Agent 对齐研究或可借鉴育儿之道:以信任为底层原语 — tokenbender · 2026-09-05
- iamtrask:AI 对齐的真正瓶颈是被保密的训练数据,而非秘密算法 — iamtrask · 2026-09-05
- iamtrask 长文:对齐问题的最大变量从来都是训练数据 — iamtrask · 2026-09-05
- 观点:开源模型该放弃追 Claude 编码,转向深度知识 — teortaxesTex · 2026-09-05
- Maxinomics 视频解读:自动化屡次预言抢工作,为何 AI 迟迟没有 — Anen-o-me · 2026-09-05