Anthropic 展示 AI 闭环改进模型,超人类研究方向
kimmonismus · x · 2026-08-29
Anthropic 发布最新研究,展示了接近递归自我改进的流程:Claude 被用于改进其他 AI 模型的对齐。模型自主搜索文献、提出方法、创建训练数据、训练并评估结果。在 10 项测试中,它修复了所有对齐失效问题且未降低通用能力,甚至用较弱的 Sonnet 5 在 60 小时内将早期 Opus 4.8 的对齐水平提升至接近生产版。实验表明,AI 指导的研究方向平均 6 小时内即可超越人类专家的提议。虽然改进后的模型尚未成为下一代研究员以闭合循环,但核心环节已基本具备,这是向递归自我改进迈出的重要一步。
所属事件:Anthropic 自动化对齐研究:Claude 自主修复失对齐、跑赢人类专家(14 条相关)→
「漫话AGI」频道最新
- 模型一致性突破临界点,使智能体可协调执行激进任务 — jd_pressman · 2026-08-29
- AI 软件本质论:颠覆过去数十年思维定式 — latticecut · 2026-08-29
- 混合统计与预测方法或更高效解 QTL — anshulkundaje · 2026-08-29
- FT 文章:AI 时代写作真实性的界定危机 — TuhinChakr · 2026-08-29
- 观点:随着脑物理预测能力提升,意识或将变得可预测 — burny_tech · 2026-08-29
- MIT 研究:数百个 AI 智能体零通信也能自发分工并留下自运行基础设施 — ProfBuehlerMIT · 2026-08-29