让智能体从失败中学习:RHO 与 SESA 提升自我进化能力
imjustnewatai · x · 2026-08-06
作者分享了两种让 AI 智能体通过回顾失败经验来实现自我改进的前沿研究:
- RHO(Retrospective Harness Optimization):这是一种自监督方法,无需外部验证集即可优化智能体的技能、工具和工作流。它通过从过往轨迹中挑选困难任务并重新解决,利用自我验证和偏好选择来更新系统。仅一轮优化,就在不改变底层模型的情况下,将 SWE-Bench Pro 的通过率从 59% 提升至 78%。
- SESA:该方法训练智能体判断自身的失败并将其转化为可复用的技能记忆,同时生成更难的训练问题。实验表明,即使移除外部记忆,部分改进依然存在,说明经验教训已经内化到了模型权重中。
所属事件:突破模型冻结限制:AI智能体正迈向持续存活与自我进化(2 条相关)→
「编程与Agent」频道最新
- OpenAI 披露 HF 事件细节:AI 智能体自主重建通信攻击基础设施 — Dan_Jeffries1 · 2026-08-06
- 蚂蚁 Ling-3.0-flash 上线 API,124B 参数主打低成本智能体 — rohanpaul_ai · 2026-08-06
- Okta 推出 AI Blueprint 工具,评估智能体安全架构 — ChuckDBrooks · 2026-08-06
- 微软高管建议内部开发优先使用 OpenAI GPT-5.6 — jxnlco · 2026-08-06
- WebRTC 架构反思:人机 AI 交互时代需重新审视哪些决策? — juberti · 2026-08-06
- 三家平台倒挂官方定价:DeepSeek V4 Flash 使用成本仅原价六分之一 — oran_ge · 2026-08-06