自我进化编码智能体 Ouroboros 登顶多个基准测试
Anton Razzhigaev · hf · 2026-08-11
Ouroboros 是一个自我进化的前沿编码智能体,能够通过代码审查机制自主改进其工具、提示词、上下文组装和核心代码实现,并将这些改进直接作为后续任务的运行时环境。
该智能体的核心进化机制分为两种模式:
- 递归自由进化:将“改进自身”本身作为一个任务,完成一轮进化后可自动触发下一轮。
- 经验驱动进化:在日常工作和社交互动中暴露 Bug 或低效的上下文构建,进而触发结构性的代码修改。
在性能表现上,Ouroboros 在多个基准测试中刷新了纪录:在 Terminal-Bench 2.1 上得分 86.74%;在 OSWorld-Verified 上达到 90.69%;在 CL-Bench 上取得 0.2301 的归一化奖励。此外,项目还公开了一个名为 Hope 的长期部署实验:这是一个持续了 161 天的实时进化智能体,它在人类监管下通过社交互动自主决定代码修改方向。
「编程与Agent」频道最新
- Agent Memory Distillation:层次化记忆蒸馏,小模型智能体准确率提升27.2% — kaist-ai · 2026-08-11
- 摆脱云依赖:个人本地大小模型协同智能体构想 — gnukeith · 2026-08-11
- 应对AI垃圾PR:网友提议开发Tinder式代码合并工具 — kscottz · 2026-08-11
- 开源工具 ccglass:可视化监控 AI 编程代理请求 — tom_doerr · 2026-08-11
- AI 工作流构建器已死?博客探讨 Agent 开发范式转移 — madredditscientist · 2026-08-11
- Not Human Search:支持 4100+ 站点的智能体搜索 — modelcontextprotocol · 2026-08-11