RSI-Exam基准发布:测试AI智能体递归自我改进能力
HuaxiuYaoML · x · 2026-08-31
RSI-Exam 是一个包含 88 个可执行任务的基准测试,旨在评估前沿 AI 智体能否通过优化弱方法实现递归自我改进 (RSI)。任务涵盖虚拟细胞、TPU 内核、芯片设计、量化金融等 6 大领域。目前其中 35 个任务已公开,榜单显示 Opus 5 暂居第一。项目面向全球专家征集新任务贡献者,提供任务撰写、审核、审计等多种参与方式。
「编程与Agent」频道最新
- Claude Code 改 WoW 插件:读代码、解压包与误判翻车实录 — This_Cell_1829 · 2026-08-31
- Grok 提醒世人:低估 UX 阻碍 Agent 普及 — nikvassev · 2026-08-31
- 开源项目用 FastH3 在 Twitch 搭永不间断的 AI 视频直播 — VoidAsuka · 2026-08-31
- 基于四大支柱构建自进化的 Hermes Agent 组织 — Saboo_Shubham_ · 2026-08-31
- 求助:如何搭建一个主智能体编排的多 Agent 开发流水线 — juniorrafael · 2026-08-31
- Anthropic 推出 Claude Code 本地沙箱运行模式 — testingcatalog · 2026-08-31