Scale AI 发布 RSI-Bench,公开征集任务:每任务 2000 美元加论文共同作者
dhruv2038 · x · 2026-08-18
Scale AI 推出 RSI-Bench,用于评估 AI agent 是否具备推进 AI R&D 所需的能力——即通往递归自我改进(RSI)的前提。每个任务提供起始环境、算力预算和验证套件,除最终结果外还评估四类行为:可靠性(能否区分真实进步与噪声)、效率(有限资源下的求解能力)、通用性(方案能否超出任务特定补丁)与想法质量(能否提炼洞见、综合知识、提出新方法)。
项目正向社区征集各领域专家策划的长时程、开放式研究任务。贡献者可获得:RSI-Bench 研究论文共同作者署名、最初 50 个任务中每个被接受任务 2000 美元报酬、Modal 算力额度,以及加入研究社区的资格。
「研究」频道最新
- 整理 10 个学习生成式 AI 的优质 YouTube 频道 — goyalshaliniuk · 2026-08-18
- 伯克利实验室推地震模拟 AI,几分钟算出数千场景 — Scobleizer · 2026-08-18
- 神经网络是人类发明,还是等待被发现的现实规律? — drabarca_ai · 2026-08-18
- KDD Cup 揭晓推荐系统大一统方案,冠军仅用 DeepSeek 搞定 — 量子位 · 2026-08-18
- Spellcaster 六 Agent 闭环:解决 AI 生成游戏不可玩难题 — 量子位 · 2026-08-18
- HumanCLAW 开源:9 个前沿 VLM 具身测试全军覆没,最高仅 16.8% — liuziwei7 · 2026-08-18