ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力
JenniferHli · x · 2026-09-11
ValsAI 推出「RSI Index」基准
- 出于对递归自我改进(recursive self improvement)的关注,AI safety 话题重回聚光灯下。
- ValsAI 联合 marimoio 与 CoreWeave 构建了首个第三方基准,衡量 AI 距离「构建自己的继任者」有多近。
- 基准让所有前沿模型完成同样的 AI 研究任务,并与已发表的最强人类结果对比打分。
- 初步结论:模型能够完成相关工作,但距离人类前沿水平仍相去甚远。
「模型」频道最新
- 博主实测 DeepSeek Flash:不谄媚敢较劲,速度快到原谅缺点 — oran_ge · 2026-09-11
- 博主横评 GLM 5.3 Flash 与 DeepSeek V4.1:Solo 最优,Agent 团队踩脚 — teortaxesTex · 2026-09-11
- Anthropic「865K 交互」口径引质疑:一次交互到底算多少? — teortaxesTex · 2026-09-11
- 曝 OpenAI 用内部新模型冲击黎曼猜想与 P vs NP — zephyr_z9 · 2026-09-11
- Qwen 3.8 Flash Next 推理优化赛:MLX 与 CUDA 双双提速超 55% — gajesh · 2026-09-11
- GPT-6 Astra 首次尝试即驱动机器人臂,Ken Goldberg 点赞 Agentic Robotics — zhaoran_wang · 2026-09-11