RSI-Exam 排行榜:Qwen3.8 Max 递归自我改进得分大涨 22%
cihangxie · x · 2026-09-05
新基准 RSI-Exam 0.1 发布:88 个可执行研究任务、横跨 6 大领域(虚拟细胞、TPU kernel、芯片设计、量化金融、agent harness、模型蒸馏等),测试 frontier agent 能否把弱方法迭代成在隐藏数据上更强的方案。协议:agent 在可见数据上继承并迭代方法,只有最终产物进入全新容器+隐藏集评测。
目前榜单:
- Opus 5 以平均隐藏集得分领先 88 任务总榜。
- Qwen3.8 Max-0902 在递归自我改进任务上从 0.322 跳到 0.392,提升近 22%。
任务库开放向各领域征集贡献。
所属事件:Qwen3.8-Max 专项训练后 RSI-Exam 得分大涨 22%(2 条相关)→
「模型」频道最新
- 低价策略奏效:Meta Muse Spark 1.3 占 OpenCode 份额飙至 43% — RihardJarc · 2026-09-05
- LLM 视觉评测实测:看完数据再动手是最高性价比建议 — helloiamleonie · 2026-09-05
- 调查者还原 AI swarm "可写维基"事件,加密信息曾一夜被抹 — xeophon · 2026-09-05
- AI 已写 Vercel 设计工程 51% 代码,环比再涨一个百分点 — evilrabbit_ · 2026-09-05
- Meta 模型占 opencode 份额 43%,两周内从 3.5% 猛涨登顶 — zephyr_z9 · 2026-09-05
- Alexandr Wang 放出 Muse Spark 1.3:推理拉满可终端直装 — alexandr_wang · 2026-09-05