Fable 5登顶KernelBench,或开启RSI循环
manubfr · reddit · 2026-07-06
据Import AI,Fable 5在KernelBench-Mega上提交了首个真正意义上(也是最快)的megakernel:在RTX PRO 6000 Blackwell上写CUDA代码实现18.71倍加速(对比优化版PyTorch基线)。作为对照,Claude Opus 4.8写Triton为14.4倍,GLM-5.2为11.14倍,GPT 5.5为4.34倍。
更关键的是实现质量:torch.profiler显示每个解码token仅一次协同内核启动,而其他高分方案需把问题拆成4到14次内核启动。Jack Clark将此称为"递归自我改进(RSI)循环的开端",强调自主设计内核是AI研发自动化的基础性任务。
所属事件:Fable 5登顶KernelBench,手写CUDA狂飙18.7倍(2 条相关)→
「模型」频道最新
- Artificial Analysis 发布 2025 年度 AI 状态与趋势报告 — ArtificialAnlys · 2026-07-28
- Kimi K3 将开源权重差距缩至 4 分 — ArtificialAnlys · 2026-07-28
- inclusionAI 的 LLaDA2.2-flash 在 Hugging Face 走红 — inclusionAI · 2026-07-28
- JEPA 控制 PDE 在分布外目标上追踪误差降 53% — burny_tech · 2026-07-28
- 独立 PPO 实验 3 到 4 分钟达 95% 准确率 花费约 20 美元 — ctjlewis · 2026-07-28
- 用户称切回 Opus 4.8:5.0 系列难以驾驭 — Aizkmusic · 2026-07-28