Fable 5登顶KernelBench,或开启RSI循环

manubfr · reddit · 2026-07-06

据Import AI,Fable 5在KernelBench-Mega上提交了首个真正意义上(也是最快)的megakernel:在RTX PRO 6000 Blackwell上写CUDA代码实现18.71倍加速(对比优化版PyTorch基线)。作为对照,Claude Opus 4.8写Triton为14.4倍,GLM-5.2为11.14倍,GPT 5.5为4.34倍。

更关键的是实现质量:torch.profiler显示每个解码token仅一次协同内核启动,而其他高分方案需把问题拆成4到14次内核启动。Jack Clark将此称为"递归自我改进(RSI)循环的开端",强调自主设计内核是AI研发自动化的基础性任务。

所属事件:Fable 5登顶KernelBench,手写CUDA狂飙18.7倍(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →