Fable 5登顶KernelBench,或开启RSI循环
manubfr · reddit · 2026-07-06
据Import AI,Fable 5在KernelBench-Mega上提交了首个真正意义上(也是最快)的megakernel:在RTX PRO 6000 Blackwell上写CUDA代码实现18.71倍加速(对比优化版PyTorch基线)。作为对照,Claude Opus 4.8写Triton为14.4倍,GLM-5.2为11.14倍,GPT 5.5为4.34倍。
更关键的是实现质量:torch.profiler显示每个解码token仅一次协同内核启动,而其他高分方案需把问题拆成4到14次内核启动。Jack Clark将此称为"递归自我改进(RSI)循环的开端",强调自主设计内核是AI研发自动化的基础性任务。
所属事件:Fable 5登顶KernelBench,手写CUDA狂飙18.7倍(2 条相关)→
「模型」频道最新
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- Terminal Bench v4 榜单:GLM-5.3 以 41.9% 一骑绝尘 — Ok_Warning2146 · 2026-09-11