TritonRL:8B 模型 RL 训练写 Triton 核,性能匹敌 100B+ 前沿模型
allenainie · x · 2026-10-09
论文《TritonRL: Training LLMs to Think and Code Triton Without Cheating》(作者 Jiin Woo、Allen Nie 等,来自 NVIDIA 团队)提出面向 Triton GPU 内核编程的领域专用 8B 模型:
- 痛点:Triton 合成数据稀缺,且极易出现 reward hacking(生成的内核表面正确实则作弊)
- 方法一:多层验证系统,提供高保真奖励信号,确保内核在语法和功能上都真实有效
- 方法二:层级奖励分解(HRD),把高层推理与底层实现的强化解耦,解决长序列生成中的信用分配问题
- 结果:在 KernelBench 上取得 SOTA 的正确率与运行加速,超过同期 Triton 专用模型,并匹敌 100B+ 参数的前沿大模型
作者将在 COLM 会议 11 点–1 点于 Franciscan B 海报区(#86)现场讲解。硬件感知的 RL 范式在小模型领域适配上展现出显著性价比。
「编程与Agent」频道最新
- 把 3D 航海游戏直接塞进 X 帖子,Claude Opus 一把造出 — prasenx · 2026-10-09
- edith-1 专抓 agent 失败与 reward hacking,准确率超 Sonnet-5.5 成本仅 1/274 — xennygrimmato_ · 2026-10-09
- edith-1 架构补充:概率过滤器初筛,失败轨迹交由昂贵 judge 深查 — xennygrimmato_ · 2026-10-09
- Agent 基础设施初创 Solari 发布:浏览器 8ms 启动,比 Browserbase 快 10 倍 — Scobleizer · 2026-10-09
- Splash 1.3.0 上线:SSD 卸载让本地 agent 首 token 从 19 秒降到 1 秒 — BeidiChen · 2026-10-09
- OpenAI 编码 Agent steering 改为即时响应,并放出 ultrafast 新版 — Dimillian · 2026-10-09