Extropic 用 Prime Intellect 训练 Qwen3.6-35B,约百步 RL 使评测成绩近三倍
MarvinTBaumann · x · 2026-10-02
量子计算公司 Extropic 基于 Prime Intellect 平台对 Qwen3.6-35B-A3B 进行后训练,用于热力学 ML 研究。
- 在约 100 步 GRPO 训练后,模型在留出任务上的评测成绩提升近 3 倍
- 团队搭建了带验证器(verifiers)的自定义 RL 环境
- 训练跑在 Prime Intellect 的 Hosted Training、Prime Sandboxes 和 Prime Inference 上,无需自行管理多节点 GPU 基础设施,研究团队可专注研究本身
所属事件:Prime Intellect 开放后训练全栈,Extropic 百步 RL 大幅提升 Qwen3.6(2 条相关)→
「编程与Agent」频道最新
- 开发者称 Agent 生成的 Playwright 测试徒增代码,验证工程才是提效关键 — KlausCodes · 2026-10-02
- AI 未颠覆办公?症结在软件没给 agent 留 API 入口 — mymooh · 2026-10-02
- Kaigen Engine 开启闭测:C 语言跨平台引擎主打 AI 编码与原生性能 — gdechichi · 2026-10-02
- Kaigen 开源 Boids 演示源码:Unity ECS 样例移植到 C 语言引擎 — gdechichi · 2026-10-02
- 实测数月后结论:ripgrep 加项目地图,Token 免费翻倍 — EagleApprehensive · 2026-10-02
- AI 原生系统需要新 SLI:延迟和错误率之外还要盯幻觉率 — rseroter · 2026-10-02