开发者质疑 Prime Intellect 直播 RL 训练的真实性
giffmana · x · 2026-09-22
Jasper lu(引用 Prime Intellect 新模型报告)指出一处时间线矛盾:报告称先训练多个 mixRL 教师,再用 MOPD 蒸馏合并成学生模型,但团队却在 RL 训练运行时全程直播,并在结束后一天内就发布模型与报告——蒸馏与整合不可能这么快完成。giffmana 据此怀疑所谓直播更像事后重演,或者是先发布后补直播;他认为更合理的解释是直播的只是某个教师模型的最终冲刺训练,但论文对此只字未提。这引发了对该项目「透明训练直播」宣传可信度的质疑。
「模型」频道最新
- 曝阿里巴巴新路线图:2032年全球20GW算力,玄武芯片性能3倍 — kevinsxu · 2026-09-22
- 实验显示 Qwen 内部藏有微小的 GPT2 自我模型 — paraschopra · 2026-09-22
- 仅给照片加水印就被 Google 标记为 AI 生成 — shashib · 2026-09-22
- 小米 MiMo-V2.6 公开最大规模 RL 训练:Pro 花费 260 万美元 — KyeGomezB · 2026-09-22
- 博主实测 Grok 4.7 编码:Cursor 里跑 4 个真实项目并算成本 — Arindam_1729 · 2026-09-22
- 小米 MiMo v2.6 登顶开源榜,RL 训练成本约 350 万美元并全程直播 — Prompt Engineering · 2026-09-22