Yacine 吐槽:中国 RL 模型登顶背后只是 on-policy 合成数据

yacineMTB · x · 2026-09-23

Yacine MTB 发推调侃:所谓「中国 RL 刷新 SOTA」,点进去一看核心其实就是 on-policy 合成数据(on-policy data synth),并非什么全新范式。帖子以反讽口吻消解了「sota」的震撼感,暗示训练配方仍是已知的合成数据套路。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →