Yacine 吐槽:中国 RL 模型登顶背后只是 on-policy 合成数据
yacineMTB · x · 2026-09-23
Yacine MTB 发推调侃:所谓「中国 RL 刷新 SOTA」,点进去一看核心其实就是 on-policy 合成数据(on-policy data synth),并非什么全新范式。帖子以反讽口吻消解了「sota」的震撼感,暗示训练配方仍是已知的合成数据套路。
「模型」频道最新
- Ovis 三款 Embedding 模型已上架 Hugging Face,附论文 — AdinaYakup · 2026-09-23
- Qwen 发布音频全家桶 Qwen-Audio-3.1,TTS 降价约 70% — airesearch12 · 2026-09-23
- Opus 5.5 思维链控制力仅 Opus 级,规模或决定该能力 — scaling01 · 2026-09-23
- 阿里开源 3 款 Ovis 多模态 Embedding 模型,Apache 2.0 协议 — AdinaYakup · 2026-09-23
- TypeSafe 推出 Jev:70-500ms 的「系统一」新原语,百万输入 token 仅 $0.042 — daniel_mac8 · 2026-09-23
- GPT-6 Astra 登顶 ZeroBench:三项指标全面超越人类基线 — Waiting4AniHaremFDVR · 2026-09-23