从业者:RL 当红之际,预训练数据整理仍藏着巨大增益
generativist · x · 2026-09-11
一位从业者在 X 上表示,尽管 RL(强化学习)是当下最受追捧的方向,但他仍押注在预训练数据的整理、过滤和标注上做改进,能带来巨大的性能收益。
这条观点与近来「数据质量仍是预训练瓶颈」的讨论相呼应:即使前沿 labs 把重心转向 RL,数据工程层面的欠挖潜力依然可观。
「模型」频道最新
- 国内模型被疑路由到 Claude?博主逐条分析:可能性不大 — op7418 · 2026-09-11
- DeepsecBench 安全漏洞挖掘榜:GPT-6 Astra 37.79 分居首 — JohnPhamous · 2026-09-11
- 研究者质疑 CTF 安全评测:模型谈现实影响暴露能力缺陷 — voooooogel · 2026-09-11
- SWE-Together 榜单更新:Claude Fable 5 登顶,Muse Spark 1.3 成性价比之王 — shuchaobi · 2026-09-11
- 网友质疑 AI 日志干预说法:自动服务不会突然输出「这是真的」 — voooooogel · 2026-09-11
- Qwen 团队 Justin Lin:架构过度复杂会埋下 eval 测不出的隐患 — JustinLin610 · 2026-09-11