PewDiePie 玩起 GRPO 训练,HF 研究员吐槽想帮他都联系不上

mervenoyann · x · 2026-10-01

Hugging Face 研究员 merve 分享:知名 YouTuber PewDiePie 已在自己动手做 GRPO 强化学习训练(未提具体工具)。

据她转述:

顶流网红下场自训模型的轶事,也算 open-source RL 普及的信号。

所属事件:PewDiePie 自学 GRPO 强化学习训练,HF 研究员想帮忙却联系不上(2 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →