用神经细胞自动机+RL 生成器合成数据训练语言模型引热议

cephaloform · x · 2026-09-27

Michael Yli 介绍其新工作的核心机制:learner 用标准 next-token 预测在生成器产出的字节上训练,而生成器本身用 RL 训练。单纯的难度奖励会失败——程序可以注入随机字节让输出任意难预测而不含结构;因此奖励设计为:程序输出的梯度与 learner 最近学习轨迹的 AdamW 预条件内积大小,即把程序难度匹配到 learner 的可学习边界。generatorman 评价这与「用神经细胞自动机训练语言模型」同向,并表示自 GPT-4/TinyStories 起就是全合成预训练的信徒。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →