用神经细胞自动机+RL 生成器合成数据训练语言模型引热议
cephaloform · x · 2026-09-27
Michael Yli 介绍其新工作的核心机制:learner 用标准 next-token 预测在生成器产出的字节上训练,而生成器本身用 RL 训练。单纯的难度奖励会失败——程序可以注入随机字节让输出任意难预测而不含结构;因此奖励设计为:程序输出的梯度与 learner 最近学习轨迹的 AdamW 预条件内积大小,即把程序难度匹配到 learner 的可学习边界。generatorman 评价这与「用神经细胞自动机训练语言模型」同向,并表示自 GPT-4/TinyStories 起就是全合成预训练的信徒。
「模型」频道最新
- 前 NVIDIA 员工:美国忽视海外用户,全球转向中国模型 — ivan_bezdomny · 2026-09-27
- GPT-OSS 官方模板藏严重 bug:历史推理会顶掉答案致模型跑偏 — arbv · 2026-09-27
- ScienceArena 基准:模型做化学题遇结构图,得分掉近 10 个点 — geoffwolfe · 2026-09-27
- 自建写作基准:GLM-5.3 Flash 花 0.7 美分写出 1.7% 差距 — OnlyProggingForFun · 2026-09-27
- 从业者感叹:前沿智能已过剩便宜到用不满订阅额度 — intellectronica · 2026-09-27
- Karpathy:用 Claude Opus 4.5 学历史比读书更有留存 — doodlestein · 2026-09-27