博主自嘲在训练两个「小型语言模型」:9 个月预训练,奖励机制靠零食

Kyrannio · x · 2026-10-07

LLMJunky 用大模型训练的口吻晒娃式吐槽:手上有两个「SLM」在 post-training,各自预训练花了 9 个月,算力账单还在来。RL 除「奖励黑客」(一哭就有零食)外进展顺利;幻觉率高(说没教过的话)、输出高度重复(「为什么」问 400 遍)、对蔬菜和睡觉的拒绝率极高、指令遵循取决于下指令的人是谁;在「制造混乱」基准上碾压,在「收拾混乱」上翻车。通篇为幽默梗帖。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →