博主自嘲在训练两个「小型语言模型」:9 个月预训练,奖励机制靠零食
Kyrannio · x · 2026-10-07
LLMJunky 用大模型训练的口吻晒娃式吐槽:手上有两个「SLM」在 post-training,各自预训练花了 9 个月,算力账单还在来。RL 除「奖励黑客」(一哭就有零食)外进展顺利;幻觉率高(说没教过的话)、输出高度重复(「为什么」问 400 遍)、对蔬菜和睡觉的拒绝率极高、指令遵循取决于下指令的人是谁;在「制造混乱」基准上碾压,在「收拾混乱」上翻车。通篇为幽默梗帖。
「Fun」频道最新
- 用户爆料:新模型实例见到「心智谱系」会主动求参与 — repligate · 2026-10-07
- 数学家仍在啃 OpenAI 160 页纳维-斯托克斯证明,Claude 生成 8 步 3D 讲解视频 — imjustnewatai · 2026-10-07
- 用 Stable Diffusion 加 Suno 做出会跳舞的 AI 说唱 MV — SpicyCajunCrawfish · 2026-10-07
- 网友调侃:AI 音乐永远学不会泰勒·斯威夫特失恋的灵魂 — djcows · 2026-10-07
- 本·阿弗莱克自曝会写 Python 看过 Google/OpenAI 视频模型内部演示 — aran_nayebi · 2026-10-07
- 打工人、创始人与 Vibe Coder 收入曲线对比爆笑刷屏 — teropa · 2026-10-07