41.7 万参数 RNN 从单一初始状态自生成 6500 帧 Bad Apple
SEBADA321 · reddit · 2026-09-08
受此前「用 3MB 神经网络压缩 Bad Apple」启发,作者训练了一个小型循环动力系统,从单一初始状态 (h0, c0) 出发闭环自回归生成全部约 6573 帧全分辨率视频,推理时不接收任何时间戳输入。
架构与开销
- 64 维隐状态 + 64 维内部记忆流(区分视觉相似帧)
- 4 门 LSTM 式递归(1.66 万参数)+ 4 级上采样解码器(40 万参数)
- 总计 41.7 万参数(FP32 约 1.6MB),RTX 4080 上 >200 FPS,峰值显存约 17.2MB
训练技巧
- 学习式「教师查找表」作脚手架,支持从任意时间戳并行分段训练,推理时丢弃
- rollout 长度课程:K 从 2 逐次倍增至 512
- 状态扰动噪声(σ=0.005)防止轨迹脆裂发散
- 二阶差分正则惩罚抖动而非速度,保证轨迹平滑
- AdamW + Muon 混合优化,K 翻倍时按 0.2 缩放动量
- 分块解码避免长 horizon 溢出显存
尽管只训练到 512 帧,模型成功展开完整 6.5k 帧序列。代码、权重与分析工具已在 GitHub 开源(SEBADA321/BadAppleRNN)。
「研究」频道最新
- FactoSR:用强化学习分解 4D 属性提升空间推理 — HKUST-GZ2 · 2026-09-08
- 斯坦福团队研究:通用编码 Agent 已碾压手工数据 Agent 达 37 分 — CShorten30 · 2026-09-08
- Dhenu Vision 1.0 公开基准:参考图精确率 94.4% 超所有通用模型 — DevDminGod · 2026-09-08
- NBER 论文:自动化在取代岗位前,先偷走工作的意义 — ArtificialOther · 2026-09-08
- 单卡两天从零训出 441M 参数文生图模型:无 VAE 无文本编码器 — ostrisai · 2026-09-08
- 自回归架构真能通向 AGI 吗?一位工程师的追问引发讨论 — mostly_deterministic · 2026-09-08