纪念 Solomonoff 百年:大模型预训练与压缩的关系
ryangr · x · 2026-07-25
这条帖分享了一篇纪念 Ray Solomonoff 100 周年诞辰的文章,主题是压缩与智能的关系。
配图里的核心论证是:
- 预训练大语言模型本质上是在做 next-token prediction;
- 预测概率可以换算成 surprisal,单位是 bit;
- 一段序列的总编码长度就是各 token surprisal 的累加;
- 模型越会预测,下次编码所需的比特就越少;
- 因此预训练里使用的 cross-entropy,本质上就是平均 surprisal。
文章想表达的是:LLM 预训练其实是在显式优化对数据序列的“尽可能短”的编码。
所属事件:纪念Solomonoff百年诞辰:探讨大模型预训练与压缩的关联(2 条相关)→
「研究」频道最新
- AI 工程师必须掌握的 10 种 agent 评测方法 — Roger_M_Taylor · 2026-07-25
- HUG 用 100 万帧人类视频训练零样本机器人抓握 — chris_j_paxton · 2026-07-25
- NeurIPS 论文用 CAPA 指出:模型越像,AI 监督越难 — dhadfieldmenell · 2026-07-25
- 模型截图自认“拟人化”自己,把技术限制说成了累了 — sebkrier · 2026-07-25
- Reddit 讨论认为,对话上下文加 SOP 能稳住 AI 推理 — Local-Reading-1624 · 2026-07-25
- 实验室训练 10T 参数模型,到底在用什么数据 — Ill_Fisherman8352 · 2026-07-25