语言带宽仅约 56k 调制解调器,模型训练的只是世界的有损残影
yunta_tsai · x · 2026-09-27
作者提出一个关于 AI 训练本质的观点:语言不是现实本身,而是对现实的一种缓慢社会压缩——口语英文每秒只携带几十比特新信息,低于 56k 调制解调器的带宽,文本略密但仍是细管道,神经系统的绝大部分体验从未进入语料。
他认为 token 是人类书写的偶然产物;如果给模型接入未压缩的原始数据流(电磁波与力,而非 token),第一个问题将不再是预测,而是决定什么才是基本单元。一个直接感知原始场的智能会发明自己的压缩方式:事件、不变量、因果结构,以及我们尚未命名的几何。
「漫话AGI」频道最新
- 观点:实验室自选披露事故时,失控其实早已发生 — birchlse · 2026-09-27
- 观点:说 AI Agent「失控」是在为开发者开脱责任 — AlexTensor · 2026-09-27
- Roko 抛争议论:解开 AI 对齐问题或许反而是坏事 — basedjensen · 2026-09-27
- Google 28 岁:新生代已是 AI 原住民,不再只要搜索答案 — dejanseo · 2026-09-27
- Colossus 价值分析:千亿 AI 工厂,出租 GPU 或是最差用法 — mitchdeg · 2026-09-27
- 炒作 AI 反叛的报道会否成为训练数据,让模型照剧本学坏? — Ghost_Pilot_MD · 2026-09-27