LLM 为什么不真正"读字":从 BPE 到字节级模型的tokenization脉络
jbhuang0604 · x · 2026-10-09
- 腾讯首席 AI 科学家黄俊杰(JB Huang)发布科普视频,讲解 LLM 表示文本的真实方式:模型并不是像人一样阅读单词。
- 视频沿技术脉络展开:从单词与 BPE 等子词 token,讲到字节级模型 ByT5、CANINE、MegaByte、BLT 以及 H-Net,梳理 tokenization 方案从子词到字节的演进及其权衡。
「研究」频道最新
- 自动驾驶一线经验沉淀:半监督学习“炼金术”长文 — Visual_Ability · 2026-10-09
- RLVR 被指忽视「求所有最小解」类问题:新方法找到解数量翻倍 — thoma_gu · 2026-10-09
- 有人辟谣:AI并未解决千禧年难题Navier-Stokes,Lean证明偷换概念 — gerardsans · 2026-10-09
- 新开源基准3JSBench:前沿模型能解千禧难题却建不好3D物体 — ycombinator · 2026-10-09
- Moonworks 发布 Lunara:扩散混合 Transformer 主打艺术审美,人类盲评全场最高 — paper-crow · 2026-10-09
- 实测 ChatGPT 与 Gemini 引用偏好:巴西本地域名占比达 41.4% — gaganghotra_ · 2026-10-09