数据科学家转 AI 工程常跳过的课:LLM 看到的是 token 不是文字
mdancho84 · x · 2026-09-11
数据科学家转 AI 工程时最容易忽略的基础,是模型实际接收的是 token 而非原始文本。
作者指出分词深刻影响构建真实 AI 系统时的诸多环节:
- 上下文窗口占用与 API 成本
- 代码生成质量
- 数字与标识符的处理
- 多语言性能
- embeddings 与 chat template
- 模型训练
他还澄清了几个常见误解:BPE 不等于自动字节级、SentencePiece 不是分词算法本身、token ID 并不具备语义。这类"实现细节"往往在调试 AI 系统、发现模型接收信息方式与预期不符时才暴露代价。
「模型」频道最新
- DeepSeek 快 4 倍、价格 1/10,编码场景智能差距还重要吗? — DigZealousideal5298 · 2026-09-12
- 用 12.5 万条真人对话微调 Qwen3.8-27B,去掉 AI 助手腔 — kvyb · 2026-09-12
- Muse、Instinct、Grok Bot 被赞今年最强产品级体验 — jeff_weinstein · 2026-09-12
- 微软发布 MAI-Transcribe-2:单模型多语言转录,自带说话人分离与时间戳 — mustafasuleyman · 2026-09-12
- GPT-6 与 Fable 5.1 同题建 3D 海港:都会忘给物体加支撑面 — ZhitingHu · 2026-09-12
- LiveBench agentic coding 评测遭质疑:4 个 Python 问题撑起异常高分 — teortaxesTex · 2026-09-12