推文线程论证 BPB 度量缺陷:tokenizer 三难困境无法全满足
RylanSchaeffer · x · 2026-10-03
Rylan Schaeffer 关于 Bits-per-Byte(BPB)作为语言模型评估度量的长线程收尾(11/11),给出领域走向判断:
- BPB 只度量编码长度本身,别无其他;学界赋予了它超出含义的解读。
- 一个(阴谋论式的)猜想:智能不在于压缩,而在于区分「正确」与「貌似合理但错误」的续写。
此前一条指出:更好的度量是可能的,但存在 tokenizer 三难困境——在三个合理诉求中,任何度量最多只能满足两个;选择度量就隐含地选择了能做哪些研究。
这是一条关于 LLM 评估方法论的实质性研究讨论。
所属事件:AI研究者发布分词器迷思讲座并证明三难困境(3 条相关)→
「研究」频道最新
- CMU 评测 Jev 计算机使用 agent:准确率低 10 倍、慢 1.5 倍 — wellecks · 2026-10-03
- Ai2 将亮相 COLM 2026:Olmo Hybrid 等全开放研究成果将集中展示 — allen_ai · 2026-10-03
- Anima Anandkumar 参与撰写联合国 AI 气候建模科学简报 — AnimaAnandkumar · 2026-10-03
- Allen AI 亮相 COLM 2026,将发布 Olmo-core 3 等新成果 — allen_ai · 2026-10-03
- UniReps 2026 研讨会截稿延至 10 月 10 日,12 月巴黎举行 — ClementineDomi6 · 2026-10-03
- SWE-chat v2 发布:23万条真实用户编程 Agent 交互提示词数据集 — Diyi_Yang · 2026-10-03