Meta 新论文:字节模型经充分训练与蒸馏可反超 token 模型

Meta FAIR 与华盛顿大学发布论文《Breaking the Token Ceiling》,质疑行业默认依赖分词器的做法。研究探讨小型模型直接读取原始字节(词表约 256)能否超越 token 模型,结论是经过足够训练以及蒸馏更强的字节模型后,字节模型的表现可以反超 token 模型,并在八大基准上进行了系统验证。

2026-10-10 ~ 2026-10-10 · 2 条相关