IFM 开源训练库 xLLM:tokenizer 和 chat template 可热改,千行 Jinja 不用重跑
HildeKuehne · x · 2026-09-29
IFM Lab 发布训练库 xLLM,主打灵活可变的在线数据 pipeline,支持对 chat/instruction 数据做微调:tokenizer 与数据配比可在训练中随时调整,换新 tokenizer 或 chat template 只需改配置,不用重跑数据处理。特性包括:
- 直接从 JSONL 流式 tokenization;
- 数据配比可配置,带缓冲 shuffle;
- Bestfit packing 在序列内保持文档完整且 padding 极少;
- 并行加载与异步准备把 CPU 工作与 GPU 训练重叠,吞吐不受影响。
团队强调灵活性不是「锦上添花」:他们在训练中不断发现 chat template 的小 bug(最终 Jinja 有 1000 行),正是能快速调整 tokenizer 和 template 才让训练中途完成修复。共同作者 Hilde Kuehne 转发了这一发布。
所属事件:IFM Lab 开源 xLLM 训练库,tokenizer 与数据配比可热切换(2 条相关)→
「Infra」频道最新
- antirez:企业配额用完别慌,自建 DGX Spark 与 Mac Ultra 机群托底 — antirez · 2026-09-29
- Ornith-1.5 三款模型开源 DFlash 投机解码草稿权重 — jacek2023 · 2026-09-29
- 黄仁勋问答称英伟达股票被低估,未来将回购数千亿美元 — firstadopter · 2026-09-29
- Transformers 原生支持运行 llama.cpp GGUF 量化模型 — ariG23498 · 2026-09-29
- Uber Eats 排序模型每秒 800 万次预测,工程团队公开特征一致性方案 — AxSaucedo · 2026-09-29
- Qdrant 推出 Constella 研究预览,换查询嵌入模型无需重建全部向量 — qdrant_engine · 2026-09-29