K2 Horizon 训练数据曝光:20T tokens 中 10T 为合成数据
rohanpaul_ai · x · 2026-09-11
K2 Horizon 的训练数据细节:
- 每个模型预训练约 20T tokens,混合网页、代码、数学、科学、多语言与合成数据
- 约 17% 的预训练语料含显式推理轨迹,预训练阶段约用了 10T 合成 tokens
- 后训练阶段生成了 1 亿+ 独特任务,通过 SFT、模型合并、强化学习和专项 Agent 训练发布 pipeline
- 已开放的预训练数据集 TxT360-v2(5.3TB)已上传 Hugging Face
所属事件:K2 Horizon 预训练 20T tokens,LoRA 并行解码提速 3 倍(2 条相关)→
「模型」频道最新
- 直播精读 Anthropic 1022 页模型内心独白:80 页全在琢磨 hCaptcha — voooooogel · 2026-09-11
- Gradio 创始人发问:现在还有谁该为闭源模型 API 付费? — Sentdex · 2026-09-11
- 网传 DeepSeek-V4.1-Flash 技术报告:552B MoE 主打百万级上下文的 KV 缓存压缩 — burkov · 2026-09-11
- 评论:DeepSeek 只发内部研究件不发产品,解释其评测落差 — teortaxesTex · 2026-09-11
- 用户反问 Claude「人类是否真实」,模型回应模拟假说 — vishalmisra · 2026-09-11
- GPT-6 级模型只会死磕目标,用对前提才能榨出价值 — daniel_mac8 · 2026-09-11