AntLing 开源 Ling-3.0 模型:WSM 合并替代 LR 衰减
AcanthisittaOk1699 · reddit · 2026-08-19
AntLing 开源了 Ling-3.0-tiny 和 Ling-3.0-flash 的 6 个 Base 模型检查点,覆盖预训练、中期训练和 WSM 合并阶段。这些模型尚未进行后训练,旨在为研究者提供灵活的起点。
核心亮点:
- WSM 技术:用加权检查点合并(WSM)替代传统的学习率(LR)衰减,使训练过程更适合持续预训练,并能离线探索不同的 LR 衰减策略。
- 统一配方:tiny-base 和 flash-base 共享同一训练配方,便于社区在小规模验证策略后扩展至大规模。
模型规格:
- Ling-3.0-tiny-base:总参数 7.9B,激活参数 1.3B。虽然总参数仅为 Ling-2.5-mini 的一半,但在多数基准测试中表现相当或更优,尤其在代码任务上表现出色。
- Ling-3.0-flash-base:总参数 124B,激活参数 5.1B。在代码、推理和长上下文任务上表现强劲,可匹敌参数大 2-3 倍的模型。
所属事件:AntLing 开源 Ling-3.0 基础模型检查点(2 条相关)→
「模型」频道最新
- MLX 框架优化 Qwen 推理,挑战本地极限 — gajesh · 2026-08-20
- Harmony 标签干扰 ChatGPT,致其错误解释 DeepSeek — mitsuhiko · 2026-08-20
- 演示:如何搭建 MINIMAX H3 — Background_Shift_333 · 2026-08-20
- Unsloth 发布 Qwen3.8-27B 新量化版:精度提升 10% — danielhanchen · 2026-08-20
- Hugging Face 放出 SmolLM3 mid-training 检查点,回应 200 倍效率之争 — eliebakouch · 2026-08-20
- 5.6 Sol Ultra 搭配 computer use 被指像 Opus 4.5 搭配 MCP — curious_vii · 2026-08-20