LLaDA 2.2 的 block-diffusion MoE 会自己编辑输出
omarsar0 · x · 2026-07-26
这条是 LLaDA 2.2 的训练流程和推理结构图说明。
- 图里展示了三阶段流程:先做带 Levenshtein editing 的预训练,再用长上下文和 agent 数据做 SFT,最后进入同样机制下的 RL。
- 推理侧则通过 Block Routing,在每个 block 里只选择一部分专家,减少路由开销。
- 整个设计的目标是让模型能“编辑”自己生成的片段,而不是把早期错误直接锁死。
所属事件:蚂蚁开源扩散大模型 LLaDA 2.2,主打智能体与自纠错(10 条相关)→
「模型」频道最新
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11