曝 DeepSeek V4.1 Flash 后训练细节:数据合成驱动 RL 复兴
joecole · x · 2026-09-10
一条关于 DeepSeek V4.1 Flash 后训练细节的转述/讨论帖(未经官方证实),要点:
- SFT、RL、OPD 均用朴素算法,重心放在数据合成
- 数据合成两条路线:通用 agent 与编码 agent,均基于真实仓库/任务(mcp/swebench 风格)
- 对问题、环境、验证器按正确性与难度做校准,且模型本身被训练来生成这类任务
- 推理努力作为标量,按 effort 分组做 credit assignment
- 基础设施用 DeepSeek 弹性算力做沙箱
- 按推理努力施加指数级长度惩罚以省 token
作者感叹其预训练与后训练侧的基础设施都"干货很多"。
「模型」频道最新
- NeoHorse-1-4B 冲上 Hugging Face 热门,主打智能体与工具调用 — TokenRhythm · 2026-09-10
- DeepSeek V4.1-Flash 引热议:552B 参数对标 GPT-5.6 — teortaxesTex · 2026-09-10
- 国产模型3D夜店实测:DeepSeek V4.1F氛围感碾压 — teortaxesTex · 2026-09-10
- DeepSeek 4.1 Flash现身Boeing榜:成绩未出 — victormustar · 2026-09-10
- Sentry CEO 实测:高阶订阅推理模型表现并不比常规旗舰强 — zeeg · 2026-09-10
- 最新模型已能熟练搞定 ffmpeg 音视频处理任务 — Flomerboy · 2026-09-10