BAAI 提出 Wnuan:三阶段后训练提升企业知识问答能力
BorisMPower · x · 2026-08-05
BAAI 发布了针对企业专有知识问答的后训练管线 Wnuan,旨在让模型学习企业知识的同时不丢失通用能力。
核心方法
Wnuan 采用三阶段训练流程:
- 从文档中构建任务导向的监督数据;
- 结合通用数据回放进行监督微调(SFT);
- 对残差错误应用强化学习(RL)。
实验结果
- 在 707 个问题的 WnuanBench 上,32B 模型的可接受回答率从适应前的 52.76% 提升至 SFT 后的 80.06%,最终在 RL 阶段达到 91.51%。
- 在匹配的 100 次更新协议下,残差错误采样优于全池采样和随机采样。
- 代价是通用基准测试平均下降了 5.17 个百分点,主要集中在指令遵循方面。
「研究」频道最新
- 近期人形机器人论文盘点:力矩增强学习 — carlosdponx · 2026-08-05
- AI 模型谁最幽默?Humor Arena 基准:Claude 暂列第一 — julianweisser · 2026-08-05
- Artificial Analysis 推出端点精度指数:GLM-5.2 等模型 API 精度差异显著 — ArtificialAnlys · 2026-08-05
- Normal Computing 发布热力学数字计算机 CN101 架构论文 — ColesThermoAI · 2026-08-05
- PyTorch 教程:用 Torch Inductor 算子融合优化 GPU 显存带宽 — PyTorch · 2026-08-05
- NeurIPS 2026 征文:聚焦元智能体与自动化设计 — RobertTLange · 2026-08-05