从松下7525页技术报告合成工业QA,4B全参微调把Set-Match拉到42%

Industrial-Instruction: An End-to-End Framework for Building Instruction-Tuning and Benchmark Datasets from Industrial Technical Reports

Parsa Bakhtiari, Hassan Bashiri, Alireza Khalilipour, Masoud Nasiripour, Moharram Challenger

cs.CL

2026-08-24

用906份松下公开技术PDF做成约1.36万条五场景工业问答。Qwen3-4B全参微调把Set-Match从28.5%拉到42%,LoRA几乎无效,改写过的FailureSensorIQ准确率仍是0%。

这篇在解决什么

工厂里真正有用的知识经常躺在产品手册、规格书和故障表里,文字和表格缠在一起,还分散在多份 PDF 中。通用 RAG 和通用指令微调几乎碰不到这类语料。FailureSensorIQ 已经说明工业多选题有多难:大模型平均大约 53.5%,在通用数据上微调的开源模型平均大约 29%。公开的指令数据和基准,几乎没有从真实工业技术报告里长出来的。

Hamedan University of Technology 和安特卫普大学这条线要补的是两样东西:两套能下载的工业 QA 数据,以及从真实 PDF 走到这些数据的整条流水线。小模型(10B 以下)是刻意的服务对象,因为产线侧更在乎能不能部署,不在乎能不能调用最大的 API。

方法

源语料是松下官网公开的 906 份 PDF、7525 页。版面抽取用 3B 的 Dots.OCR,保留 Markdown 表格,删掉全部图片,再去掉空页、过短页和重复页 370 页。7525 页里 291 页抽取失败,约 3.8%,失败页里表格占 236 页。检索侧是 EmbeddingGemma(3 亿参数)加 FAISS。

题目按五种检索关系合成,对应真实 RAG 会碰到的脏情况:

生成时用 FailureSensorIQ 的 5334 道题当指令范例,强制五选一(可多选)JSON。同一套检索和提示跑了两遍:开源 Qwen3-30B-A3B-Instruct,和 API 的 Claude-Opus-4.6。Qwen 原始 23910 条,规则过滤掉约 43%(10353 条),剩下约 1.36 万,训练 12557、基准 1000。Claude 原始 26395 条,只丢掉 143 条(0.5%),训练 25252、基准 1000。本地生成大约 1 小时 43 分、3.2 美元;Claude API 大约 330 美元。

下游拿 Qwen3-4B-Instruct 做全参微调,两张 RTX 5090 训大约 12 小时。LoRA 扫了 rank 8 到 64,几乎不动。评测用 Set-Match Accuracy(选项集合相等,不管顺序)、F1 和 Jaccard,另加 FailureSensorIQ 和微调前后的完整 MMLU。

结果

没微调时,松下基准上 Qwen3-4B Set-Match 28.5%、F1 46.7%;Phi-3-mini 17.5%;RAG-Instruct-Llama3-8B 只有 0.7%。LoRA 最好一档把 Set-Match 从 28.50% 挪到 28.70%。全参微调才动得了针。

数据 / 设置Set-MatchF1
Qwen 合成,原模型28.5%46.6%
Qwen 合成,全参微调42.0%63.5%
Claude 合成,原模型(含 RAG)40.9%58.6%
Claude 合成,全参微调(含 RAG)56.4%72.7%

两组测试集各自从对应生成器的数据里划出,基线本来就不同,不能当成同一把尺上的对决。方向一致:全参微调在松下分布上大约提升 13 到 15 个点,加不加 RAG 几乎一样。

搬到 FailureSensorIQ,故事就裂开了。Qwen 数据微调把 AccOrgIBM 从 34% 降到 27%,F1-Micro 从 66% 升到 74%。Claude 数据微调把 AccOrgIBM 拉到 49.6%,F1-Macro / F1-Micro 反而掉到 33.5% / 50.3%。两种微调在改写过的 AccPerIBM 上都是 0%;RAG-Instruct-Llama3-8B 是 33%,它在松下基准上几乎不可用。

MMLU 全量 14042 题:基座 72.13%,Qwen 数据微调 70.87%(掉 1.26),Claude 数据微调 72.08%(掉 0.05)。遗忘主要落在 Humanities,道德情景相关科目大约掉 10 个点。

为什么重要

这是一条能复现的工业文档产线:OCR 保表、五种检索脏场景、开源和闭源生成器对照、小模型全参微调。3.2 美元就能做出能训的数据,330 美元换更干净的 JSON 和略大的涨幅,性价比不按两个数量级涨。可落地的结论更窄:LoRA 在这任务上几乎无效;最简 RAG 在模型已经背过同一分布之后几乎不加分;自产自测的松下分数会好看,换一种问法(FailureSensorIQ 扰动)4B 骨干会直接归零。

局限与存疑

语料只有松下公开英文文档,一家公司、一种文体。图片和图纸被整类丢掉,而工业页里图往往才是规格。问答由模型合成,过滤只抓格式,没有专家对错标注,松下基准和训练集同分布,全参微调涨分有一部分是在拟合生成器的题型。两组测试集不可比。AccPerIBM 全程 0%,流水线没有改写或对抗变体。论文自己把这一点写成未来工作。文中若干表格排版也有错位,读原始数字时需要对着正文核对。

术语

原文与代码

相关论文

全部论文解读