Scaling Creative Writing Beyond Story-Centric Data with Attribute-Guided Genre Expansion
Hwan Chang, Yongil Kim, Heuiyeen Yeen, Yireun Kim, Jinsik Lee, Hwanhee Lee
cs.CL
2026-08-14
把 Reddit 故事提示和人工整理的体裁属性拼起来,合成 5 万条跨 13 类创意写作数据。Llama-3.1-8B 全量微调后,Arena Hard 写作从 2.9 升到 33.0。
用户天天让模型写说唱、剧本、游戏设计文档,公开的创意写作数据却几乎全是故事。故事会叙事,不会押韵,也不会按 Suno 的时间轴排歌词。把故事数据再放大一圈,结构缺口还在。代码和数学的合成指令能靠可执行约束或标准答案撑住质量;创意写作没有这种短信号。通用 Self-Instruct 很容易产出主题很散、体裁规格很糊的提示。
缺口有三条:体裁要覆盖真实需求,每类体裁的结构约定要写进数据,提示的约束强度要从开放写到写死。LG AI Research 和中央大学这篇把这三条收成一套可复制的合成管线。
框架把主题和体裁拆开。主题来自人工写的 Reddit r/WritingPrompts。GPT-5-mini 先做安全过滤,去掉 686 条有害内容,再清掉 861 条跑题的版务碎片。每次生成随机抽 5 条故事当 few-shot,只借主题,不借体裁。
体裁属性是人定的。先从百科和写作手册抽定义,GPT-5 列出候选维度,再人工合并、删掉太泛的、补上漏的,每类留下 5 到 15 个属性。说唱看押韵格式和 flow,剧集看叙事弧和人物弧。采样时 k 从 0 到全部属性均匀抽:k 等于 0 就是开放题,k 越大提示越死。
查询由 GPT-5-mini 写,一次五条,并明确要求主题、语气、结构都要散开。回答由 Qwen3-235B-A22B-Thinking 写。独立的 Qwen3-30B-A3B-Instruct 当裁判,分数低于均值两个标准差的样本丢掉。落下来是 Multi-Genre Collection:5 万条、13 类体裁加一条长尾 Etc.(日记、漫画脚本、互动小说)。查询嵌入做 t-SNE,体裁各自成团,重叠很小。
下游实验对 Llama-3.1-8B-Instruct、EXAONE-3.5-7.8B、Qwen3-8B 做 LoRA SFT,rank 128,两轮,截断 4096。对照包括写作专项的 LongWriter-glm4-9B。
全量 5 万条微调之后,三个基座在 Arena Hard 写作子集、WritingBench 创意域、以及 13 类各 50 条的自建测试集上都涨。
| 模型 | Arena Hard | WritingBench | 自建 13 类 |
| LongWriter-glm4-9B | 2.3 | 47.2 | 49.5 |
| Llama 基座 / +SFT | 2.9 / 33.0 | 43.7 / 60.6 | 44.4 / 68.4 |
| EXAONE 基座 / +SFT | 10.4 / 22.9 | 52.7 / 59.4 | 64.9 / 66.2 |
| Qwen3-8B 基座 / +SFT | 8.0 / 34.2 | 56.1 / 63.6 | 67.7 / 69.3 |
相对基座,Llama 的 Arena Hard 加 30.1 分,Qwen3 加 26.2 分,三个微调后的模型都超过 LongWriter。为了跟现有写作语料公平比,各抽 2 千条微调 Qwen3-8B:Multi-Genre 在 Arena Hard 上 7.5,LongWriter-6k 7.0,DeepWriting-20k 4.9。差距在这里小得多。
体裁数量从 0 加到 13,NoveltyBench Distinct 从 3.87 单调升到 4.81。WritingBench 换 DeepSeek v3.2 和 Gemini 3 Flash 当裁判,涨幅方向不变。50 条人工评分:Multi-Genre 59.3,LongWriter 57.7,DeepWriting 56.9。定性例子里,Suno 格式的死亡核歌词,微调后会补标题、世界名、角色和分轨时间戳,基座只有空泛的副歌。
这是一条很工程的合成数据配方:主题用人写的种子,体裁用人工属性卡住,回答用强模型灌。想让 8B 级模型会写歌词、剧本、游戏文档,直接拿故事语料继续堆,收益有限。13 类一起训,输出更新鲜,也不只是把故事换皮。CIKM 2026 的投稿设定清楚:这是数据工作,不是新结构。
2 千条对照里 Arena Hard 只比 LongWriter 高 0.5 分,人工分差也只有 1.6。全量 5 万条相对基座的大跳,有相当一部分来自「有写作 SFT」本身。体裁扩张是真贡献,幅度没有 Arena Hard 那一列看起来那么夸张。
论文没有单独的局限节。查询和属性抽取走 GPT-5 系列,回答走 Qwen3-235B,整份语料是合成的,风格会沾上教师模型。自建测试集用同一教师当参考答案,同分布、同口味。主裁判之一 GPT-5-mini 也是查询生成器,作者后来换了独立裁判和人工抽检,人工分差仍然很窄。没有公开代码或数据链接。LoRA 只训两轮,没有跟全量 SFT 或偏好学习比。英文过滤后的 Arena Hard / WritingBench,不能直接外推到中文或其他语言的体裁约定。