故事提示扩成 13 类体裁,5 万条数据把 Llama 写作分拉到 33

Scaling Creative Writing Beyond Story-Centric Data with Attribute-Guided Genre Expansion

Hwan Chang, Yongil Kim, Heuiyeen Yeen, Yireun Kim, Jinsik Lee, Hwanhee Lee

cs.CL

2026-08-14

把 Reddit 故事提示和人工整理的体裁属性拼起来,合成 5 万条跨 13 类创意写作数据。Llama-3.1-8B 全量微调后,Arena Hard 写作从 2.9 升到 33.0。

这篇在解决什么

用户天天让模型写说唱、剧本、游戏设计文档,公开的创意写作数据却几乎全是故事。故事会叙事,不会押韵,也不会按 Suno 的时间轴排歌词。把故事数据再放大一圈,结构缺口还在。代码和数学的合成指令能靠可执行约束或标准答案撑住质量;创意写作没有这种短信号。通用 Self-Instruct 很容易产出主题很散、体裁规格很糊的提示。

缺口有三条:体裁要覆盖真实需求,每类体裁的结构约定要写进数据,提示的约束强度要从开放写到写死。LG AI Research 和中央大学这篇把这三条收成一套可复制的合成管线。

方法

框架把主题和体裁拆开。主题来自人工写的 Reddit r/WritingPrompts。GPT-5-mini 先做安全过滤,去掉 686 条有害内容,再清掉 861 条跑题的版务碎片。每次生成随机抽 5 条故事当 few-shot,只借主题,不借体裁。

体裁属性是人定的。先从百科和写作手册抽定义,GPT-5 列出候选维度,再人工合并、删掉太泛的、补上漏的,每类留下 5 到 15 个属性。说唱看押韵格式和 flow,剧集看叙事弧和人物弧。采样时 k 从 0 到全部属性均匀抽:k 等于 0 就是开放题,k 越大提示越死。

查询由 GPT-5-mini 写,一次五条,并明确要求主题、语气、结构都要散开。回答由 Qwen3-235B-A22B-Thinking 写。独立的 Qwen3-30B-A3B-Instruct 当裁判,分数低于均值两个标准差的样本丢掉。落下来是 Multi-Genre Collection:5 万条、13 类体裁加一条长尾 Etc.(日记、漫画脚本、互动小说)。查询嵌入做 t-SNE,体裁各自成团,重叠很小。

下游实验对 Llama-3.1-8B-Instruct、EXAONE-3.5-7.8B、Qwen3-8B 做 LoRA SFT,rank 128,两轮,截断 4096。对照包括写作专项的 LongWriter-glm4-9B。

结果

全量 5 万条微调之后,三个基座在 Arena Hard 写作子集、WritingBench 创意域、以及 13 类各 50 条的自建测试集上都涨。

模型Arena HardWritingBench自建 13 类
LongWriter-glm4-9B2.347.249.5
Llama 基座 / +SFT2.9 / 33.043.7 / 60.644.4 / 68.4
EXAONE 基座 / +SFT10.4 / 22.952.7 / 59.464.9 / 66.2
Qwen3-8B 基座 / +SFT8.0 / 34.256.1 / 63.667.7 / 69.3

相对基座,Llama 的 Arena Hard 加 30.1 分,Qwen3 加 26.2 分,三个微调后的模型都超过 LongWriter。为了跟现有写作语料公平比,各抽 2 千条微调 Qwen3-8B:Multi-Genre 在 Arena Hard 上 7.5,LongWriter-6k 7.0,DeepWriting-20k 4.9。差距在这里小得多。

体裁数量从 0 加到 13,NoveltyBench Distinct 从 3.87 单调升到 4.81。WritingBench 换 DeepSeek v3.2 和 Gemini 3 Flash 当裁判,涨幅方向不变。50 条人工评分:Multi-Genre 59.3,LongWriter 57.7,DeepWriting 56.9。定性例子里,Suno 格式的死亡核歌词,微调后会补标题、世界名、角色和分轨时间戳,基座只有空泛的副歌。

为什么重要

这是一条很工程的合成数据配方:主题用人写的种子,体裁用人工属性卡住,回答用强模型灌。想让 8B 级模型会写歌词、剧本、游戏文档,直接拿故事语料继续堆,收益有限。13 类一起训,输出更新鲜,也不只是把故事换皮。CIKM 2026 的投稿设定清楚:这是数据工作,不是新结构。

2 千条对照里 Arena Hard 只比 LongWriter 高 0.5 分,人工分差也只有 1.6。全量 5 万条相对基座的大跳,有相当一部分来自「有写作 SFT」本身。体裁扩张是真贡献,幅度没有 Arena Hard 那一列看起来那么夸张。

局限与存疑

论文没有单独的局限节。查询和属性抽取走 GPT-5 系列,回答走 Qwen3-235B,整份语料是合成的,风格会沾上教师模型。自建测试集用同一教师当参考答案,同分布、同口味。主裁判之一 GPT-5-mini 也是查询生成器,作者后来换了独立裁判和人工抽检,人工分差仍然很窄。没有公开代码或数据链接。LoRA 只训两轮,没有跟全量 SFT 或偏好学习比。英文过滤后的 Arena Hard / WritingBench,不能直接外推到中文或其他语言的体裁约定。

术语

原文与代码

相关论文

全部论文解读