LLM为何有“Reddit味”?训练数据演变的三个时代
ethayarajh · x · 2026-07-31
大型语言模型(LLM)常带有一种特定的“Reddit语气”,这与其训练数据的演变密切相关。回顾历史,使用Reddit训练模型经历了三个阶段:
- 作为数据过滤器(2019年):在GPT-2时期,OpenAI利用Reddit上 karma 达到3分以上的帖子链接来抓取高质量网页,构建了WebText数据集。
- 特定子版块用于特定任务(2019-2023年):研究者提取 /r/ELI5 和 /r/TL;DR 等特定板块的数据,用于训练模型的问答和摘要能力,经典的RLHF论文就使用了 /r/TL;DR 的数据来训练奖励模型。
- 广泛提取人类偏好(2023年至今):斯坦福NLP发布了SHP数据集,包含来自18个子版块的38.5万条成对偏好数据,进一步将Reddit的社区风格深度融入了模型对齐过程。
「研究」频道最新
- ICML 论文:LLM 存在根本缺陷,绕过安全护栏就像玩“西蒙说” — lescarr · 2026-07-31
- LLM连破数学猜想引发学者信仰危机:我们究竟在做什么? — zetalyrae · 2026-07-31
- 拆解 DeepSpeed 引擎架构:如何用一个「上帝对象」安全控制复杂训练 — Mahmoud_Zalt · 2026-07-31
- M5Stack 开办强化学习机器人研讨会:从仿真到真机部署 — ShawnHymel · 2026-07-31
- 清华等提出 Cortex 框架,破解机器人长程任务执行难题 — jiqizhixin · 2026-07-31
- MegaLoc 图像检索模型登顶多榜单,支持任意场景定位 — rsasaki0109 · 2026-07-31