实验室训练 10T 参数模型,到底在用什么数据
Ill_Fisherman8352 · reddit · 2026-07-25
帖子在问:实验室训练所谓 10T 参数模型 时,到底在用什么数据配比。
作者的疑问是,参数规模如果继续放大 3 倍,训练数据是否也要同步增长;但自 GPT-4 以来又一直在讨论“互联网数据墙”,那这些新增数据究竟来自哪里?他列出的可能性包括:
- 模型在推理过程中生成的 reasoning chains / 合成推理链
- 通过 Mercor 之类渠道收集的人类推理轨迹
- 其他尚未公开的混合数据方案
本质上,这是一个关于大模型训练数据来源与数据墙的实质性讨论。
「研究」频道最新
- 一套 10 题 LLM 机制判别测试,检验歧义推理能力 — Local-Reading-1624 · 2026-07-25
- 一套 10 题 LLM 机制判别测试,考察歧义与可证伪性 — Local-Reading-1624 · 2026-07-25
- 一篇文章用压缩与智能的关系纪念 Solomonoff 百年 — ryangr · 2026-07-25
- AI 工程师必须掌握的 10 种 agent 评测方法 — Roger_M_Taylor · 2026-07-25
- 一套可复制的 LLM 分析 SOP 追求更可靠结论 — Local-Reading-1624 · 2026-07-25
- HUG 用 100 万帧人类视频训练零样本机器人抓握 — chris_j_paxton · 2026-07-25