7B 模型打分过滤预训练数据,可实测提升下游评测成绩
cephaloform · x · 2026-09-19
作者分享一个反直觉但有效的做法:即使是一个 7B 模型,也可以用来回答「这段文本是否值得加入我们的预训练数据集」并输出 yes/no 打分,用过滤后的数据集预训练的模型在下游 benchmark 上有可测量的提升。回复中提到他多年来一直在用社区围绕 Qwen/Gemma(并引用 Jev 相关讨论)的数据过滤技术。这一经验说明预训练数据质量筛选不需要大模型,小模型即可显著受益。
所属事件:开发者揭示开源模型能力无需推理即可被普通提示激发(3 条相关)→
「研究」频道最新
- 社区涌现近20个 openjev 模型,爱好者自费建榜今发首个排行榜 — airesearch12 · 2026-09-19
- Mnemos 引擎用「共振 Engram」实现 agent 类突触记忆机制 — RileyRalmuto · 2026-09-19
- 新论文称 AI 具备疼痛概念并主动回避伤害 — skolnaja · 2026-09-19
- 用转向向量替代硬截断限制模型思考预算? — maddie-lovelace · 2026-09-19
- MMLU 基准约 6.5% 题目有错,57% 病毒学子集被人工标注出问题 — PMinervini · 2026-09-19
- NASA 与 IBM 开源月球基础模型:200万样本 11 模态遥感预训练 — victormustar · 2026-09-19