FineWeb 作者:用 27B 模型标注预训练数据很疯狂,但通用模型更省部署

antoine_chaffin · x · 2026-10-09

FineWeb 团队作者 antoinechaffin 回应质疑:用 27B 级通用模型给预训练数据做标注甚至重排序确实「很疯狂」,但若能把它压缩好,通用模型在部署上非常有用——零样本能力和多任务学习能带来专门模型难以获得的能力。他也承认,面对大规模、重复性的具体任务,微调小模型(如 ModernBERT/mmBERT)在吞吐量上始终占优,最好蒸馏过去。

所属事件:Hugging Face 研究者谈小模型与通用模型取舍(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →