Hugging Face 研究者谈小模型与通用模型取舍

Hugging Face 研究者、FineWeb 论文作者 Antoine Chaffin 回应关于「探索性模型 vs. 性能最大化模型」的讨论。他表示,若要在超大规模任务上追求最高吞吐量,微调过的小模型仍是王道;同时承认用 27B 级通用模型给预训练数据做标注和重排序确实「很疯狂」,但若压缩得当,通用模型在部署上非常有优势、更省部署成本。

2026-10-09 ~ 2026-10-09 · 2 条相关