训练大模型前如何用小模型预测性能
BlancheMinerva · x · 2026-07-05
@BlancheMinerva 提出一个训练 scaling 的实践问题:在训练 P 参数、D token 的大模型之前,通常会先训练小模型来预测大模型的性能。他询问应采用哪种 scaling 方案才能得到最佳预测——是固定所有模型的 D、固定 P/D 比例,还是其他做法。该问题涉及 scaling laws 在性能外推中的方法论选择。
所属事件:学者探讨大模型缩放定律的拟合与参数选择(4 条相关)→
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22