Raschka:一亿美元做 LLM 应全砸后训练
Sebastian Raschka 在播客中被问到「若有 1 亿美元如何打造 SOTA 级 LLM」,他的答案是:不从头训练,而是选用现成模型,把预算全部投入后训练(post-training)。讨论中 MaziyarPanahi 补充爆料称,据创始人暗示,Jev 的数据集 100% 为合成生成,且没有做预训练、仅做后训练,从而省下巨额成本,其泛化能力仍令人印象深刻。
2026-09-20 ~ 2026-09-20 · 3 条相关
- 爆料:Jev 全用合成数据,无预训练仅做后训练省下巨资 — MaziyarPanahi · 2026-09-20
- Sebastian Raschka:拿 1 亿美元做 LLM,我会全砸后训练 — rasbt · 2026-09-20
- Sebastian Raschka:若有 1 亿美元做顶级 LLM,首选给现有模型做后训练 — MaziyarPanahi · 2026-09-20