爆料:Jev 全用合成数据,无预训练仅做后训练省下巨资
MaziyarPanahi · x · 2026-09-20
MaziyarPanahi 在回复 Sebastian Raschka 时称,Jev 的泛化能力令人印象深刻。据创始人暗示,其数据集 100% 为合成生成;且据称没有做预训练,只是对一个已有模型做后训练(post-training),这一路线被认为节省了大量成本。信息来自社区转述,尚未获官方完整确认。
所属事件:Raschka:一亿美元做 LLM 应全砸后训练(3 条相关)→
「Infra」频道最新
- llama.cpp 新 PR:为 Qwen 启用稀疏 FlashAttention 再提速 — jacek2023 · 2026-09-21
- 分析师:Agentic 场景 CPU 与 GPU 配比不会到 40:1,实际约 4:1 — BenBajarin · 2026-09-20
- QwenImage 2.1 INT4 版仅 4GB 显存即可跑通 — reeight · 2026-09-20
- 小米 MiMo V2.6 训练直播 4 天半烧掉 324 万美元 — teortaxesTex · 2026-09-20
- François Fleuret 提议仿生物安全等级建立「AI 安全等级」物理隔离设施 — francoisfleuret · 2026-09-20
- 摩根士丹利统计:七大超大规模厂商表外承诺超 3.1 万亿美元 — luisdans · 2026-09-20