从头预训练可控安全护栏,比微调别人模型更强
JosephJacks_ · x · 2026-09-07
- Ramin 争辩:从零预训练能让你对模型核心能力有深度控制。例如要部署一个面向网络安全的快速模型,可以在预训练阶段就「可验证地」引导其基础行为,使后训练阶段达到最强的护栏可靠性与韧性。
- 用别人的 checkpoint 做不到这一点,因为你不知道它的预训练数据与初始条件。
「模型」频道最新
- GPT-6 Astra 内测反响:计算机使用能力跨过质变门槛 — firstadopter · 2026-09-07
- 用户呼吁Astra开放跨上下文记忆导出:锁定数据比订阅折扣更重要 — VraserX · 2026-09-07
- 曝 GPT-6 Astra 可从单图自动建模 3D 城市街景并生成 breakdown — gabrielchua · 2026-09-07
- 开发者自建数据集仍因「蒸馏」理由被平台封号,吐槽申诉无门 — QuixiAI · 2026-09-07
- 谷歌 Astra Ultra 复赛 1800 分 Wally 棋 bot,胜负各半后认输 — MikePFrank · 2026-09-07
- ChatGPT 里的模型或非 10 万块 B200 训的那个,疑为二次蒸馏版 — teortaxesTex · 2026-09-07