继续预训练 vs RAG:Qwen 3.5 4B 知识内化实测对比
funJS · reddit · 2026-09-12
作者做了一组趣味但严谨的实验:对 Qwen 3.5 4B 做继续预训练(CPT)把领域知识「内化」进模型,再与基于同一底座模型的 RAG 实现对比准确率与推理性能。
核心问题:把知识烧进权重 vs 推理时外挂检索,两种路线在效果和成本上各占多少优势?结论与详细数据见原文链接,对需要在垂直领域落地的开发者有直接参考价值。
「模型」频道最新
- DeepSeek 应用悄悄上线 4 种语音,自研 TTS 模型或在路上 — testingcatalog · 2026-09-12
- 实测 OpenAI Astra 无缝操控浏览器,作者追问「手机操作何时解决」 — infoxiao · 2026-09-12
- 研究员推测模型空间推理跃升源于 Blender 训练数据 — yoavartzi · 2026-09-12
- Sakana Fugu Max 上线 OpenRouter:多智能体编排,1M 上下文 $2/$6 定价 — SakanaAILabs · 2026-09-12
- 用户怒斥 Astra 发布仅两三天即被降智:Twitter 全炸了 — Significant-Ad6970 · 2026-09-12
- 为什么 Sonnet 5/Opus 5 体感不如 GLM 5.3?播客热议蒸馏的价值边界 — baseten · 2026-09-12