不微调 9B 参数,只搜 4K 维 token 嵌入:小众微调法重提
cephaloform · x · 2026-10-09
作者 cephaloform 介绍一种非常规微调思路:不改动模型参数,而是直接微调(用进化算法搜索)prompt 中 token 的嵌入表示。他给出的理由:token 嵌入维度很低(约 4K 维,对比 9B 参数量),进化算法在这种低维搜索空间上更容易奏效;且这种方式不像 LoRA 那样破坏算子内核(kernels)。作者补充称该方法早年曾在部分任务上超过完整模型微调的表现,并附上了相关链接。
这是一种介于 prompt engineering 与参数微调之间的路线:把「学什么」从模型权重转移到输入嵌入上,计算开销小、实现门槛低。对于想在本地小成本定制模型行为的开发者是一个值得了解的方向。
「研究」频道最新
- 多伦多大学人工智能意识计划招聘AI意识哲学博士后 — KathleenACreel · 2026-10-09
- PS 插件实测 SAM3+VITMatte 抠图:边缘与透明度仍不理想 — Just_Second9861 · 2026-10-09
- 用 AI 在 NASA 数据集里找外星植物,称已获线索 — BLUECOW009 · 2026-10-09
- Looped 模型或能抵御蒸馏攻击:推理藏在潜空间而非可见 CoT — moyix · 2026-10-09
- LLM-as-a-Verifier 开源:弱模型验证强模型,Terminal-Bench 达 69.2% SOTA — Azaliamirh · 2026-10-09
- 线性注意力模型的量化研究:Qwen 与 Kimi 为主角 — kroggens · 2026-10-09