开发者发现 vLLM 可传入 input embeds,猜想微调 token 被严重低估
cephaloform · x · 2026-10-09
开发者 @cephaloform 表示此前因 vLLM 接口变动太快而回避使用,现在才发现 vLLM 支持传入 input embeds,打算实际尝试。他在讨论中提出一个猜想:社区可能严重低估了 prompt tuning 类微调 token(以及 DreamBooth 式高显存配置)的潜力,如果推理框架普遍支持接受 inputsids/embeds,结合进化算法或许能打开新玩法。
「Infra」频道最新
- TokenRouter 实现 token 级 LLM 路由服务,解码吞吐提升最高 64 倍 — nics-efc · 2026-10-09
- SparseDecoding 解码感知剪枝:对齐生成分布,A100 解码提速至 1.48 倍 — encodelab · 2026-10-09
- Arduino VENTUNO Q 上用 FEX 跑 x86 版 Edge,还有 GPU 加速 — unixterminal · 2026-10-09
- Edge0 开源月余:35B 模型 iPhone 飞行模式运行,峰值内存仅 1.8GB — FinanceYF5 · 2026-10-09
- 免依赖 CLI 直接跑 Qwen Image 2.1 与 MiniMax H3,模型自动下载 — TracerBulletX · 2026-10-09
- llm-tune 开源:一键为本地 LLM 找最优量化与推理参数 — Distinct-Pie2389 · 2026-10-09