高中生为 FLUX.2 造出 RGBA VAE,实现真透明 PNG 输出并附论文
Superb_Composer_3389 · reddit · 2026-09-30
一位刚高中毕业的开发者历时数月,让 FLUX.2 Klein 实现原生透明图像输出,并发布了个人首篇论文。
核心组件:
- RGBA VAE:将 FLUX.2 的 VAE 从 3 通道扩展到 4 通道并微调,使 latent 携带 alpha 通道。
- Extract-9B:基于 Klein Base 9B 的 LoRA,输入照片+同角度空背景,即可输出透明 PNG 物体,软阴影保留半透明。
- Remove-9B:擦除物体的 LoRA,可与 Extract 串联,只需涂抹目标区域。
性能数据(小测试集): Extract-9B 在 20 个留出物体上 IoU 达 0.934,6 步与 25 步效果相同,约 11 秒/图、10GB 显存(fp8)。RGBA VAE 相比原版有约 10–18% 的色彩误差,是塞入 alpha 的代价。
局限与对比: Remove-9B 对扁平图形填充效果一般,未测试 512² 以上分辨率;作者还基于 Qwen-Image-2.1 训练了提取器,精度相当且更快但需双 GPU,论文中做了对比,作者认为 Qwen 方案更好。
权重以非商用许可发布在 Hugging Face,附 Gradio demo,致谢 AlphaVAE 与 ostris 的 ai-toolkit。
所属事件:高中生开发者仅加 2305 参数让 FLUX.2 输出透明 PNG(2 条相关)→
「多模态」频道最新
- ComfyUI Refmod 实测:几秒生成角色参考,比 LORA 快太多 — Free_Pressure8623 · 2026-09-30
- Minimax H3 搭配 LM Studio Bionic Agent 写提示词的短视频演示 — fa6637 · 2026-09-30
- 用 MiniMax H3 生成《星际迷航》企业号贴纸视频 — Certain_Potato_4509 · 2026-09-30
- Google 推出 Diffusion Controller,轻量网络精准矫正图像生成对齐 — algo_diver · 2026-09-30
- MiniMax H3 在 5070 Ti 上本地生成 47 秒视频,全程约 7 分钟 — Mystvearn_ · 2026-09-30
- 无人机拍摄+高斯泼溅重建房产实景,效果优于 Google 3D 数据 — janusch_patas · 2026-09-30