无需提示词的 Krea 2 分块放大法:利用视觉编码切片实现 4K 放大
blakeem · reddit · 2026-08-06
作者分享了使用 Krea 2 模型进行图像放大的新工作流,并开源了 ComfyUI 节点。
传统分块放大的痛点
- 常规分块放大时,由于提示词描述的是整张图,强提示词依从模型会在每个分块中尝试重建整图内容,导致边缘出现伪影或重复物体。
创新解决方案
- Krea 2 使用 Qwen3-VL 视觉语言模型作为文本编码器。作者对全图进行一次视觉编码,生成带有空间位置信息的视觉 token 网格。
- 针对每个分块,仅截取覆盖该区域的 token 替代正向提示词,完全弃用文本提示词。
- 这种方法让每个分块准确知道其实际内容,且所有分块共享同一全局编码,从而在色调、调色板和跨越接缝的结构上保持高度一致,消除了物体重复和分块间的漂移。
效果与开源
- 该方法在 0.42-0.5 的去噪强度下,单次即可将图像放大至 4K 以上,细节丰富且连贯。
- 相关节点已在 GitHub 免费开源,且该方法理论上可适配任何带有 VLM 编码器的模型。
「编程与Agent」频道最新
- 用 Claude Code 驱动 ComfyUI,Ideogram 4.0 出图实测 — nark0se · 2026-08-06
- ClickUp 研发动态生成 UI 的 AI 智能体 — testingcatalog · 2026-08-06
- Mnemos 架构:用扩散激活机制打造 Agent 的「个人品味」 — RileyRalmuto · 2026-08-06
- 实战横评:Claude Opus 4.8 担纲主力,GPT 5.6 Sol 适合打下手 — Kaladayn · 2026-08-06
- 开发者构建仓库机器人安全监控:实时风险检测与自动熔断 — ___Mufasaa · 2026-08-06
- GitHub 热门项目:一键提取网站设计系统并转为 tokens — tom_doerr · 2026-08-06