【ComfyUI】QwenImageEdit + Wan2.2 写真套图短视频生成

发布时间:2026/9/19 19:36:08
【ComfyUI】QwenImageEdit + Wan2.2 写真套图短视频生成
今天给大家演示一个写真套图与短视频一键生成的 ComfyUI 工作流。本套工作流围绕图生图、多场景续写以及自动视频合成展开,通过双模型结构、独立高低保真 UNet、可控的 Prompt 解析链路和批处理节点组合,将一张原图扩展成稳定风格的写真套图,并同步生成数秒钟的高质量短视频。整个流程从输入、文案拆解、模型采样、批量输出到视频拼接完全自动化,让创作者在最少操作下完成成套商业可用素材。文章目录工作流介绍核心模型Node 节点工作流程大模型应用CLIPTextEncode 场景语义解析与风格控制使用方法应用场景开发与应用工作流介绍这个工作流围绕“图像到视频”和“场景延续写真”展开,以两组 UNet 和双路 KSampler 为核心,实现高低维度模型的互补生成。模型部分由 Wan 系列模型、SmoothMix I2V 高低版本、Wan 专用 VAE 与 CLIP 共同构成,通过 BlockSwap、Attention Patch 等节点完成风格巩固与跨帧一致性。节点部分涵盖 Prompt 解析、图像尺寸解析、批处理拆分、数学表达式生成时序索引、图像 Batch 合并、视频合成、结果展示等模块,让整个内容生产从输入到输出都保持清晰易控。整体结构以高低模型双路采样为骨架,配合剧情文本切片和场景 Prompt 自动化,保证每一张图与视频帧都能延续原始风格并保持叙事性。核心模型本工作流的核心模型体系以 Wan 生态为中心,通过高低 UNet 的双路结构让画面既能保持统一风格,又能在细节上做层级区分。高模型负责最终画面的细节密度与写实表现,低模型负责整体结构、姿态与过渡。再结合 WanVAE 与 Qwen Image VAE,分别承担 I2V 与图像重建的编码解码任务,让多场景写真保持稳定的肤质、光线与风格。CLIP 则作为文本入口,将分片后的 Prompt 转化为明确的条件信息,保证每一帧、每一张图都能沿着既定叙事向下生成。模型名称说明