Qwen-Image-2.1实战:人像生成、局部编辑与老照片修复全攻略
在写这篇内容之前先说一句大实话Qwen-Image-2.1 这个模型刚放出权重的时候我就没忍住连夜把它塞进了本地的 ComfyUI跑完第一张正脸图之后脑子里只有一个想法——国产开源模型里终于有人把“人像”这碗饭做到这么顺手的程度了。今天这篇帖不聊虚的围绕人像生成、发型表情编辑、老照片修复这三个最常被问到的场景把我在 Qwen-Image-2.1 上攒下来的提示词写法、工作流配置和踩坑记录一次性整理出来。同时会把整合包的获取思路、安装路径、目录结构讲清楚让第一次接触的人也能照着复现。无论你是刚下载模型试水的玩家还是想把人像工作流做成常规生产力的老手这篇都应该对你有用。1. 先搞清楚Qwen-Image-2.1 是什么强在哪儿很多人看到“Qwen-Image-2.1”第一反应是这跟之前那些开源文生图模型有什么区别是不是又一个刷榜选手我必须说一开始我也有这个怀疑但真正在本地跑起来之后认知是会被改写的。1.1 模型身份与核心能力拆解Qwen-Image-2.1 是通义系列推出的图像生成模型属于 Qwen 视觉生态的一部分。它跟传统 SD1.5、SDXL 系列最本质的区别体现在三个地方。第一是中文理解能力。用中文写提示词的效果不是“勉强能用”而是“确实好用”。我做过对比同一个画面描述用英文写进 SDXL 和用中文写进 Qwen-Image-2.1后者对“穿汉服的女孩站在古镇石桥上身后有水雾”这类描述理解得明显更精确构图也更贴近语义。原因不复杂——训练数据里中文语料占了足够大的比重模型的 tokenizer 对中文表达不像老一代模型那样“翻译腔”。第二是长文本描述支持。Qwen-Image-2.1 原生支持很长的提示词输入这意味着你可以把画面里多个元素都写进去比如“主体动作 服装材质 发型细节 光线方向 镜头焦段 背景环境 画幅比例”一口气说清楚。SD1.5 时代提示词超过七八十个词就开始失控这个模型扛得住更复杂的指令。第三是细粒度编辑能力。它不只是“文生图”厉害在图生图、局部编辑、身份保持这些方面也做了针对性优化。这篇文章要讲的人像发型编辑、表情调整、老照片修复全都是靠这个能力落地的。1.2 选它做人像场景的原因我身边不少人问既然有 SDXL 生态有 Flux有各种微调模型为什么还要折腾 Qwen-Image-2.1我的选择逻辑其实很务实。首先人像场景对“身份一致性”的要求特别高。以前用 SDXL 跑人像最痛苦的就是脸部特征不稳定同一个人的两张图放在一起像两个人。Qwen-Image-2.1 在脸部结构保持上做得相当到位尤其是正面脸、四分之三侧脸这些常见角度基本不会出现五官漂移。其次它特别适合做“可控的微调”。如果你只想把一张照片里人物的长发改成短发把微笑改成抿嘴或者把七八十年代的老照片照片修复出高清纹理这类细节任务如果走 SDXL 的 LoRA 路线要训练、要调权重步骤很长。而 Qwen-Image-2.1 通过提示词加参考图就能完成大部分操作门槛低了很多。还有个实际原因模型体积可控部署压力小。跟那些动辄几十 GB 还要吃大显存的闭源方案不同Qwen-Image-2.1 的开源权重配合 GGUF 量化版能在中端显卡上跑得比较舒服最低十几 GB 显存也能体验完整工作流。对普通玩家来说这决定了它能不能成为“常用工具”。2. 人像提示词写法从入门到能用的完整拆解人像提示词是这次整理的重头戏。很多人拿到模型后第一张图往往还算正常第二张就开始失控问题基本都出在提示词结构太乱、用词太随意、要素堆砌没有次序。这节我把自己的写法拆开给你一套可以直接套用的体系。2.1 提示词的基本构成单元我习惯把人像提示词拆成六个基本单元主体身份、面部细节、发型与表情、服装与道具、环境与背景、影像风格。以这张示例为基准一个二十岁出头的中国女孩黑色长发空气刘海鹅蛋脸皮肤白皙笑眼弯弯表情温柔穿浅蓝色棉麻连衣裙站在清晨的江南古镇石板桥上背景有水雾和灯笼早晨柔光35mm镜头浅景深胶片质感高细节8k每个单元都对应一项“指令”少一块画面就残缺。比如去掉“笑眼弯弯”脸部神态就会平庸去掉“清晨柔光”整体色调可能变得生硬。这里有一个关键心态中文提示词不是写作文是下指令。你要把需求说得像跟摄影师沟通一样清楚。很多人写“美女、漂亮、好看”模型确实会给你漂亮的脸但画面里没有细节没有记忆点因为你什么都没告诉它。2.2 可直接抄的通用人像模板下面这些模板是我这段时间用得最频繁的直接抄走就能出图。注意管住手不要强行加戏。通用写真人像A 青年女性中长发自然波浪卷皮肤质感真实五官立体淡妆白衬衫海边傍晚逆光剪影感发丝被风吹起35mmf/1.8电影感色调raw photohigh detail古典中国风人像中国古风女子乌黑发髻簪花柳叶眉丹凤眼朱唇微启穿红色齐胸襦裙手拿团扇站在竹林深处薄雾午后阳光穿透竹叶柔焦背景50mm中国画色彩唯美精致五官男性商务肖像三十岁中国男性短发面部轮廓清晰胡茬轻微穿深色西装白色衬衫不打领带神情沉稳灰色摄影棚背景左侧硬光右侧补光85mm质感皮肤商业肖像摄影这三个模板涵盖了最常见的三种人像类型你把细节换成自己需要的就行。我的经验是形容词数量控制在三到五个足够关键是把“具体对象”和“动作状态”写明而不是堆一堆虚词。2.3 发型与面部特征控制发型是人像生成里最容易翻车的地方。你写“长发”两个字模型可能给你来一个及腰大波浪也可能只给到肩膀。我总结的规律是发型提示词必须写清楚“长度、层次、刘海、卷直、颜色”五个维度。长发版过胸长发发尾微卷中分深棕色发丝根根分明头顶有轻微光泽短发版齐耳短发发尾内扣轻薄刘海深黑色头发蓬松耳侧头发别到耳后卷发版大波浪卷发长度到锁骨三七分刘海暖棕色卷度自然有几缕碎发飘在脸颊旁边至于面部特征尽量写“结构词”而不是“评价词”。比如“鹅蛋脸”是结构“好美”是评价“双眼皮”是结构“有神”是评价。模型更擅长理解结构词然后把它转化成画面。想控年龄就写“看起来二十五岁”想控气质就写“嘴角带着慵懒的笑意”少写“很好看、很高级”这种情绪化描述——除非你完全不在乎结果。2.4 镜头、光效与氛围层的加分写法人像图好不好看除了主体描述镜头和光影占了非常大的比重。同样的脸手机自拍式光效和电影布光式光效成片质感完全不同。镜头参数建议直接写焦段和光圈35mm 适合环境人像有透视感背景融入度高。85mm 适合半身肖像背景压缩感强景深好看。135mm 适合特写脸部压缩自然五官比例最稳。光效描述我常用的关键词有柔光、伦勃朗光、蝴蝶光、逆光、轮廓光、窗户自然光、霓虹光、阴天漫射光。氛围词要跟场景匹配不要出现矛盾描述比如“阳光明媚”和“阴冷忧郁”就别同时写。有一段描述值得记录85mm镜头f/1.4柔和窗光从左前方照射右脸微暗发丝边缘有金色轮廓光浅景深背景虚化成暖色光斑室内安静氛围这一段里镜头决定了构图光效决定了立体感氛围决定了情绪。人像提示词写到这个颗粒度基本就不会出“木头人”效果。3. 发型表情编辑实战局部改动不破坏身份感如果只能保留 Qwen-Image-2.1 的一个优势我会选“局部编辑”能力。传统工作流想只改发型不换脸往往要抠图、重生成或者折腾各种 ControlNet 玩法现在用提示词加参考图就能做到七八成效果下面展开聊聊。3.1 编辑型提示词的组合公式局部编辑的本质是“保持大部分信息不动只改变目标属性”。实际操作中我把它拆成三个部分不变量描述、目标变量描述、负面签证声明。不变量描述要承接原图身份特征比如“同一个女孩五官不变皮肤纹理不变”目标变量则是你真正要改的地方比如“把黑色长发改成银白色短发刘海位置保持”负面签证声明防止模型顺手改了别的比如“不要改变脸型不要改变服装不要改变背景”。示例原图为一名年轻女性长黑发圆脸穿灰色帽衫。请保留她的五官、脸型、服装和角度只把发型改为银白色齐耳短发微卷发尾外翘保留空气刘海背景不变这种写法的好处是让模型明确知道“什么不能动”。实际跑图时我会把它作为正向提示词输入再配合图生图低重绘幅度。重绘幅度这里要说清楚太高会让整张图重造身份丢失太低会连目标改动也不生效。我的经验值在 0.35 到 0.5 之间跟底图分辨率也有关系后面有具体参数表。3.2 表情与情绪控制表情编辑最容易犯的错误是只写“笑”一个词。不同笑法差别非常大而且写得太粗的时候模型容易用力过猛直接给你画出一个僵硬咧嘴脸。我一般会把“表情类型 强度 微表情辅助”三层都写出来。比如克制微笑嘴角微微上扬不露齿眼睛微弯眼神温和带笑意整体表情放松自然肌肉不紧绷如果换成带有情绪强度的状态就把微表情词换成“眉头轻蹙”“嘴唇紧抿”之类配合眼神词给模型做牵引。比较适合新手的是在指令里面加“自然”“不做作”“松弛”这类控强度词能有效防止表情过度。还有一个小贴士人物头部的角度也要在编辑时声明。比如“侧脸角度保持与下图一致”可以防止模型在改表情的同时把整个脸的方向都改了这是身份感保持的关键一步。3.3 编辑操作中容易踩的坑局部编辑看着美好实际很吃细节。第一个常见坑是发型越改越乱根源在于“不变量”写太短。只有一个“同一人”是拉不住模型的必须把脸型、眼睛、嘴角这些骨架特征写清楚模型才有锚点。第二个坑是眼神方向被无意改动。我改发型时踩过一次输出图面部整体还在但两只眼睛的视线从镜头转到了旁边整个画面气质就变了。后来我在提示词里加了一句“视线方向保持不变眼睛看向镜头”问题就解决了。第三个坑是背景的过渡处理。Qwen-Image-2.1 在编辑时如果重绘幅度偏大背景容易生成出一些莫名其妙的杂物这时候除了降低重绘幅度还可以在负面提示词里写“背景不要改变不要增加新物体”。如果你愿意再费一点功夫把人物主体先用分割模型抠出来再编辑效果会更好只是步骤多了一些。4. 老照片修复本地工作流与整合包实操人像生成和编辑是面子老照片修复是我觉得 Qwen-Image-2.1 真正能用出“人文价值”的场景。一张泛黄、模糊、布满划痕的家族老照片修好之后给家里长辈看那种感觉不是追新技术的人能体会的。这节把从拿到模型到完成修复的全过程拆开。4.1 老照片修复的原理和修复路线老照片修复通常分三个处理维度画质修复、色彩还原、清晰度提升。传统方案要动用一堆专用模型比如去划痕、去噪点、上色、超分每个环节一个工具流程繁琐。Qwen-Image-2.1 的思路不太一样——它用图像生成模型的理解力直接补全受损区域和重建细节。它见过海量的人脸照片知道眼睛周围应该有哪些纹路衣服褶皱应该是什么走向。你给它一张破损的输入图它能结合提示词把它“重画”得更完整。但要清楚这个重画不是简单锐化而是“理解性修复”等于让模型用人脸先验知识填补缺失信息。我推荐的工作流是先去噪和去划痕再做脸部细节重建最后放大输出。一句话总结很好的模特也需要化完妆再上镜。4.2 从整合包到第一步出图新手最友好的路径是直接找人打包好的 ComfyUI 整合包省去手动装依赖的麻烦。搜索“Qwen-Image-2.1 ComfyUI 整合包”一般能找到社区维护的现成包。下载整合包时我的建议是尽量找更新时间离现在比较近的版本模型社区迭代快老整合包容易缺组件。下载前注意看整合包的目录说明确认包含 Qwen-Image-2.1 的模型权重文件和 ComfyUI 工作流文件。解压后不要直接双击运行先看一下目录结构确认没有混入奇怪脚本。安全上的谨慎不能省。整合包目录里一般会有这些关键路径我列一个对照ComfyUI/models/checkpoints/ # 放置主模型文件 ComfyUI/models/vae/ # 放置 VAE 文件老照片修复建议选修复向的 VAE ComfyUI/models/loras/ # LoRA 文件可选 ComfyUI/user/default/workflows/ # 工作流 JSON 文件把模型文件放到对应位置后启动 ComfyUI在浏览器打开工作流页面加载工作流 JSON再上传老照片点运行就能看到输出。第一次跑图建议先用默认参数确认流程通了再开始调参。4.3 推荐的修复工作流与参数建议修复老照片时我习惯在自己的工作流里挂两个核心模块第一个是图像放大模块第二个是细节修复模块。放大通常用 ESRGAN 系列模型修复细节用 Qwen-Image-2.1 的图生图能力。这样分工明确放大模型负责把像素增多Qwen-Image-2.1 负责把纹理画真实。实际操作时我会先在 Qwen-Image-2.1 工作流里跑一遍修复输出后挂进放大模块做 2 倍到 4 倍超分。如果照片同时有大量划痕和噪点可以在修复之前先经过一个轻量的去噪步骤。还有要注意的是老照片修复最好分“两步对话式”进行大致是第一步去除表面破损文件去除照片上的划痕、折痕、污渍、噪点保持人物五官和服装结构不变画质自然第二步恢复细节和清晰度修复老照片人物面部纹理清晰眼睛有神头发丝细节还原衣物褶皱自然肤色真实曝光均匀高清画质参数建议我直接给一份参数名称建议值说明重绘幅度 denoise0.3 ~ 0.45太低修不动太高会改变原图身份采样步数 steps30 ~ 40修复任务不建议低于 30采样器DPM 2M Karras稳定细节均衡CFG 强度6 ~ 7.5太高会让画面偏“塑料”输出分辨率1024 起放大到 2048太小丢细节太大容易出人工痕迹我实测下来0.35 的重绘幅度配合 35 步采样是大多数老照片的甜点区。如果照片本身清晰度太差可以先放大再修复顺序反过来的话修复模型不容易捕捉到足够的面部特征点。需要特别提醒的是别指望它凭空修复一张完全糊掉的脸。如果原始照片里五官已经模糊成色块模型只能“猜”一张脸出来那就不叫修复叫换脸了。老照片修复的边界是——原图至少保留足够的面部轮廓信息修复过程才有意义。5. 常见问题与排查技巧实录跑模型一个月群里问得最多的几种问题基本可以汇总成一张速查表。我把自己真实遇到过以及排查出来的解法放在这里供你直接索引。问题表现可能原因排查步骤与解决思路生成出来是黑图/灰图VAE 配置错误检查工作流中是否加载了正确的 VAE换一个官方匹配的 VAE 再跑显存不足、中途崩溃分辨率设置太高或模型非量化版降低初始分辨率到 512 或 576换 GGUF 量化版模型开启 xformers 优化人脸五官漂移/左右不对称重绘幅度过高或提示词缺少面部约束降低 denoise把“五官结构保持”作为硬性提示词写进去输出颜色奇怪、偏色严重老照片色彩映射阶段未约束提示词增加“自然肤色”“色彩真实准确”的描述发型编辑不生效重绘幅度太低或“变量”描述不够突出把目标发型描述写得更具体把 denoise 从 0.3 提到 0.45修改发型后衣服变样不变量描述缺失在提示词中明确“服装保持不变颜色、版型不变”照片修复得像“塑料画”CFG 太高或放大模型过于激进CFG 降回 6 左右放大选择更轻柔的模型档位文字乱码出现在画面上模型被迫生成文字在负面提示词中写“不要出现文字、水印、字幕”表格之外还有三个我自己总结的独家小技巧分享给看到这里的朋友。第一个技巧是“两步像”的修复节奏。一开始我以为老照片修复是全自动一步完成后来发现先做去破损、再做细节重建效果远好于一次性完成。这跟化妆很像先打底再上色步骤拆开后面部细节更稳。第二个技巧是尽量使用原始比例不要让模型重新构图。老照片的边框、构图是历史的一部分在提示词里加一句“保持原始构图”模型才不容易自行裁剪。第三个技巧是我会习惯保留少量胶片噪点很多修复模型会把所有颗粒都磨平结果照片立刻失掉年代感。我在修复时会在提示词里写“保留自然胶片颗粒”输出照片既清晰又有质感。另外一个容易被忽略的点老照片如果是彩色转黑白再褪色的修复时不要过度饱和度管用。用 Qwen-Image-2.1 上色时提示词里写“低饱和复古色调颜色自然褪色感”往往比写“鲜艳明亮”更有老照片味道因为年代滤镜本身就是颜色不完整的。最后再放一句我从实战里提炼的话Qwen-Image-2.1 的真正强项不在于它能生成一张多么惊艳的脸而在于你把一张残缺的、模糊的、旧得不像样的人像丢给它它有能力理解你想表达的那个人然后把细节一点点找回来。模型在更新提示词也在长进但工具的地位终究是由使用它的人决定的。把这套工作流跑熟之后你自然会发现它不过是个起点——后面接 ControlNet 做更精细的姿态控制、串 LoRA 做专属人脸风格每一步都有更大的操作空间。