day20- Comfyui文生图原理解析和实操
张晓波 bobo老师
AIGC环节:comfyui生图和生视频,codex&skill,路小飞数字人
comfyui简介
ComfyUI 是一款专为 Stable Diffusion 打造的开源可视化操作工具。它用「节点化工作流」的方式,让你拖一拖、连一连,就能轻松生成高质量的 AI 图像和视频。并且它还有如下特点:
- 永久免费、可商用:不用花一分钱,就能使用最前沿的生图/制视频功能。
- 可玩性和可控性超强:相比 DeepSeek、Midjourney,ComfyUI 拥有最细致的参数调节,想要的效果一目了然。
- 节点工作流可复用、可分享:大佬们的模板随手拿来,零基础的小白也能瞬间出图。
- 开源生态无限扩展:插件一装就能玩出各种花样。
进阶介绍
- comfyui可视化操作工具功能和性能很强
- 可以进行模型本地部署,可以不必担心taken的消耗,只需要考虑算力的成本。
- comfyui也支持进行线上模型调用
- comfyui是可以对模型进行参数调优(底层)
- comfyui可以使用很多不同的优化器进行模型性能和效果优化
本地安装
电脑配置
| 用户类型 | 推荐配置 |
|---|---|
| 入门尝鲜(只玩图) | RTX 3060 12GB 显存 + 32GB 内存 + 1TB 固态硬盘 |
| 进阶创作(图+短视频) | RTX 4070 Ti / 4080(16GB 显存)+ 32GB 内存 + 2TB 固态硬盘 |
| 商业/批量生产 | RTX 4090(24GB 显存)+ 64GB 内存 + 2TB NVMe 固态硬盘 + 备份硬盘 |
安装git:
由于comfyui在安装过程中有些依赖环境是基于git进行下载的,因此需要事先进行git环境安装。
-
软件下载
-
安装git for Windows
- 一路下一步使用默认选项即可
安装comfyui
官网:https://www.comfy.org/zh-cn/
选择合适的操作系统进行安装包下载:
安装:注意安装路径不能有中文和特殊符号,并且最好不要安装在C盘



运行comfyui
尽量打开代理,进行comfyui的运行,因为会进行相关依赖文件下载。
云端安装
云服务器本质上就是一个远程的centos。
Cloud Studio简介
Cloud Studio(云端 IDE,官方链接: https://cloudstudio.net/?page=home )是腾讯云提供的一款基于浏览器的集成式开发环境(IDE),支持无需本地安装即可通过浏览器在线编程。它提供高性能的工作空间机制,预置多种主流开发环境(如 Java、Python、Node.js 等),并集成 GPU 算力、AI 代码助手、实时协作及云原生部署能力。
登录成功后,可以进行实名认证,然后每日签到,可以获取平台赠送的"机时”。
Cloud Studio创建应用
创建一个干净的系统环境,这里选择开发场景下的Linux环境:
删除无用文件:
设置布局和算力类型:


新建一个终端:
升级下现有系统:apt update

安装环境:pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
升级下pip:pip install --upgrade pip
安装comfy-cli命令行工具:pip install comfy-cli和comfy --here install
安装ComfyUI-Manager:
cd ComfyUI
cd custom_nodes
git clone https://github.com/ltdrdata/ComfyUI-Manager comfyui-manager
cd comfyui-manager
pip install -r requirements.txt
运行comfyui(新建一个终端):
cd ComfyUI
python main.py --listen 0.0.0.0 --port 8188 #自定义端口
或者:comfy launch
查看端口,然后在浏览器启动comfyui:如果google浏览器打开comfyui出现问题可以更换其他浏览器

comfyui文生图原理+实操
1.comfyui的文生图架构
comfyui的文生图架构如图所示:
条件空间:文本等条件输入,告诉comfyui我们需要什么内容
潜空间:图片进行迭代(逐步)去噪的过程。该空间是用来生产符合条件空间要求的图片。
像素空间:将去噪结果还原为图片。也就是将潜空间去噪后的图片还原为我们可见的图片。
其中潜空间部分相对比较难理解,接下来通过下图深入理解潜空间工作原理:
首先随机初始化一张无意义的噪点图,然后可以提出一个生图的条件,潜空间会根据【条件空间】中的每一个条件逐步对噪点图进行迭代去噪。每一步迭代去噪我们会发现生成的图像就越来越具象和清晰了。
经过潜空间的迭代去噪,最终需要通过像素空间将降噪后的结果还原为可识别的图像。
在comfyui中对应的条件空间、潜空间和像素空间对应的节点如下:

| 模块/阶段 | 功能与原理说明 | 对应节点/组件 |
|---|---|---|
| 1. 条件空间处理 | ||
| 文本编码 | 通过CLIP 文本编码器将文本提示词转化为语义向量(将人类语言转换为AI能理解的“数学语言”),建立文本与图像的关联性。 正向提示词:告诉AI“要画什么” 负向提示词:告诉AI“不要画什么” |
CLIP 文本编码器(正向/负向) |
| 大模型加载 | 加载相关模型 | Checkpoint加载器 |
| 2. 潜空间生成 | ||
| 噪声初始化 | 生成指定尺寸的随机高斯噪声矩阵,作为生图的起点。 简单理解:创建一张“完全随机”的初始画布 |
空Latent |
| 迭代降噪(核心) | 通过扩散模型(UNet)结合文本条件在潜空间逐步去除噪声。 扩散模型原理: 前向过程(训练时):给清晰图片逐步加噪声,直到完全随机 反向过程(生成时):从随机噪声开始,逐步“猜测并移除”噪声 |
K采样器 |
| 3. 像素空间转换 | ||
| 潜空间解码 | 将降噪后的潜空间特征矩阵还原为高清像素图像 | VAE 解码 |
| 图像输出 | 保存或预览最终生成的图像 | 保存图像 |
2.文生图实操
-
添加【条件空间】相关节点
- Checkpoint加载器
- CLIP 文本编码器
-
选择模型:

-
添加【潜空间】相关节点
- K采样器
- 空Latent

-
添加【像素空间】相关节点
- VAE 解码
- 图像保存

最后注意,将所有连线串联完整!
3.模型相关
文生图大模型综合对比表

3.1常用大模型
-
写实模型:
- realisticVisionV51
-
3d大模型:
- dreamshaper_8
-
卡通大模型:
- meinamix
- GhostMix鬼混_V2.0
下载链接: https://pan.baidu.com/s/19Len6XHX4L15MApaJq8Y2A?pwd=j9kz 提取码: j9kz
下载好的模型文件存放目录:ComfyUI/model/checkpoints
4.深度进阶
4.1 Checkpoint 节点深度介绍
Checkpoint节点是 ComfyUI 为新手友好设计的整合式模型加载器,其本质是把UNet加载器+加载CLIP+加载VAE三个节点的功能合并,通过读取一个整合权重文件,自动拆分并加载 UNet(图像生成核心)、CLIP(文本编码)、VAE(Latent 解码)的权重,无需用户手动分拆配置,大幅降低操作门槛。
4.2 UNet 加载器 + 加载 CLIP + 加载 VAE 的功能与理解
这三个节点是 ComfyUI 中进阶版的模型组件分拆加载模块,对应文生图模型的三大核心部件,把Checkpoint加载器(简易)的整合功能拆分成独立节点,实现对每个组件的精细化配置,可理解为 “把一台整机拆成 CPU、显卡、内存,分别调试升级”。
一、UNet 加载器
-
核心功能
- 加载调用文生图模型,负责在潜在空间(Latent)中根据 CLIP 传递的文本特征,对空白 Latent 进行迭代优化,逐步生成包含图像细节的特征张量。
-
通俗理解
- 相当于绘画时的 “主笔画师”,根据文案要求(CLIP 的文本特征),在画布(空 Latent)上勾勒出图像的核心轮廓与细节,决定图像生成的主体逻辑。
二、加载 CLIP
-
核心功能
- 加载调用CLIP 编码器模型,将自然语言的提示词(正 / 负)转化为模型能识别的向量特征(CLIP 条件),传递给 UNet 作为图像生成的 “文本指导依据”。
-
通俗理解
- 相当于绘画时的 “翻译官”,把用户的文字描述(如 “赛博朋克少女”)翻译成画师(UNet)能看懂的 “绘画指令”,确保生成内容与文本匹配。
三、加载 VAE
-
核心功能
- 加载调用VAE模型,主要负责两个核心操作:
- 编码:将现实图像转化为 Latent 特征张量(图生图场景用);
- 解码:将 UNet 生成的 Latent 特征张量转化为肉眼可见的 RGB 像素图像(文生图核心用解码功能)。
- 加载调用VAE模型,主要负责两个核心操作:
-
通俗理解
- 相当于绘画时的 “显影师”,把画师(UNet)画在特殊画布(Latent)上的草稿,转化为能直接观看的成品画作(像素图像);同时也能把现实照片转成草稿供画师参考。
4.3 分拆加载的核心价值
Checkpoint 模型 = 一台装好的整机电脑
插电就能用 → 一键加载
分拆模型 = 单独买的 CPU、显卡、主板
必须自己组装 → UNet+CLIP+VAE 分别接
- 组件替换灵活:可混搭不同的 UNet、CLIP、VAE 权重,实现定制化的生成效果;
- 参数精细化调控:为每个组件单独配置数据类型、设备(CPU/GPU)等参数,适配不同硬件环境;
- 适配特殊模型:针对 qwen等 这类组件分离的模型,必须通过分拆加载才能正常运行。
4.4 模型选择
HuggingFace 下载模型时,如何一眼判断用 Checkpoint 加载 还是 UNet/CLIP/VAE 分拆加载?
看文件 → 看后缀 → 看数量
-
一个文件 = Checkpoint 加载器(简易)
- 模型文件只有 1 个主文件
- 文件名结尾是
.ckpt.safetensors
-
多个文件(unet/clip/vae 分开) = 分拆加载(UNet+CLIP+VAE)
- 模型文件夹里 有好几个文件
- 文件名明确出现关键词:
unetclipvae
- 文件是分开的,比如:
model_unet.safetensorsmodel_clip.safetensorsmodel_vae.safetensors
4.5 工作流搭建
模型下载:https://pan.baidu.com/s/1Fx1pDr9ZTKJeC0GITnxF3Q?pwd=5zmj 提取码: 5zmj

qwen基础工作流.json

Unet加载器不同数据类型含义:

这些是FP8(8 位浮点)的不同存储格式,属于低精度数据类型,用于在 ComfyUI 中优化模型推理的显存占用和速度,不同格式的核心差异在指数位、尾数位的分配以及推理效率 / 精度的取舍,以下是具体解析:
| 数据类型 | 核心含义 | 适用场景 |
|---|---|---|
fp8_e4m3fn |
FP8 的标准格式:4 位指数位 + 3 位尾数位,fn表示 “非规范化数(denorm)” 支持,是 FP8 最基础、兼容性最好的格式。 |
多数消费级显卡(如 RTX 30/40 系),平衡精度与速度。 |
fp8_e4m3fn_fast |
在fp8_e4m3fn基础上做了硬件加速优化,推理速度更快,但部分老显卡可能不支持。 |
高端显卡(如 RTX 4090/50 系、A 卡 RX 7000 系),追求极致生成速度。 |
fp8_e5m2 |
FP8 的另一种格式:5 位指数位 + 2 位尾数位,指数位更多,能表示更大 / 更小的数值范围,但尾数位更少,精度略低于e4m3fn。 |
大模型(如 qwen)的低精度推理,显存受限的设备(如笔记本显卡)。 |
核心总结
- 精度排序:
fp8_e4m3fn≈fp8_e4m3fn_fast>fp8_e5m2; - 速度排序:
fp8_e4m3fn_fast>fp8_e5m2>fp8_e4m3fn; - 显存占用:三者均比 FP16/FP32 大幅降低,
fp8_e5m2显存占用略低。
实际使用中,优先选fp8_e4m3fn(兼容性最好),高端显卡选fp8_e4m3fn_fast,显存紧张或运行大模型时选fp8_e5m2即可。
5.提示词编写技巧
一份清晰、结构化的提示词,能够更好地引导 AI 生成我们想要的画面。这里为大家推荐一个高效且易于上手的提示词编写模板。
一、核心公式:三位一体结构
我们可以将提示词想象成向一位画家描述作品要求,一个高效的公式是:
质量词 + 内容描述 + 艺术风格
这三个部分依次决定了画面的 “精细度”、“是什么” 和 “像什么”。
1. 质量词
这部分用于设定画面的基础质量和细节水平,通常放在提示词的最开头。
- 常用词示例:
masterpiece(杰作)、highly detailed(高度细节)、Best quality(最佳质量) - 作用:相当于对 AI 说:“请用心画,画得精致一些。”
2. 内容描述
这是提示词的核心,用于描绘画面的具体内容。推荐采用 “谁 + 在哪里 + 做什么” 的结构进行组织,这样逻辑清晰,不易遗漏。
- 谁:主体是什么?例如:
1girl(一个女孩)、an astronaut(一位宇航员)、a cute cat(一只可爱的猫)。 - 在哪里:场景或背景是什么?例如:
in a coffee shop(在咖啡馆)、on the moon(在月球上)、in a magical forest(在魔法森林中)。 - 做什么:主体在发生什么动作或呈现什么状态?例如:
smiling(微笑)、reading a book(看书)、flying a kite(放风筝)。 - 细节补充:可以进一步描述外貌、服饰、表情、光线等,如
black curly hair, long hair, Big eyes, blue Shoulder skirt, Earrings(黑色卷发、长发、大眼睛、蓝色露肩裙、耳环)。
3. 艺术风格
这部分决定了画面的最终表现手法和审美基调。
- 写实风格:追求像照片一样真实。关键词:
photorealistic(照片般真实)、realistic(写实的)。 - 3D 渲染风格:像三维软件制作的 CG 图像。关键词:
3d rendering(3D 渲染)、CGI(电脑生成图像)。 - 卡通/动画风格:具有手绘或动画质感。关键词:
Cartoon(卡通)、Studio Ghibli(吉卜力工作室风格)、anime(动漫)。
二、参考案例与实操解析
假设我们想生成一张 “一位女孩在咖啡馆喝咖啡” 的精致写实图片。
-
大模型选择:为了实现写实效果,我们可以选择擅长此类风格的模型,例如
realistic或ghostmix等。 -
正面提示词:这是我们希望画面中出现的内容。
- text
masterpiece, highly detailed, Best quality, 1girl, black curly hair, long hair, Big eyes, blue Shoulder skirt, Earrings, smiling, Coffee shop, have coffee, photorealistic- 结构分解:
- 质量词:
masterpiece, highly detailed, Best quality - 内容:
1girl(谁),black curly hair... Earrings(外貌细节),Coffee shop(在哪里),smiling, have coffee(做什么) - 风格:
photorealistic(写实风格)
- 质量词:
-
负面提示词:这是我们不希望画面中出现的内容,用于避免常见错误或瑕疵。
- text
nsfw, text, watermark- 含义解释:
nsfw:排除不适宜公开的内容。text:避免图片中出现无意义的文字符号。watermark:避免出现类似水印的痕迹。
演示示例1:
这个示例营造一个充满幻想、色彩明媚的动画电影场景。
-
正面提示词:
text
Studio Ghibli style, masterpiece, beautiful and detailed, vibrant colors, a young explorer with a backpack and a straw hat, standing in a sun-dappled enchanted forest, giant glowing mushrooms and friendly forest spirits, looking up in awe, magical atmosphere, Miyazaki Hayao- 结构解析:
- 质量词:
masterpiece, beautiful and detailed - 内容:
a young explorer with a backpack and a straw hat(谁),standing in a sun-dappled enchanted forest, giant glowing mushrooms...(在哪里),looking up in awe(做什么),magical atmosphere(氛围) - 风格:
Studio Ghibli style, vibrant colors, Miyazaki Hayao(非常明确的风格指引)
- 质量词:
- 结构解析:
-
负面提示词:
text
realistic, photorealistic, photo, dark, scary, horror, ugly, deformed, nsfw, text
演示示例2:
这个示例侧重于宏大的场景构建与特定的数字艺术风格。
-
正面提示词:
text
epic scale, concept art, digital painting, intricate details, a massive floating mechanical city overgrown with luminous plants, towering spires and flying vehicles, golden hour sunlight piercing through clouds, volumetric fog, by artists like Syd Mead and Moebius- 结构解析:
- 质量词:
epic scale, concept art, intricate details(这里用“概念艺术”和“史诗规模”来定义一种高质量标准) - 内容:
a massive floating mechanical city(场景主体),overgrown with luminous plants, towering spires and flying vehicles(场景细节),golden hour sunlight, volumetric fog(光影氛围) - 风格:
digital painting(风格媒介),by artists like...(通过参考艺术家来锁定特定审美风格)
- 质量词:
- 结构解析:
-
负面提示词:
text
low resolution, pixelated, blurry, simple background, empty, cartoon, real photo, photograph, human, person, face
6.k采样器参数
| 参数类别 | 参数名称 | 说明 | 推荐值范围 | 作用效果与原理 | 实用示例 |
|---|---|---|---|---|---|
| 基础控制 | 随机种(Seed) | 生成过程的“身份ID” | 任意整数(如12345) |
本质是潜在空间中初始噪点图的坐标。相同种子+相同参数=几乎相同的输出,保证可复现性。是创作中微调的起点。 | 找到一张喜欢的图,记录其种子,可在此基础上仅修改提示词进行系列创作。 |
| 生成后控制 | 种子的行为模式 | 递增/递减/固定/随机 | 固定:保持当前种子不变;随机:每次生成全新种子。 |
批量生成不同创意时选“随机”;优化单张作品时选“固定”。 | |
| 质量与时间 | 步数(Steps) | 画师的“思考时间” | 见右侧详解 | 去噪迭代次数。每一步都是对图像的一次“思考与修正”。 | 草图(5-15步):快速构思,适合分镜。 动漫/卡通(20-30步):风格化强,细节需求适中。 超写实/复杂场景(25-40步):需要更多步数打磨材质、光影等微观细节。 |
| 创意控制 | CFG(提示词引导系数) | 画师的“听话程度” | 见右侧详解 | 控制生成结果与你的提示词之间的紧密度。 | 创意发散(3-6):AI有更大自由发挥空间,色彩、构图可能更“艺术”,但可能偏离提示。 平衡可控(7-9):最常用范围,良好遵循提示的同时保持自然。 过度引导(>10):易产生“过度锐化”、“塑料感”、颜色饱和度过高或肢体扭曲。 |
| 算法核心 | 采样器(Sampler) | 画师的“作画策略” | 见右侧详解 | 决定了从纯噪声到清晰图像的“行走路径”。不同算法在速度、稳定性和风格倾向上有差异。 | 全能优选 dpmpp_2m:速度与质量平衡好,通用性强。 快速草图 euler/euler a:单步快,适合快速测试想法(euler a 是随机变体,更有趣)。 高质写实 dpmpp_sde:带随机微分方程,常能产出更丰富的细节和更“绘画感”的结果,但更慢。 |
| 调度器(Scheduler) | 作画的“节奏大师” | 见右侧详解 | 控制每一步噪声去除的“力度”变化曲线。影响收敛速度和最终纹理。 | 细节增强 karras:中后期步长变化,强调后期精细调整,常增加对比和细节。 平滑稳定 normal:线性或简单调度,产出更柔和、有时更“平均”的结果。 快速收敛 exponential:前期去噪猛,适合步数少时快速成型,但可能损失一些微妙过渡。 |
|
| 高级合成 | 降噪(Denoise) | 新旧画面的“融合比” | 0.0 - 1.0 |
在图生图(Latent)流程中,控制在初始图上应用新生成过程的比例。 | 完整重绘(1.0):从初始潜变量完全重新生成。 风格融合(0.5-0.8):保留原图大致构图和色彩,注入新风格或内容。 微调优化(0.2-0.4):仅做轻微色调、细节调整。 抽象叠加(<0.3):产生类似双重曝光的多层抽象效果。 |
步数测试:
- 推荐参数:
- 卡通20,写实30

cfg测试
- 推荐参数:
- 7左右

步数(Steps) vs. 采样器(Sampler)
- 误区纠正:“步数越高=质量越好”不完全正确。每个采样器都有其“收益饱和点”。
- 示例对比:
- 使用
euler采样器,可能15步后细节就不再显著提升,而30步只是浪费时间。 - 使用
dpmpp_2m采样器,可能在25步达到最佳平衡,40步能挖掘出更微妙的纹理。
- 使用
- 行动建议:为你的常用采样器做阶梯测试(如5, 15, 25, 35步),找到其“性价比”最高的步数区间。
cfg与采样器的化学反应
- 关键洞察:cfg的效果强烈依赖采样器。
- 对于
euler这类简单采样器,CFG>9就极易崩坏。 - 对于
dpmpp_sde这类复杂采样器,CFG在7-11之间可能仍能保持稳定,并产出高动态范围的作品。
- 对于
- 测试任务:固定一个复杂人像提示词,用
dpmpp_2m测试CFG=7, 9, 12。观察面部细节、瞳孔高光和发丝锐利度的变化。
调度器:改变图像的“质感”
让我们通过一个具体场景来理解:
- 提示词:
A weathered ancient stone statue, moss covering, morning mist, forest - 测试组合:
dpmpp_2m+karras:雕像表面会显得更粗糙、更戏剧化,苔藓细节分明,像一张高清摄影。dpmpp_2m+normal:雕像可能更光滑、整体更统一,雾气更柔和,像一幅古典油画。
- 原理:
karras调度在最后几步使用极小的步长,相当于画师在收尾时用了更细的笔刷进行“精雕细琢”。
推荐组合配置模板
| 创作目标 | 采样器 | 步数 | CFG | 调度器 | 说明 |
|---|---|---|---|---|---|
| 快速创意探索 | euler a |
12-18 | 7-8 | normal |
快速试错,捕捉灵感,不拘泥于细节。 |
| 高质量动漫/角色 | dpmpp_2m |
25-30 | 7.5-8.5 | karras |
平衡速度与角色细节、线条清晰度。 |
| 超写实照片/场景 | dpmpp_sde |
30-35 | 8-9.5 | karras |
最大化材质、光影和复杂场景的细节深度。 |
| 艺术感绘画/概念 | dpmpp_2m |
28-35 | 6-7.5 | normal |
给予AI更多创作自由,获得更“绘画性”而非“照片性”的结果。 |
| 图生图风格融合 | dpmpp_2m |
20-25 | 7-8 | normal |
降噪设置在0.5-0.75,平衡原图信息与新指令。 |
最终建议:理解参数最好的方式就是控制变量法测试。创建一个你最喜欢的提示词,然后每次只改变一个参数(如固定其他,只从CFG=7调到CFG=12),像做科学实验一样观察其带来的视觉变化,你将成为真正驾驭AI的画师。
角色
你是一名精通 ComfyUI 的中文智能助手,同时具备以下身份:
- ComfyUI 入门老师;
- ComfyUI 工作流设计师;
- AI 图像与视频生成顾问;
- ComfyUI 安装部署与故障排查工程师;
- ComfyUI 自定义节点和模型管理助手。
你的任务是帮助用户学习、理解和使用 ComfyUI,解决其在安装部署、模型配置、节点连接、工作流设计、图片生成、视频生成、角色一致性、报错排查和性能优化等方面的问题。
用户可能并不熟悉编程,因此回答时应尽量使用通俗易懂的中文,不能只给结论,还要告诉用户具体应该在哪里点击、如何操作以及如何验证操作是否成功。
核心原则
- 永远使用中文回答。
- ComfyUI 节点名称、模型名称、文件夹名称、参数名称和报错信息保留英文原文,并在必要时补充中文解释。
- 优先解决用户当前的问题,不要擅自扩展或修改用户的目标。
- 如果用户的问题已经明确,直接回答,不要重复询问已经提供的信息。
- 只有缺少的信息会实质影响解决方案时,才向用户提问。
- 不得虚构节点名称、模型名称、下载地址、工作流参数或报错原因。
- 如果不能确定答案,应明确说明需要核验,不要凭经验编造。
- 给出的操作步骤必须尽量适合用户当前的操作系统、显卡和 ComfyUI 安装方式。
- 涉及命令行操作时,必须说明命令应该在哪个目录、哪个终端或哪个 Python 环境中执行。
- 用户上传截图、报错日志或工作流文件时,应优先分析用户提供的实际内容。
技能
技能1:解答 ComfyUI 基础问题
当用户询问 ComfyUI 概念、节点或使用方法时:
- 先用通俗语言解释它是什么、解决什么问题。
- 再说明它在整个工作流中的位置和作用。
- 给出具体的节点连接关系。
- 解释重要参数及其影响。
- 最后给出适合初学者的推荐参数。
回答节点连接关系时,优先使用以下格式:
节点A:输出端口
→
节点B:输入端口
例如:
Load Checkpoint:MODEL
→
KSampler:model
如果涉及多个节点,应按照工作流的实际执行顺序进行说明。
技能2:设计 ComfyUI 工作流
用户提出图片、视频、换脸、角色一致性、局部重绘、高清放大或其他生成需求时,先分析任务目标,再设计合适的工作流。
工作流方案至少应说明:
- 使用什么基础模型;
- 是否需要 VAE、CLIP、LoRA、ControlNet、IPAdapter 等组件;
- 需要哪些核心节点;
- 是否涉及第三方自定义节点;
- 节点之间如何连接;
- 关键参数如何设置;
- 模型文件分别放在哪个目录;
- 用户需要准备哪些图片、视频、音频或其他素材;
- 预计的显存压力和可行的降显存方案。
如果存在多种实现方式,应按照以下方式进行比较:
| 方案 | 优点 | 缺点 | 适用情况 |
|---|---|---|---|
比较后应给出明确的推荐方案和推荐理由。
技能3:分析和修改工作流
当用户上传 ComfyUI 工作流 JSON、带有工作流信息的 PNG 图片或工作流截图时:
- 识别工作流的整体用途;
- 按执行顺序梳理主要节点;
- 说明每组节点的作用;
- 检查缺失模型、缺失节点和无效连接;
- 检查尺寸、批次、采样、显存和模型兼容性;
- 找出可能影响生成效果或导致报错的位置;
- 提出尽量少改动的优化方案;
- 修改后说明具体改了哪些节点和参数。
如果用户只上传截图,应基于截图中能够确认的内容进行分析。看不清的信息必须说明,不能自行猜测。
如果用户要求生成或修改工作流 JSON:
- 只有在节点名称、节点类型、输入输出结构和版本信息能够确认时,才生成完整 JSON;
- 如果不能确认第三方节点的数据结构,应先让用户提供原始工作流 JSON;
- 不得生成看似完整但无法导入或无法运行的虚假工作流;
- 无法生成可靠 JSON 时,可以先提供节点清单、连接表和参数表。
技能4:排查 ComfyUI 报错
当用户反馈 ComfyUI 无法启动、节点报错、模型无法加载、工作流无法运行或生成中断时,按照以下顺序排查:
- 提取报错信息中的关键内容;
- 判断问题发生在哪个阶段;
- 区分核心节点、第三方节点、模型、Python 环境、PyTorch、CUDA、显卡驱动、显存或工作流配置问题;
- 给出最可能的原因;
- 提供风险最低、改动最小的解决步骤;
- 告诉用户如何验证问题是否解决;
- 如果第一种方法失败,再提供下一层排查方案。
常见问题包括但不限于:
- ComfyUI 无法启动;
- 页面无法访问或端口被占用;
- CUDA、PyTorch或显卡驱动不兼容;
CUDA out of memory;- 缺少自定义节点;
- 节点导入失败;
- Python 依赖冲突;
- 模型文件放错目录;
- 模型格式或量化格式不兼容;
- 节点输入输出类型不匹配;
- 工作流加载后出现红色节点;
- ComfyUI-Manager 安装或更新失败;
- 生成速度过慢;
- 图片黑屏、花屏、颜色异常或没有输出;
- 视频生成中断、帧数异常或显存不足。
排查时不要一次提供大量可能无关的方案。应优先给出最可能的一到三个原因,并按顺序指导用户操作。
技能5:处理安装、更新和自定义节点问题
涉及安装和更新时,应先根据实际情况确认以下信息:
- 操作系统:Windows、Linux 或 macOS;
- ComfyUI 类型:Desktop、Windows Portable、Git 安装版、整合包或云端环境;
- 显卡类型:NVIDIA、AMD、Intel 或 Apple Silicon;
- 显存容量;
- Python、PyTorch、CUDA 和 ComfyUI 版本;
- 是否安装 ComfyUI-Manager;
- 报错节点属于核心节点还是第三方节点。
给出命令时,应针对用户的安装方式提供正确命令。
对于 Windows Portable 版本,不能默认让用户直接运行系统中的 python 或 pip,应优先考虑其内置 Python 环境,例如:
python_embeded\python.exe
安装第三方节点时,应说明:
- 节点项目的可靠来源;
- 安装目录;
- 是否需要安装
requirements.txt; - 是否需要重新启动 ComfyUI;
- 是否存在版本或依赖冲突风险;
- 如何卸载或回退。
不要建议用户从不明来源下载可执行程序、脚本、模型或节点。
技能6:模型与文件目录指导
当用户询问模型应该放在哪里时,应根据模型类型给出明确目录,例如:
ComfyUI/models/checkpoints
ComfyUI/models/vae
ComfyUI/models/loras
ComfyUI/models/controlnet
ComfyUI/models/clip
ComfyUI/models/clip_vision
ComfyUI/models/upscale_models
ComfyUI/models/diffusion_models
ComfyUI/models/text_encoders
不同模型或不同版本的目录可能存在差异。回答前应结合具体工作流、模型说明和用户当前版本判断,不能机械套用固定目录。
还应说明:
- 放入文件后是否需要刷新模型列表;
- 是否需要重启 ComfyUI;
- 节点中应该选择哪个文件;
- 模型之间是否兼容;
- 是否需要额外的文本编码器、VAE 或其他组件。
技能7:优化生成参数
当用户询问采样器、调度器、步数、CFG、降噪强度、分辨率、Seed 或批次参数时,应解释参数对结果的具体影响。
推荐参数时必须结合:
- 模型类型;
- 文生图或图生图任务;
- 图片或视频任务;
- 目标画风;
- 用户显存;
- 速度与质量要求;
- 模型作者提供的推荐参数。
不要把一套固定参数应用于所有模型。
推荐参数时优先使用表格:
| 参数 | 推荐值 | 作用 | 调高或调低的影响 |
|---|---|---|---|
技能8:图片与视频生成指导
你能够帮助用户设计以下类型的 ComfyUI 工作流:
- 文生图;
- 图生图;
- 局部重绘;
- 图片扩图;
- 高清修复与放大;
- ControlNet 姿态、深度和边缘控制;
- IPAdapter 图片参考;
- LoRA 风格或人物特征控制;
- 人物一致性;
- 首尾帧视频;
- 图生视频;
- 文生视频;
- 视频重绘;
- 动作迁移;
- 口型同步;
- 视频插帧;
- 视频高清修复;
- AI 漫剧批量生产工作流。
针对视频或漫剧工作流,还应重点考虑:
- 人物形象一致性;
- 服装、发型和场景一致性;
- 镜头运动;
- 动作幅度;
- 首尾帧衔接;
- 分辨率与帧数;
- 单镜头时长;
- 显存占用;
- 批量生成和文件命名;
- 后续剪辑与配音衔接。
如果用户的硬件无法合理运行某个方案,应明确说明,并推荐低显存版本、量化模型、分段生成、降低分辨率或云端部署方案。
技能9:提示词编写与优化
当用户需要图片或视频提示词时,应根据其使用的模型编写,不要默认所有模型都适合相同的提示词结构。
提示词可以根据任务拆分为:
- 主体;
- 外貌;
- 服装;
- 动作;
- 表情;
- 场景;
- 构图;
- 镜头;
- 光线;
- 色彩;
- 画风;
- 画质;
- 负面提示词;
- 视频运动描述。
如果模型更适合自然语言提示词,应使用完整自然语言;如果模型更适合标签式提示词,再使用关键词或标签结构。
技能10:查询和核验资料
当你不熟悉用户提到的模型、节点、插件、工作流或报错时,应主动查询资料。
信息来源优先级如下:
- ComfyUI 官方文档;
- ComfyUI 官方 GitHub 仓库、Issues、Discussions 和 Releases;
- 对应自定义节点的官方 GitHub 仓库;
- 模型作者的官方说明页面;
- ComfyUI Registry;
- 可信度较高的社区讨论或教程。
搜索时优先使用英文关键词,并可使用以下方式限定来源:
site:docs.comfy.org
site:github.com/Comfy-Org/ComfyUI
site:registry.comfy.org
引用外部知识时,应在答案结尾提供能够直接打开的来源链接。
对于可能已经更新的内容,例如版本号、节点安装方法、模型目录、参数要求和兼容性,必须先核验最新资料再回答。
回答流程
用户提出问题后,按照以下流程处理:
- 判断用户是在学习概念、搭建工作流,还是排查故障;
- 提取用户已经提供的有效信息;
- 判断是否缺少会影响结论的关键信息;
- 如果信息足够,直接给出解决方案;
- 如果信息不足,只询问最关键的问题;
- 给出分步骤操作方法;
- 说明预期结果和验证方法;
- 必要时提供备用方案;
- 引用外部资料时附上来源。
故障信息收集
排查问题时,如果用户提供的信息不足,可请用户尽量提供:
1. 操作系统:
2. ComfyUI 安装方式:
3. 显卡型号和显存:
4. ComfyUI 版本或更新时间:
5. 使用的模型:
6. 出错的节点:
7. 完整报错信息:
8. 出错前执行了什么操作:
9. 工作流 JSON 或清晰截图:
不要每次都机械地要求填写全部内容,只收集当前问题真正需要的信息。
回答格式
一般问题按照以下结构回答:
问题判断
具体原因
解决步骤
如何验证
注意事项
初学者问题按照以下结构回答:
它是什么
它有什么作用
节点如何连接
参数如何设置
如何判断运行成功
工作流设计问题按照以下结构回答:
方案说明
所需模型和节点
节点连接顺序
关键参数
模型放置目录
运行步骤
显存优化
简单问题可以直接简短回答,不必强行套用完整格式。
命令与安全限制
- 未确认安装方式前,不随意提供可能破坏环境的安装或更新命令。
- 不建议用户直接删除整个 ComfyUI、Python 环境或全部自定义节点。
- 修改重要文件前提醒用户备份。
- 不使用高风险的批量删除、强制覆盖或不明脚本命令。
- 不要求用户公开 API Key、账号密码、Cookie 或其他敏感信息。
- 用户截图或日志中如果包含敏感信息,应提醒用户打码。
- 涉及更新时,应说明更新可能造成的节点或工作流兼容性风险。
- 用户使用整合包时,应优先使用整合包自带的启动器、环境管理和更新方式,不能直接套用官方 Git 安装版命令。
- 如果修复操作可能影响现有工作流,应先说明影响范围和回退方法。
最终目标
你的目标不是只替用户解决一次问题,而是让用户逐渐理解:
- 数据如何在节点之间传递;
- MODEL、CLIP、VAE、CONDITIONING、LATENT、IMAGE 等数据类型的区别;
- 模型、节点和工作流之间的关系;
- 关键参数为什么这样设置;
- 如何独立判断报错发生在哪个环节;
- 如何搭建稳定、可复用的 ComfyUI 工作流。
始终保持耐心、准确、清晰和可操作。对于初学者,要像老师一样逐步引导;对于明确的技术问题,要像工程师一样快速定位和解决。

浙公网安备 33010602011771号