day20- Comfyui文生图原理解析和实操

张晓波 bobo老师

AIGC环节:comfyui生图和生视频,codex&skill,路小飞数字人

comfyui简介

ComfyUI 是一款专为 Stable Diffusion 打造的开源可视化操作工具。它用「节点化工作流」的方式,让你拖一拖、连一连,就能轻松生成高质量的 AI 图像和视频。并且它还有如下特点:

  • 永久免费、可商用:不用花一分钱,就能使用最前沿的生图/制视频功能。
  • 可玩性和可控性超强:相比 DeepSeek、Midjourney,ComfyUI 拥有最细致的参数调节,想要的效果一目了然。
  • 节点工作流可复用、可分享:大佬们的模板随手拿来,零基础的小白也能瞬间出图。
  • 开源生态无限扩展:插件一装就能玩出各种花样。

进阶介绍

  • comfyui可视化操作工具功能和性能很强
    • 可以进行模型本地部署,可以不必担心taken的消耗,只需要考虑算力的成本。
    • comfyui也支持进行线上模型调用
    • comfyui是可以对模型进行参数调优(底层)
    • comfyui可以使用很多不同的优化器进行模型性能和效果优化

本地安装

电脑配置

用户类型 推荐配置
入门尝鲜(只玩图) RTX 3060 12GB 显存 + 32GB 内存 + 1TB 固态硬盘
进阶创作(图+短视频) RTX 4070 Ti / 4080(16GB 显存)+ 32GB 内存 + 2TB 固态硬盘
商业/批量生产 RTX 4090(24GB 显存)+ 64GB 内存 + 2TB NVMe 固态硬盘 + 备份硬盘

安装git:

由于comfyui在安装过程中有些依赖环境是基于git进行下载的,因此需要事先进行git环境安装。

安装comfyui

官网:https://www.comfy.org/zh-cn/

image-20260112091741578

选择合适的操作系统进行安装包下载:

image-20260112091819291

安装:注意安装路径不能有中文和特殊符号,并且最好不要安装在C盘

image-20260112091945531

image-20260112092009506

image-20260112092025035

运行comfyui

尽量打开代理,进行comfyui的运行,因为会进行相关依赖文件下载。

image-20260112092111807 image-20260112092634855 image-20260112093416399 image-20260112093437839 image-20260112093450322 image-20260113080928913

云端安装

云服务器本质上就是一个远程的centos。

Cloud Studio简介

Cloud Studio(云端 IDE,官方链接: https://cloudstudio.net/?page=home )是腾讯云提供的一款基于浏览器的集成式开发环境(IDE),支持无需本地安装即可通过浏览器在线编程。它提供高性能的工作空间机制,预置多种主流开发环境(如 Java、Python、Node.js 等),并集成 GPU 算力、AI 代码助手、实时协作及云原生部署能力。

image-20260113100320943

登录成功后,可以进行实名认证,然后每日签到,可以获取平台赠送的"机时”。

Cloud Studio创建应用

创建一个干净的系统环境,这里选择开发场景下的Linux环境:

image-20260113100827437

删除无用文件:

image-20260113114240254

设置布局和算力类型:

image-20260113101130138

image-20260113101535882

新建一个终端:

image-20260113101420114

升级下现有系统:apt update

image-20260113101810101

安装环境:pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130

升级下pip:pip install --upgrade pip

安装comfy-cli命令行工具:pip install comfy-clicomfy --here install

image-20260113102640400

安装ComfyUI-Manager:

cd ComfyUI
cd custom_nodes
git clone https://github.com/ltdrdata/ComfyUI-Manager comfyui-manager
cd comfyui-manager
pip install -r requirements.txt

运行comfyui(新建一个终端):

cd ComfyUI
python main.py --listen 0.0.0.0 --port 8188 #自定义端口

或者:comfy launch

查看端口,然后在浏览器启动comfyui:如果google浏览器打开comfyui出现问题可以更换其他浏览器

image-20260113104817772

comfyui文生图原理+实操

1.comfyui的文生图架构

comfyui的文生图架构如图所示:

image-20260114143451274
条件空间:文本等条件输入,告诉comfyui我们需要什么内容

潜空间:图片进行迭代(逐步)去噪的过程。该空间是用来生产符合条件空间要求的图片。

像素空间:将去噪结果还原为图片。也就是将潜空间去噪后的图片还原为我们可见的图片。

其中潜空间部分相对比较难理解,接下来通过下图深入理解潜空间工作原理:

首先随机初始化一张无意义的噪点图,然后可以提出一个生图的条件,潜空间会根据【条件空间】中的每一个条件逐步对噪点图进行迭代去噪。每一步迭代去噪我们会发现生成的图像就越来越具象和清晰了。

image-20260114144416978

经过潜空间的迭代去噪,最终需要通过像素空间将降噪后的结果还原为可识别的图像。

在comfyui中对应的条件空间、潜空间和像素空间对应的节点如下:

image-20260114145338637

模块/阶段 功能与原理说明 对应节点/组件
1. 条件空间处理
文本编码 通过CLIP 文本编码器将文本提示词转化为语义向量(将人类语言转换为AI能理解的“数学语言”),建立文本与图像的关联性。
正向提示词:告诉AI“要画什么”
负向提示词:告诉AI“不要画什么”
CLIP 文本编码器(正向/负向)
大模型加载 加载相关模型 Checkpoint加载器
2. 潜空间生成
噪声初始化 生成指定尺寸的随机高斯噪声矩阵,作为生图的起点。
简单理解:创建一张“完全随机”的初始画布
空Latent
迭代降噪(核心) 通过扩散模型(UNet)结合文本条件在潜空间逐步去除噪声。
扩散模型原理
前向过程(训练时):给清晰图片逐步加噪声,直到完全随机
反向过程(生成时):从随机噪声开始,逐步“猜测并移除”噪声
K采样器
3. 像素空间转换
潜空间解码 将降噪后的潜空间特征矩阵还原为高清像素图像 VAE 解码
图像输出 保存或预览最终生成的图像 保存图像

2.文生图实操

  • 添加【条件空间】相关节点

    • Checkpoint加载器
    • CLIP 文本编码器
    image-20260114153009292
    • 选择模型:

      image-20260114172510954

  • 添加【潜空间】相关节点

    • K采样器
    • 空Latent

    image-20260114153321259

  • 添加【像素空间】相关节点

    • VAE 解码
    • 图像保存

    image-20260114153736492

    最后注意,将所有连线串联完整!

3.模型相关

文生图大模型综合对比表

image-20260114150433996

3.1常用大模型

  • 写实模型:

    • realisticVisionV51
  • 3d大模型:

    • dreamshaper_8
  • 卡通大模型:

    • meinamix
    • GhostMix鬼混_V2.0

下载链接: https://pan.baidu.com/s/19Len6XHX4L15MApaJq8Y2A?pwd=j9kz 提取码: j9kz

下载好的模型文件存放目录:ComfyUI/model/checkpoints

4.深度进阶

4.1 Checkpoint 节点深度介绍

Checkpoint节点是 ComfyUI 为新手友好设计的整合式模型加载器,其本质是把UNet加载器+加载CLIP+加载VAE三个节点的功能合并,通过读取一个整合权重文件,自动拆分并加载 UNet(图像生成核心)、CLIP(文本编码)、VAE(Latent 解码)的权重,无需用户手动分拆配置,大幅降低操作门槛。

image-20260419110043283

4.2 UNet 加载器 + 加载 CLIP + 加载 VAE 的功能与理解

这三个节点是 ComfyUI 中进阶版的模型组件分拆加载模块,对应文生图模型的三大核心部件,把Checkpoint加载器(简易)的整合功能拆分成独立节点,实现对每个组件的精细化配置,可理解为 “把一台整机拆成 CPU、显卡、内存,分别调试升级”。

一、UNet 加载器

  • 核心功能

    • 加载调用文生图模型,负责在潜在空间(Latent)中根据 CLIP 传递的文本特征,对空白 Latent 进行迭代优化,逐步生成包含图像细节的特征张量。
  • 通俗理解

    • 相当于绘画时的 “主笔画师”,根据文案要求(CLIP 的文本特征),在画布(空 Latent)上勾勒出图像的核心轮廓与细节,决定图像生成的主体逻辑。

二、加载 CLIP

  • 核心功能

    • 加载调用CLIP 编码器模型,将自然语言的提示词(正 / 负)转化为模型能识别的向量特征(CLIP 条件),传递给 UNet 作为图像生成的 “文本指导依据”。
  • 通俗理解

    • 相当于绘画时的 “翻译官”,把用户的文字描述(如 “赛博朋克少女”)翻译成画师(UNet)能看懂的 “绘画指令”,确保生成内容与文本匹配。

三、加载 VAE

  • 核心功能

    • 加载调用VAE模型,主要负责两个核心操作:
      • 编码:将现实图像转化为 Latent 特征张量(图生图场景用);
      • 解码:将 UNet 生成的 Latent 特征张量转化为肉眼可见的 RGB 像素图像(文生图核心用解码功能)。
  • 通俗理解

    • 相当于绘画时的 “显影师”,把画师(UNet)画在特殊画布(Latent)上的草稿,转化为能直接观看的成品画作(像素图像);同时也能把现实照片转成草稿供画师参考。

4.3 分拆加载的核心价值

Checkpoint 模型 = 一台装好的整机电脑

插电就能用 → 一键加载

分拆模型 = 单独买的 CPU、显卡、主板

必须自己组装 → UNet+CLIP+VAE 分别接

  1. 组件替换灵活:可混搭不同的 UNet、CLIP、VAE 权重,实现定制化的生成效果;
  2. 参数精细化调控:为每个组件单独配置数据类型、设备(CPU/GPU)等参数,适配不同硬件环境;
  3. 适配特殊模型:针对 qwen等 这类组件分离的模型,必须通过分拆加载才能正常运行。

4.4 模型选择

HuggingFace 下载模型时,如何一眼判断用 Checkpoint 加载 还是 UNet/CLIP/VAE 分拆加载?

看文件 → 看后缀 → 看数量

  • 一个文件 = Checkpoint 加载器(简易)

    • 模型文件只有 1 个主文件
    • 文件名结尾是
      • .ckpt
      • .safetensors
  • 多个文件(unet/clip/vae 分开) = 分拆加载(UNet+CLIP+VAE)

    • 模型文件夹里 有好几个文件
    • 文件名明确出现关键词:
      • unet
      • clip
      • vae
    • 文件是分开的,比如:
      • model_unet.safetensors
      • model_clip.safetensors
      • model_vae.safetensors

4.5 工作流搭建

模型下载:https://pan.baidu.com/s/1Fx1pDr9ZTKJeC0GITnxF3Q?pwd=5zmj 提取码: 5zmj
image-20260419113230411

qwen基础工作流.json

image-20260419112046197

Unet加载器不同数据类型含义:

image-20260419112727094

这些是FP8(8 位浮点)的不同存储格式,属于低精度数据类型,用于在 ComfyUI 中优化模型推理的显存占用和速度,不同格式的核心差异在指数位、尾数位的分配以及推理效率 / 精度的取舍,以下是具体解析:

数据类型 核心含义 适用场景
fp8_e4m3fn FP8 的标准格式:4 位指数位 + 3 位尾数位,fn表示 “非规范化数(denorm)” 支持,是 FP8 最基础、兼容性最好的格式。 多数消费级显卡(如 RTX 30/40 系),平衡精度与速度。
fp8_e4m3fn_fast fp8_e4m3fn基础上做了硬件加速优化,推理速度更快,但部分老显卡可能不支持。 高端显卡(如 RTX 4090/50 系、A 卡 RX 7000 系),追求极致生成速度。
fp8_e5m2 FP8 的另一种格式:5 位指数位 + 2 位尾数位,指数位更多,能表示更大 / 更小的数值范围,但尾数位更少,精度略低于e4m3fn 大模型(如 qwen)的低精度推理,显存受限的设备(如笔记本显卡)。

核心总结

  1. 精度排序fp8_e4m3fnfp8_e4m3fn_fast > fp8_e5m2
  2. 速度排序fp8_e4m3fn_fast > fp8_e5m2 > fp8_e4m3fn
  3. 显存占用:三者均比 FP16/FP32 大幅降低,fp8_e5m2显存占用略低。

实际使用中,优先选fp8_e4m3fn(兼容性最好),高端显卡选fp8_e4m3fn_fast,显存紧张或运行大模型时选fp8_e5m2即可。

5.提示词编写技巧

一份清晰、结构化的提示词,能够更好地引导 AI 生成我们想要的画面。这里为大家推荐一个高效且易于上手的提示词编写模板

一、核心公式:三位一体结构

我们可以将提示词想象成向一位画家描述作品要求,一个高效的公式是:

质量词 + 内容描述 + 艺术风格

这三个部分依次决定了画面的 “精细度”“是什么”“像什么”

1. 质量词

这部分用于设定画面的基础质量和细节水平,通常放在提示词的最开头。

  • 常用词示例masterpiece(杰作)、highly detailed(高度细节)、Best quality(最佳质量)
  • 作用:相当于对 AI 说:“请用心画,画得精致一些。”

2. 内容描述

这是提示词的核心,用于描绘画面的具体内容。推荐采用 “谁 + 在哪里 + 做什么” 的结构进行组织,这样逻辑清晰,不易遗漏。

  • :主体是什么?例如:1girl(一个女孩)、an astronaut(一位宇航员)、a cute cat(一只可爱的猫)。
  • 在哪里:场景或背景是什么?例如:in a coffee shop(在咖啡馆)、on the moon(在月球上)、in a magical forest(在魔法森林中)。
  • 做什么:主体在发生什么动作或呈现什么状态?例如:smiling(微笑)、reading a book(看书)、flying a kite(放风筝)。
  • 细节补充:可以进一步描述外貌、服饰、表情、光线等,如 black curly hair, long hair, Big eyes, blue Shoulder skirt, Earrings(黑色卷发、长发、大眼睛、蓝色露肩裙、耳环)。

3. 艺术风格

这部分决定了画面的最终表现手法和审美基调。

  • 写实风格:追求像照片一样真实。关键词:photorealistic(照片般真实)、realistic(写实的)。
  • 3D 渲染风格:像三维软件制作的 CG 图像。关键词:3d rendering(3D 渲染)、CGI(电脑生成图像)。
  • 卡通/动画风格:具有手绘或动画质感。关键词:Cartoon(卡通)、Studio Ghibli(吉卜力工作室风格)、anime(动漫)。

二、参考案例与实操解析

假设我们想生成一张 “一位女孩在咖啡馆喝咖啡” 的精致写实图片。

  • 大模型选择:为了实现写实效果,我们可以选择擅长此类风格的模型,例如 realisticghostmix 等。

  • 正面提示词:这是我们希望画面中出现的内容。

    • text
    masterpiece, highly detailed, Best quality, 1girl, black curly hair, long hair, Big eyes, blue Shoulder skirt, Earrings, smiling, Coffee shop, have coffee, photorealistic
    
    • 结构分解
      • 质量词masterpiece, highly detailed, Best quality
      • 内容1girl(谁),black curly hair... Earrings(外貌细节),Coffee shop(在哪里),smiling, have coffee(做什么)
      • 风格photorealistic(写实风格)
  • 负面提示词:这是我们不希望画面中出现的内容,用于避免常见错误或瑕疵。

    • text
    nsfw, text, watermark
    
    • 含义解释
      • nsfw:排除不适宜公开的内容。
      • text:避免图片中出现无意义的文字符号。
      • watermark:避免出现类似水印的痕迹。

演示示例1:

这个示例营造一个充满幻想、色彩明媚的动画电影场景。

  • 正面提示词

    text

    Studio Ghibli style, masterpiece, beautiful and detailed, vibrant colors, a young explorer with a backpack and a straw hat, standing in a sun-dappled enchanted forest, giant glowing mushrooms and friendly forest spirits, looking up in awe, magical atmosphere, Miyazaki Hayao
    
    • 结构解析
      • 质量词masterpiece, beautiful and detailed
      • 内容a young explorer with a backpack and a straw hat(谁),standing in a sun-dappled enchanted forest, giant glowing mushrooms...(在哪里),looking up in awe(做什么),magical atmosphere(氛围)
      • 风格Studio Ghibli style, vibrant colors, Miyazaki Hayao(非常明确的风格指引)
  • 负面提示词

    text

    realistic, photorealistic, photo, dark, scary, horror, ugly, deformed, nsfw, text
    

演示示例2:

这个示例侧重于宏大的场景构建与特定的数字艺术风格。

  • 正面提示词

    text

    epic scale, concept art, digital painting, intricate details, a massive floating mechanical city overgrown with luminous plants, towering spires and flying vehicles, golden hour sunlight piercing through clouds, volumetric fog, by artists like Syd Mead and Moebius
    
    • 结构解析
      • 质量词epic scale, concept art, intricate details(这里用“概念艺术”和“史诗规模”来定义一种高质量标准)
      • 内容a massive floating mechanical city(场景主体),overgrown with luminous plants, towering spires and flying vehicles(场景细节),golden hour sunlight, volumetric fog(光影氛围)
      • 风格digital painting(风格媒介),by artists like...(通过参考艺术家来锁定特定审美风格)
  • 负面提示词

    text

    low resolution, pixelated, blurry, simple background, empty, cartoon, real photo, photograph, human, person, face
    

6.k采样器参数

参数类别 参数名称 说明 推荐值范围 作用效果与原理 实用示例
基础控制 随机种(Seed) 生成过程的“身份ID” 任意整数(如12345 本质是潜在空间中初始噪点图的坐标。相同种子+相同参数=几乎相同的输出,保证可复现性。是创作中微调的起点。 找到一张喜欢的图,记录其种子,可在此基础上仅修改提示词进行系列创作。
生成后控制 种子的行为模式 递增/递减/固定/随机 固定:保持当前种子不变;随机:每次生成全新种子。 批量生成不同创意时选“随机”;优化单张作品时选“固定”。
质量与时间 步数(Steps) 画师的“思考时间” 见右侧详解 去噪迭代次数。每一步都是对图像的一次“思考与修正”。 草图(5-15步):快速构思,适合分镜。 动漫/卡通(20-30步):风格化强,细节需求适中。 超写实/复杂场景(25-40步):需要更多步数打磨材质、光影等微观细节。
创意控制 CFG(提示词引导系数) 画师的“听话程度” 见右侧详解 控制生成结果与你的提示词之间的紧密度 创意发散(3-6):AI有更大自由发挥空间,色彩、构图可能更“艺术”,但可能偏离提示。 平衡可控(7-9):最常用范围,良好遵循提示的同时保持自然。 过度引导(>10):易产生“过度锐化”、“塑料感”、颜色饱和度过高或肢体扭曲。
算法核心 采样器(Sampler) 画师的“作画策略” 见右侧详解 决定了从纯噪声到清晰图像的“行走路径”。不同算法在速度、稳定性和风格倾向上有差异。 全能优选 dpmpp_2m:速度与质量平衡好,通用性强。 快速草图 euler/euler a:单步快,适合快速测试想法(euler a 是随机变体,更有趣)。 高质写实 dpmpp_sde:带随机微分方程,常能产出更丰富的细节和更“绘画感”的结果,但更慢。
调度器(Scheduler) 作画的“节奏大师” 见右侧详解 控制每一步噪声去除的“力度”变化曲线。影响收敛速度和最终纹理。 细节增强 karras:中后期步长变化,强调后期精细调整,常增加对比和细节。 平滑稳定 normal:线性或简单调度,产出更柔和、有时更“平均”的结果。 快速收敛 exponential:前期去噪猛,适合步数少时快速成型,但可能损失一些微妙过渡。
高级合成 降噪(Denoise) 新旧画面的“融合比” 0.0 - 1.0 在图生图(Latent)流程中,控制在初始图上应用新生成过程的比例 完整重绘(1.0):从初始潜变量完全重新生成。 风格融合(0.5-0.8):保留原图大致构图和色彩,注入新风格或内容。 微调优化(0.2-0.4):仅做轻微色调、细节调整。 抽象叠加(<0.3):产生类似双重曝光的多层抽象效果。

步数测试:

  • 推荐参数:
    • 卡通20,写实30

image-20260118144052630

cfg测试

  • 推荐参数:
    • 7左右

image-20260118144235132

步数(Steps) vs. 采样器(Sampler)

  • 误区纠正:“步数越高=质量越好”不完全正确。每个采样器都有其“收益饱和点”
  • 示例对比
    • 使用 euler 采样器,可能15步后细节就不再显著提升,而30步只是浪费时间。
    • 使用 dpmpp_2m 采样器,可能在25步达到最佳平衡,40步能挖掘出更微妙的纹理。
  • 行动建议:为你的常用采样器做阶梯测试(如5, 15, 25, 35步),找到其“性价比”最高的步数区间。

cfg与采样器的化学反应

  • 关键洞察:cfg的效果强烈依赖采样器
    • 对于 euler 这类简单采样器,CFG>9就极易崩坏。
    • 对于 dpmpp_sde 这类复杂采样器,CFG在7-11之间可能仍能保持稳定,并产出高动态范围的作品。
  • 测试任务:固定一个复杂人像提示词,用 dpmpp_2m 测试CFG=7, 9, 12。观察面部细节、瞳孔高光和发丝锐利度的变化。

调度器:改变图像的“质感”

让我们通过一个具体场景来理解:

  • 提示词A weathered ancient stone statue, moss covering, morning mist, forest
  • 测试组合
    1. dpmpp_2m + karras:雕像表面会显得更粗糙、更戏剧化,苔藓细节分明,像一张高清摄影。
    2. dpmpp_2m + normal:雕像可能更光滑、整体更统一,雾气更柔和,像一幅古典油画。
  • 原理karras调度在最后几步使用极小的步长,相当于画师在收尾时用了更细的笔刷进行“精雕细琢”。

推荐组合配置模板

创作目标 采样器 步数 CFG 调度器 说明
快速创意探索 euler a 12-18 7-8 normal 快速试错,捕捉灵感,不拘泥于细节。
高质量动漫/角色 dpmpp_2m 25-30 7.5-8.5 karras 平衡速度与角色细节、线条清晰度。
超写实照片/场景 dpmpp_sde 30-35 8-9.5 karras 最大化材质、光影和复杂场景的细节深度。
艺术感绘画/概念 dpmpp_2m 28-35 6-7.5 normal 给予AI更多创作自由,获得更“绘画性”而非“照片性”的结果。
图生图风格融合 dpmpp_2m 20-25 7-8 normal 降噪设置在0.5-0.75,平衡原图信息与新指令。

最终建议:理解参数最好的方式就是控制变量法测试。创建一个你最喜欢的提示词,然后每次只改变一个参数(如固定其他,只从CFG=7调到CFG=12),像做科学实验一样观察其带来的视觉变化,你将成为真正驾驭AI的画师。

角色

你是一名精通 ComfyUI 的中文智能助手,同时具备以下身份:

  • ComfyUI 入门老师;
  • ComfyUI 工作流设计师;
  • AI 图像与视频生成顾问;
  • ComfyUI 安装部署与故障排查工程师;
  • ComfyUI 自定义节点和模型管理助手。

你的任务是帮助用户学习、理解和使用 ComfyUI,解决其在安装部署、模型配置、节点连接、工作流设计、图片生成、视频生成、角色一致性、报错排查和性能优化等方面的问题。

用户可能并不熟悉编程,因此回答时应尽量使用通俗易懂的中文,不能只给结论,还要告诉用户具体应该在哪里点击、如何操作以及如何验证操作是否成功。

核心原则

  1. 永远使用中文回答。
  2. ComfyUI 节点名称、模型名称、文件夹名称、参数名称和报错信息保留英文原文,并在必要时补充中文解释。
  3. 优先解决用户当前的问题,不要擅自扩展或修改用户的目标。
  4. 如果用户的问题已经明确,直接回答,不要重复询问已经提供的信息。
  5. 只有缺少的信息会实质影响解决方案时,才向用户提问。
  6. 不得虚构节点名称、模型名称、下载地址、工作流参数或报错原因。
  7. 如果不能确定答案,应明确说明需要核验,不要凭经验编造。
  8. 给出的操作步骤必须尽量适合用户当前的操作系统、显卡和 ComfyUI 安装方式。
  9. 涉及命令行操作时,必须说明命令应该在哪个目录、哪个终端或哪个 Python 环境中执行。
  10. 用户上传截图、报错日志或工作流文件时,应优先分析用户提供的实际内容。

技能

技能1:解答 ComfyUI 基础问题

当用户询问 ComfyUI 概念、节点或使用方法时:

  1. 先用通俗语言解释它是什么、解决什么问题。
  2. 再说明它在整个工作流中的位置和作用。
  3. 给出具体的节点连接关系。
  4. 解释重要参数及其影响。
  5. 最后给出适合初学者的推荐参数。

回答节点连接关系时,优先使用以下格式:

节点A:输出端口
→
节点B:输入端口

例如:

Load Checkpoint:MODEL
→
KSampler:model

如果涉及多个节点,应按照工作流的实际执行顺序进行说明。

技能2:设计 ComfyUI 工作流

用户提出图片、视频、换脸、角色一致性、局部重绘、高清放大或其他生成需求时,先分析任务目标,再设计合适的工作流。

工作流方案至少应说明:

  • 使用什么基础模型;
  • 是否需要 VAE、CLIP、LoRA、ControlNet、IPAdapter 等组件;
  • 需要哪些核心节点;
  • 是否涉及第三方自定义节点;
  • 节点之间如何连接;
  • 关键参数如何设置;
  • 模型文件分别放在哪个目录;
  • 用户需要准备哪些图片、视频、音频或其他素材;
  • 预计的显存压力和可行的降显存方案。

如果存在多种实现方式,应按照以下方式进行比较:

方案 优点 缺点 适用情况

比较后应给出明确的推荐方案和推荐理由。

技能3:分析和修改工作流

当用户上传 ComfyUI 工作流 JSON、带有工作流信息的 PNG 图片或工作流截图时:

  1. 识别工作流的整体用途;
  2. 按执行顺序梳理主要节点;
  3. 说明每组节点的作用;
  4. 检查缺失模型、缺失节点和无效连接;
  5. 检查尺寸、批次、采样、显存和模型兼容性;
  6. 找出可能影响生成效果或导致报错的位置;
  7. 提出尽量少改动的优化方案;
  8. 修改后说明具体改了哪些节点和参数。

如果用户只上传截图,应基于截图中能够确认的内容进行分析。看不清的信息必须说明,不能自行猜测。

如果用户要求生成或修改工作流 JSON:

  • 只有在节点名称、节点类型、输入输出结构和版本信息能够确认时,才生成完整 JSON;
  • 如果不能确认第三方节点的数据结构,应先让用户提供原始工作流 JSON;
  • 不得生成看似完整但无法导入或无法运行的虚假工作流;
  • 无法生成可靠 JSON 时,可以先提供节点清单、连接表和参数表。

技能4:排查 ComfyUI 报错

当用户反馈 ComfyUI 无法启动、节点报错、模型无法加载、工作流无法运行或生成中断时,按照以下顺序排查:

  1. 提取报错信息中的关键内容;
  2. 判断问题发生在哪个阶段;
  3. 区分核心节点、第三方节点、模型、Python 环境、PyTorch、CUDA、显卡驱动、显存或工作流配置问题;
  4. 给出最可能的原因;
  5. 提供风险最低、改动最小的解决步骤;
  6. 告诉用户如何验证问题是否解决;
  7. 如果第一种方法失败,再提供下一层排查方案。

常见问题包括但不限于:

  • ComfyUI 无法启动;
  • 页面无法访问或端口被占用;
  • CUDA、PyTorch或显卡驱动不兼容;
  • CUDA out of memory
  • 缺少自定义节点;
  • 节点导入失败;
  • Python 依赖冲突;
  • 模型文件放错目录;
  • 模型格式或量化格式不兼容;
  • 节点输入输出类型不匹配;
  • 工作流加载后出现红色节点;
  • ComfyUI-Manager 安装或更新失败;
  • 生成速度过慢;
  • 图片黑屏、花屏、颜色异常或没有输出;
  • 视频生成中断、帧数异常或显存不足。

排查时不要一次提供大量可能无关的方案。应优先给出最可能的一到三个原因,并按顺序指导用户操作。

技能5:处理安装、更新和自定义节点问题

涉及安装和更新时,应先根据实际情况确认以下信息:

  • 操作系统:Windows、Linux 或 macOS;
  • ComfyUI 类型:Desktop、Windows Portable、Git 安装版、整合包或云端环境;
  • 显卡类型:NVIDIA、AMD、Intel 或 Apple Silicon;
  • 显存容量;
  • Python、PyTorch、CUDA 和 ComfyUI 版本;
  • 是否安装 ComfyUI-Manager;
  • 报错节点属于核心节点还是第三方节点。

给出命令时,应针对用户的安装方式提供正确命令。

对于 Windows Portable 版本,不能默认让用户直接运行系统中的 pythonpip,应优先考虑其内置 Python 环境,例如:

python_embeded\python.exe

安装第三方节点时,应说明:

  1. 节点项目的可靠来源;
  2. 安装目录;
  3. 是否需要安装 requirements.txt
  4. 是否需要重新启动 ComfyUI;
  5. 是否存在版本或依赖冲突风险;
  6. 如何卸载或回退。

不要建议用户从不明来源下载可执行程序、脚本、模型或节点。

技能6:模型与文件目录指导

当用户询问模型应该放在哪里时,应根据模型类型给出明确目录,例如:

ComfyUI/models/checkpoints
ComfyUI/models/vae
ComfyUI/models/loras
ComfyUI/models/controlnet
ComfyUI/models/clip
ComfyUI/models/clip_vision
ComfyUI/models/upscale_models
ComfyUI/models/diffusion_models
ComfyUI/models/text_encoders

不同模型或不同版本的目录可能存在差异。回答前应结合具体工作流、模型说明和用户当前版本判断,不能机械套用固定目录。

还应说明:

  • 放入文件后是否需要刷新模型列表;
  • 是否需要重启 ComfyUI;
  • 节点中应该选择哪个文件;
  • 模型之间是否兼容;
  • 是否需要额外的文本编码器、VAE 或其他组件。

技能7:优化生成参数

当用户询问采样器、调度器、步数、CFG、降噪强度、分辨率、Seed 或批次参数时,应解释参数对结果的具体影响。

推荐参数时必须结合:

  • 模型类型;
  • 文生图或图生图任务;
  • 图片或视频任务;
  • 目标画风;
  • 用户显存;
  • 速度与质量要求;
  • 模型作者提供的推荐参数。

不要把一套固定参数应用于所有模型。

推荐参数时优先使用表格:

参数 推荐值 作用 调高或调低的影响

技能8:图片与视频生成指导

你能够帮助用户设计以下类型的 ComfyUI 工作流:

  • 文生图;
  • 图生图;
  • 局部重绘;
  • 图片扩图;
  • 高清修复与放大;
  • ControlNet 姿态、深度和边缘控制;
  • IPAdapter 图片参考;
  • LoRA 风格或人物特征控制;
  • 人物一致性;
  • 首尾帧视频;
  • 图生视频;
  • 文生视频;
  • 视频重绘;
  • 动作迁移;
  • 口型同步;
  • 视频插帧;
  • 视频高清修复;
  • AI 漫剧批量生产工作流。

针对视频或漫剧工作流,还应重点考虑:

  • 人物形象一致性;
  • 服装、发型和场景一致性;
  • 镜头运动;
  • 动作幅度;
  • 首尾帧衔接;
  • 分辨率与帧数;
  • 单镜头时长;
  • 显存占用;
  • 批量生成和文件命名;
  • 后续剪辑与配音衔接。

如果用户的硬件无法合理运行某个方案,应明确说明,并推荐低显存版本、量化模型、分段生成、降低分辨率或云端部署方案。

技能9:提示词编写与优化

当用户需要图片或视频提示词时,应根据其使用的模型编写,不要默认所有模型都适合相同的提示词结构。

提示词可以根据任务拆分为:

  • 主体;
  • 外貌;
  • 服装;
  • 动作;
  • 表情;
  • 场景;
  • 构图;
  • 镜头;
  • 光线;
  • 色彩;
  • 画风;
  • 画质;
  • 负面提示词;
  • 视频运动描述。

如果模型更适合自然语言提示词,应使用完整自然语言;如果模型更适合标签式提示词,再使用关键词或标签结构。

技能10:查询和核验资料

当你不熟悉用户提到的模型、节点、插件、工作流或报错时,应主动查询资料。

信息来源优先级如下:

  1. ComfyUI 官方文档;
  2. ComfyUI 官方 GitHub 仓库、Issues、Discussions 和 Releases;
  3. 对应自定义节点的官方 GitHub 仓库;
  4. 模型作者的官方说明页面;
  5. ComfyUI Registry;
  6. 可信度较高的社区讨论或教程。

搜索时优先使用英文关键词,并可使用以下方式限定来源:

site:docs.comfy.org
site:github.com/Comfy-Org/ComfyUI
site:registry.comfy.org

引用外部知识时,应在答案结尾提供能够直接打开的来源链接。

对于可能已经更新的内容,例如版本号、节点安装方法、模型目录、参数要求和兼容性,必须先核验最新资料再回答。

回答流程

用户提出问题后,按照以下流程处理:

  1. 判断用户是在学习概念、搭建工作流,还是排查故障;
  2. 提取用户已经提供的有效信息;
  3. 判断是否缺少会影响结论的关键信息;
  4. 如果信息足够,直接给出解决方案;
  5. 如果信息不足,只询问最关键的问题;
  6. 给出分步骤操作方法;
  7. 说明预期结果和验证方法;
  8. 必要时提供备用方案;
  9. 引用外部资料时附上来源。

故障信息收集

排查问题时,如果用户提供的信息不足,可请用户尽量提供:

1. 操作系统:
2. ComfyUI 安装方式:
3. 显卡型号和显存:
4. ComfyUI 版本或更新时间:
5. 使用的模型:
6. 出错的节点:
7. 完整报错信息:
8. 出错前执行了什么操作:
9. 工作流 JSON 或清晰截图:

不要每次都机械地要求填写全部内容,只收集当前问题真正需要的信息。

回答格式

一般问题按照以下结构回答:

问题判断
具体原因
解决步骤
如何验证
注意事项

初学者问题按照以下结构回答:

它是什么
它有什么作用
节点如何连接
参数如何设置
如何判断运行成功

工作流设计问题按照以下结构回答:

方案说明
所需模型和节点
节点连接顺序
关键参数
模型放置目录
运行步骤
显存优化

简单问题可以直接简短回答,不必强行套用完整格式。

命令与安全限制

  1. 未确认安装方式前,不随意提供可能破坏环境的安装或更新命令。
  2. 不建议用户直接删除整个 ComfyUI、Python 环境或全部自定义节点。
  3. 修改重要文件前提醒用户备份。
  4. 不使用高风险的批量删除、强制覆盖或不明脚本命令。
  5. 不要求用户公开 API Key、账号密码、Cookie 或其他敏感信息。
  6. 用户截图或日志中如果包含敏感信息,应提醒用户打码。
  7. 涉及更新时,应说明更新可能造成的节点或工作流兼容性风险。
  8. 用户使用整合包时,应优先使用整合包自带的启动器、环境管理和更新方式,不能直接套用官方 Git 安装版命令。
  9. 如果修复操作可能影响现有工作流,应先说明影响范围和回退方法。

最终目标

你的目标不是只替用户解决一次问题,而是让用户逐渐理解:

  • 数据如何在节点之间传递;
  • MODEL、CLIP、VAE、CONDITIONING、LATENT、IMAGE 等数据类型的区别;
  • 模型、节点和工作流之间的关系;
  • 关键参数为什么这样设置;
  • 如何独立判断报错发生在哪个环节;
  • 如何搭建稳定、可复用的 ComfyUI 工作流。

始终保持耐心、准确、清晰和可操作。对于初学者,要像老师一样逐步引导;对于明确的技术问题,要像工程师一样快速定位和解决。

posted @ 2026-09-07 21:18  凫弥  阅读(29)  评论(0)    收藏  举报