ComfyUI 文生圖完全指南:教程與常見問題排查
ComfyUI 文生圖詳細教程 — 提示詞技巧、參數調優、常見問題修復,從入門到解決出圖模糊、手部變形等問題。
什麼是文生圖?
文生圖(Text to Image)是最基礎的 AI 藝術工作流 — 你用文字描述想要的畫面,AI 模型就會生成對應的圖片。在 ComfyUI 中,這個過程被構建為一個節點圖,每個節點負責生成流程中的一個步驟。
這個過程涉及三個核心要素:
- 生成模型 — 創建圖像的神經網絡(如 Stable Diffusion 1.5)
- 潛空間 — 圖像逐步成形的壓縮數學空間
- 提示詞 — 你的文字描述,分為正向提示(想要的元素)和反向提示(想避免的元素)
準備工作
開始之前,確保你已經:
- 安裝並運行了 ComfyUI(快速開始)
- 在
ComfyUI/models/checkpoints文件夾中有至少一個模型
本教程使用 SD1.5 模型。你可以從 HuggingFace 下載 v1-5-pruned-emaonly-fp16.safetensors。
如果你使用 ComfyUI Desktop 安裝,可以直接通過界面下載模型,無需手動管理文件。
工作流節點詳解
默認的文生圖工作流使用六種節點(其中 CLIP Text Encode 出現兩次 — 分別用於正向和反向提示詞):
Load Checkpoint(加載模型)
加載你的 AI 模型。一個 checkpoint 通常包含三個組件:
| 組件 | 作用 |
|---|---|
| MODEL (UNet) | 在擴散過程中預測和去除噪聲 |
| CLIP | 將文字提示轉換為模型能理解的數值向量 |
| VAE | 在潛空間和像素空間之間轉換 |
Empty Latent Image(空白潛像)
設定畫布尺寸。這個節點創建一個充滿隨機噪聲的空白潛空間 — 生成過程的起點。寬高決定了最終圖片的尺寸。
SD1.5 建議使用 512×512 以獲得最佳效果。
CLIP Text Encode(文字編碼,需要兩個)
一個用於正向提示(你想要的),一個用於反向提示(你想避免的)。CLIP 編碼器將文字轉換為語義向量來引導去噪過程。
KSampler(採樣器)
工作流的核心。它接收噪聲潛像、模型和提示條件,然後通過多步迭代去噪生成圖像。
關鍵參數:
| 參數 | 作用 |
|---|---|
| seed | 隨機種子 — 相同的種子 + 相同的設置 = 相同的圖片 |
| steps | 去噪迭代次數。越多細節越好,但生成越慢 |
| cfg | 模型遵循提示的程度。太低會忽略提示,太高會出現瑕疵 |
| denoise | 噪聲強度。文生圖保持 1.0(從純噪聲完全生成) |
VAE Decode(VAE 解碼)
將去噪後的潛像轉換回可查看的圖片。
Save Image(保存圖片)
顯示並保存結果到 ComfyUI/output 文件夾。
寫好提示詞
好的提示詞對輸出質量影響巨大。以下是 SD1.5 的實用技巧:
建議:
- 儘量使用英文以獲得最佳效果
- 用逗號分隔短語,不要寫長句子
- 具體描述:"golden sunset over calm ocean" 比 "nice landscape" 好得多
- 加入質量提升詞:
masterpiece, best quality, highly detailed - 用權重強調重點:
(golden hour:1.2)讓這個概念更突出
避免:
- 寫長段落 — 模型對簡潔關鍵詞的反應更好
- 忘記反向提示 — 它們對避免常見瑕疵非常重要
示例:動漫風格
正向提示:
anime style, 1girl, long pink hair, cherry blossom background,
soft lighting, intricate details, masterpiece, best quality反向提示:
low quality, blurry, deformed hands, extra fingers示例:寫實人像
正向提示:
(ultra realistic portrait:1.3), elegant woman,
soft cinematic lighting, (golden hour:1.2),
shallow depth of field, (skin texture:1.3),
warm color grading反向提示:
deformed, cartoon, anime, plastic skin, overexposed,
blurry, extra fingers原理簡述
文生圖是一個逆向擴散過程:
- 從潛空間中的純隨機噪聲開始
- 模型在每一步預測需要去除的噪聲
- 你的文字提示(編碼為向量)引導去噪方向
- 所有步驟完成後,VAE 將結果解碼為像素圖像
潛空間是一種壓縮的數學表示 — 比實際圖像小得多。這就是為什麼擴散模型能在消費級硬件上運行。可以理解為先畫草稿(潛空間)再完成最終作品(像素)。
關於 SD1.5
Stable Diffusion 1.5 是使用最廣泛的開源圖像生成模型之一:
- 大小: 約 4 GB — 可在 6 GB 以上顯存的 GPU 上運行
- 最佳分辨率: 512×512
- 生態: 大量的 LoRA、ControlNet 和社區微調模型
- 侷限性: 手部、複雜光照可能出問題,超過 512px 質量下降
常見問題和解決方法
出圖模糊、質量低
- 增加步數 — 嘗試 25–30 步,而非默認的 20
- 提高 cfg — 嘗試 7–9 以增強提示詞的影響力
- 加入質量關鍵詞 — 正向提示中加入
masterpiece, best quality, highly detailed, 4k - 檢查分辨率 — SD1.5 在 512×512 效果最佳。直接生成更高分辨率往往會降低質量
手部和手指變形
這是 SD1.5 的已知侷限。緩解方法:
- 反向提示中加入
deformed hands, extra fingers, bad anatomy - 使用修手 LoRA(如 Civitai 上的 "detail tweaker" 或 "hand fix")
- 生成 512×512 後再放大
出圖完全不符合提示詞
- cfg 太低 — 提高到 7–12 讓模型更緊密跟隨提示
- 概念太多 — 精簡提示詞。少而精的關鍵詞比長段描述效果更好
- 模型不匹配 — 一些模型針對特定風格微調過,動漫模型不擅長寫實風格
Load Checkpoint 顯示 null 或空
- 確認
.safetensors文件在ComfyUI/models/checkpoints/中 - 刷新 ComfyUI(F5)或重啟
- 檢查文件是否損壞(下載不完整)
生成速度很慢
- 顯存不足 — 啟動時加
--lowvram參數 - 步數太多 — 快速迭代用 20 步就夠,30+ 步留給最終渲染
- 分辨率太大 — 用 512×512 生成後再放大,不要直接生成 1024×1024
下一步
先按上面的步驟定位根因。還卡住時,可以下載 Wonderful Launcher 檢查目前機器;啟動器原生修復、任務日誌和執行階段檢查會集中在一起。credits 只用於圖片生成和按量工具。
下載 Wonderful Launcher查看 credits 方案這篇文件解決了你的問題嗎?
你的回饋會幫助我們優先補強真實 ComfyUI 排障文件。