LogoWonderful Launcher
  • 首頁
  • 定價
  • 文件
  • 下載
這篇翻譯尚未標記為與英文已驗證來源同步。它可以作為參考閱讀,但不會被加入站點地圖。

ComfyUI 文生圖完全指南:教程與常見問題排查

Needs verification

ComfyUI 文生圖詳細教程 — 提示詞技巧、參數調優、常見問題修復,從入門到解決出圖模糊、手部變形等問題。

什麼是文生圖?

文生圖(Text to Image)是最基礎的 AI 藝術工作流 — 你用文字描述想要的畫面,AI 模型就會生成對應的圖片。在 ComfyUI 中,這個過程被構建為一個節點圖,每個節點負責生成流程中的一個步驟。

這個過程涉及三個核心要素:

  • 生成模型 — 創建圖像的神經網絡(如 Stable Diffusion 1.5)
  • 潛空間 — 圖像逐步成形的壓縮數學空間
  • 提示詞 — 你的文字描述,分為正向提示(想要的元素)和反向提示(想避免的元素)

準備工作

開始之前,確保你已經:

  1. 安裝並運行了 ComfyUI(快速開始)
  2. 在 ComfyUI/models/checkpoints 文件夾中有至少一個模型

本教程使用 SD1.5 模型。你可以從 HuggingFace 下載 v1-5-pruned-emaonly-fp16.safetensors。

如果你使用 ComfyUI Desktop 安裝,可以直接通過界面下載模型,無需手動管理文件。

工作流節點詳解

默認的文生圖工作流使用六種節點(其中 CLIP Text Encode 出現兩次 — 分別用於正向和反向提示詞):

Load Checkpoint(加載模型)

加載你的 AI 模型。一個 checkpoint 通常包含三個組件:

組件作用
MODEL (UNet)在擴散過程中預測和去除噪聲
CLIP將文字提示轉換為模型能理解的數值向量
VAE在潛空間和像素空間之間轉換

Empty Latent Image(空白潛像)

設定畫布尺寸。這個節點創建一個充滿隨機噪聲的空白潛空間 — 生成過程的起點。寬高決定了最終圖片的尺寸。

SD1.5 建議使用 512×512 以獲得最佳效果。

CLIP Text Encode(文字編碼,需要兩個)

一個用於正向提示(你想要的),一個用於反向提示(你想避免的)。CLIP 編碼器將文字轉換為語義向量來引導去噪過程。

KSampler(採樣器)

工作流的核心。它接收噪聲潛像、模型和提示條件,然後通過多步迭代去噪生成圖像。

關鍵參數:

參數作用
seed隨機種子 — 相同的種子 + 相同的設置 = 相同的圖片
steps去噪迭代次數。越多細節越好,但生成越慢
cfg模型遵循提示的程度。太低會忽略提示,太高會出現瑕疵
denoise噪聲強度。文生圖保持 1.0(從純噪聲完全生成)

VAE Decode(VAE 解碼)

將去噪後的潛像轉換回可查看的圖片。

Save Image(保存圖片)

顯示並保存結果到 ComfyUI/output 文件夾。

寫好提示詞

好的提示詞對輸出質量影響巨大。以下是 SD1.5 的實用技巧:

建議:

  • 儘量使用英文以獲得最佳效果
  • 用逗號分隔短語,不要寫長句子
  • 具體描述:"golden sunset over calm ocean" 比 "nice landscape" 好得多
  • 加入質量提升詞:masterpiece, best quality, highly detailed
  • 用權重強調重點:(golden hour:1.2) 讓這個概念更突出

避免:

  • 寫長段落 — 模型對簡潔關鍵詞的反應更好
  • 忘記反向提示 — 它們對避免常見瑕疵非常重要

示例:動漫風格

正向提示:

anime style, 1girl, long pink hair, cherry blossom background,
soft lighting, intricate details, masterpiece, best quality

反向提示:

low quality, blurry, deformed hands, extra fingers

示例:寫實人像

正向提示:

(ultra realistic portrait:1.3), elegant woman,
soft cinematic lighting, (golden hour:1.2),
shallow depth of field, (skin texture:1.3),
warm color grading

反向提示:

deformed, cartoon, anime, plastic skin, overexposed,
blurry, extra fingers

原理簡述

文生圖是一個逆向擴散過程:

  1. 從潛空間中的純隨機噪聲開始
  2. 模型在每一步預測需要去除的噪聲
  3. 你的文字提示(編碼為向量)引導去噪方向
  4. 所有步驟完成後,VAE 將結果解碼為像素圖像

潛空間是一種壓縮的數學表示 — 比實際圖像小得多。這就是為什麼擴散模型能在消費級硬件上運行。可以理解為先畫草稿(潛空間)再完成最終作品(像素)。

關於 SD1.5

Stable Diffusion 1.5 是使用最廣泛的開源圖像生成模型之一:

  • 大小: 約 4 GB — 可在 6 GB 以上顯存的 GPU 上運行
  • 最佳分辨率: 512×512
  • 生態: 大量的 LoRA、ControlNet 和社區微調模型
  • 侷限性: 手部、複雜光照可能出問題,超過 512px 質量下降

常見問題和解決方法

出圖模糊、質量低

  • 增加步數 — 嘗試 25–30 步,而非默認的 20
  • 提高 cfg — 嘗試 7–9 以增強提示詞的影響力
  • 加入質量關鍵詞 — 正向提示中加入 masterpiece, best quality, highly detailed, 4k
  • 檢查分辨率 — SD1.5 在 512×512 效果最佳。直接生成更高分辨率往往會降低質量

手部和手指變形

這是 SD1.5 的已知侷限。緩解方法:

  • 反向提示中加入 deformed hands, extra fingers, bad anatomy
  • 使用修手 LoRA(如 Civitai 上的 "detail tweaker" 或 "hand fix")
  • 生成 512×512 後再放大

出圖完全不符合提示詞

  • cfg 太低 — 提高到 7–12 讓模型更緊密跟隨提示
  • 概念太多 — 精簡提示詞。少而精的關鍵詞比長段描述效果更好
  • 模型不匹配 — 一些模型針對特定風格微調過,動漫模型不擅長寫實風格

Load Checkpoint 顯示 null 或空

  • 確認 .safetensors 文件在 ComfyUI/models/checkpoints/ 中
  • 刷新 ComfyUI(F5)或重啟
  • 檢查文件是否損壞(下載不完整)

生成速度很慢

  • 顯存不足 — 啟動時加 --lowvram 參數
  • 步數太多 — 快速迭代用 20 步就夠,30+ 步留給最終渲染
  • 分辨率太大 — 用 512×512 生成後再放大,不要直接生成 1024×1024

下一步

  • 圖生圖 — 用參考圖引導生成
  • LoRA 指南 — 用輕量模型適配器微調輸出
  • 圖片放大指南 — 用 AI 放大提升分辨率

先按上面的步驟定位根因。還卡住時,可以下載 Wonderful Launcher 檢查目前機器;啟動器原生修復、任務日誌和執行階段檢查會集中在一起。credits 只用於圖片生成和按量工具。

下載 Wonderful Launcher查看 credits 方案

這篇文件解決了你的問題嗎?

你的回饋會幫助我們優先補強真實 ComfyUI 排障文件。

目錄

什麼是文生圖?
準備工作
工作流節點詳解
Load Checkpoint(加載模型)
Empty Latent Image(空白潛像)
CLIP Text Encode(文字編碼,需要兩個)
KSampler(採樣器)
VAE Decode(VAE 解碼)
Save Image(保存圖片)
寫好提示詞
示例:動漫風格
示例:寫實人像
原理簡述
關於 SD1.5
常見問題和解決方法
出圖模糊、質量低
手部和手指變形
出圖完全不符合提示詞
Load Checkpoint 顯示 null 或空
生成速度很慢
下一步