iPAS Study Club

從 SD 畫圖過程看擴散模型的運作


這不是 Stable Diffusion 操作筆記而已。它是一份把生圖旋鈕對回 iPAS 考點的 QA 講義:每次只改一個參數,看畫面怎麼變,順手把考題陷阱拆掉。

OVERVIEW

SD 架構一句話

Stable Diffusion 就像一個畫家團隊:CLIP 是翻譯官,U-Net 是畫家本人,VAE 是印刷機,LoRA 是外掛技能包。

Prompt你用自然語言提出需求。
CLIP把文字翻成圖像模型聽得懂的向量。
U-Net在潛在空間逐步預測噪聲、反覆去噪。
VAE把壓縮草稿解碼成可見圖片。
LoRA不用重訓整個模型,就能加新風格。
Q1

擴散模型怎麼從一團噪音變成一張圖?

擴散模型的核心不是「憑空畫圖」,而是學會一個反向過程:訓練時看過大量「清楚圖片被逐步加噪」的例子,生成時就反過來,從亂數噪聲開始,一步一步把不該存在的噪聲擦掉。

讀書會的演示方式是固定 prompt 和 seed,只改 Steps。這樣大家看到的差異就不是「運氣」,而是取樣步數本身造成的。

a handsome man with six pack abs, beach background, professional photo
控制項讀書會白話考試要抓的點
Steps擦幾次噪聲。太少會模糊,太多開始收益遞減。生成階段想提升清晰度,先看取樣步數。
Sampler用哪種數學路線擦噪聲。有的快,有的穩,有的細。和 Steps 一起影響生成品質,不是 prompt 聽話程度。
Checkpoint換一個大模型就像換一位畫家,風格與能力都會變。不要把模型風格差異誤判成單一參數造成。
Stable Diffusion 取樣步數 1 的生成結果
Steps 1:幾乎還是噪聲,只能看到大概色塊。
Stable Diffusion 取樣步數 6 的生成結果
Steps 6:主體開始成形,但細節鬆散。
Stable Diffusion 取樣步數 12 的生成結果
Steps 12:輪廓與光影已經穩定許多。
Stable Diffusion 取樣步數 25 的生成結果
Steps 25:畫面清楚,但再增加通常只剩收益遞減。

考試怎麼抓?

題目如果問「生成圖有顆粒感或模糊,僅在生成階段調整,怎麼提升清晰度?」優先看取樣步數與取樣器。Steps 太少就是去噪不夠;Sampler 是用什麼數學路線去擦噪聲。

考古題 #38:SD 生圖顆粒感與模糊,較合理的修法是增加取樣步數並選擇高品質取樣器。

陷阱:提高 CFG 不是解清晰度,它解的是「多聽 prompt」。

iPAS 考古題 38 題目截圖
原講題中的 #38 考題截圖。
Q2

CFG 是什麼?AI 有多聽你的話?

CFG 全名是 Classifier-Free Guidance,可以把它想成「聽話旋鈕」。數值低,模型比較自由發揮;數值高,模型更用力貼近 prompt。但過高會讓畫面過飽和、僵硬,甚至變形。

CFG 2 的 Stable Diffusion 生圖結果
CFG 2:比較鬆,可能有創意,但容易偏題。
CFG 7 的 Stable Diffusion 生圖結果
CFG 7:常見甜蜜點,既貼題又不太緊繃。
CFG 24 的 Stable Diffusion 生圖結果
CFG 24:過度聽話,畫面容易用力過猛。
參數數值高數值低常見甜蜜點
CFG越聽 prompt,過高會怪越自由,可能偏題7 到 8
Temperature越放飛,過高會胡說越保守0.7 到 0.8

所以 CFG 和語言模型的 Temperature 方向剛好相反。這是讀書會現場最容易「喔原來如此」的點。

Q3

為什麼你的筆電跑得動 AI 畫圖?

答案是 VAE。Stable Diffusion 不直接在 512×512×3 的巨大像素空間中去噪,而是先把圖片壓進 64×64 的潛在空間。U-Net 在小空間裡工作,最後再由 VAE 解碼回成品圖。

這就是它叫 Latent Diffusion Model 的原因:真正的去噪發生在「壓縮後的潛在空間」,不是你最後看到的像素空間。

VAE 到 2026 還能幹嘛?

場景為什麼還需要 VAE
SD / FLUX 類生圖模型仍然需要壓縮與解碼,讓去噪工作在低維空間完成。
異常偵測模型學會正常資料的潛在分布,重建失敗處常是異常線索。
藥物與分子設計把複雜結構壓成可探索的潛在空間,再搜尋可能解。
語音合成像 VITS 這類系統會把 VAE 與其他生成模型結合,做端到端語音生成。

VAE 在考題裡通常長怎樣?

VAE 會跟 GAN、Diffusion 放在一起考。抓關鍵字就好:VAE 是顯式潛在變數建模,擅長捕捉整體語意結構,但生成解析度有限、容易模糊。

考古題 #40:VAE / GAN / Diffusion 的差異。看到「顯式潛在變數建模」「解析度有限」通常就是 VAE。

iPAS 考古題 40 題目截圖
原講題中的 #40 考題截圖。
Q4

AI 是怎麼「聽懂」你打的文字的?

擴散模型本身不懂文字,它需要 CLIP 把 prompt 轉成語意向量。CLIP 的訓練方式叫圖文對比學習:把圖片和文字放到共同嵌入空間,正確配對拉近,錯誤配對推遠。

這也是為什麼 CLIP 很適合圖片搜尋、影像自動標註、零樣本分類。你不必替每張圖重訓分類器,只要用文字描述去空間裡找相似的圖片。

CLIP 任務擅長程度原因
圖片搜尋文字和圖片在同一個嵌入空間,適合用相似度找圖。
自動標註可把候選標籤當文字描述,做零樣本分類。
文字渲染它知道「有字」,但不會逐筆理解字形。
局部結構綁定長 prompt 容易被壓成粗略語意雲,關係會鬆掉。

那 CLIP 的弱點是什麼?

CLIP 學到的是語意,不是精準結構。它知道「有一個招牌寫著 iPAS」,但常常不知道每個字該怎麼一筆一畫排出來;它也知道「有手」,但不保證手指數量與骨架對。

Stable Diffusion 文字渲染失敗的 iPAS 招牌示例
CLIP 失敗案例:模型知道要畫招牌,但文字本身變成亂碼。

考古題 #35:媒體公司導入 CLIP 做影像自動標註與搜尋,關鍵是圖文對比式學習與共同嵌入空間。

考古題 #50:手指、Logo、文字與顏色跑掉,常見根源是文字與影像編碼器在語意空間未充分對齊。

CLIP 在生圖領域怎麼被取代?

時期文字理解方式典型結果
2022-2023CLIP text encoder能抓大方向,但文字、手部、Logo 容易崩。
2023雙 CLIPSDXL 比 SD 1.5 穩,但長 prompt 仍常掉細節。
2024CLIP + T5 / 純 T5英文 prompt 改善,句法保留更好。
2025LLM / 原生多模態文字理解和生成開始進入同一個大模型語境。
iPAS 考古題 35 題目截圖
#35:CLIP 的企業應用。
iPAS 考古題 50 題目截圖
#50:語意對齊偏差。
Q5

怎麼不用重訓模型就能教 AI 新風格?

LoRA 是低成本微調外掛。你不需要重新訓練整個 U-Net,只要用很小的權重檔,讓原本的大模型學會某個角色、畫風或概念。

讀書會演示的重點是:同一個 prompt、同一個 seed,只是掛上不同 LoRA,畫面風格就會大幅改變。這是遷移學習與 fine-tuning 最直覺的實物版。

做法成本感適合什麼
重訓大模型最貴,資料、GPU、時間都重。要改變模型底層能力時才考慮。
Fine-tuning中等成本,調整範圍較大。特定領域、特定任務微調。
LoRA相對輕量,常見檔案只有數十到百 MB。風格、角色、產品視覺、特定畫法。
未套用 LoRA 的基準生成圖
基準圖:未套用 LoRA。
套用 pixel art LoRA 的生成圖
Pixel Art LoRA:同一主題變成像素風。
套用水墨 LoRA 的生成圖
墨心 LoRA:同一主題轉為水墨風。

考試連結:題目問「資料量少,想讓既有模型學新任務」時,優先想到遷移學習、微調、LoRA。

SUMMARY

考古題速查總表

題號核心考點讀書會對應段落
#35CLIP 零樣本分類、共同嵌入空間、影像搜尋Q4
#38取樣步數、取樣器、CFG 陷阱Q1、Q2
#40VAE 顯式潛在變數建模、生成解析度有限Q3
#50CLIP 對齊偏差、擴散去噪限制Q4
資料少題型遷移學習、Fine-tuning、LoRAQ5