SD 架構一句話
Stable Diffusion 就像一個畫家團隊:CLIP 是翻譯官,U-Net 是畫家本人,VAE 是印刷機,LoRA 是外掛技能包。
擴散模型怎麼從一團噪音變成一張圖?
擴散模型的核心不是「憑空畫圖」,而是學會一個反向過程:訓練時看過大量「清楚圖片被逐步加噪」的例子,生成時就反過來,從亂數噪聲開始,一步一步把不該存在的噪聲擦掉。
讀書會的演示方式是固定 prompt 和 seed,只改 Steps。這樣大家看到的差異就不是「運氣」,而是取樣步數本身造成的。
| 控制項 | 讀書會白話 | 考試要抓的點 |
|---|---|---|
| Steps | 擦幾次噪聲。太少會模糊,太多開始收益遞減。 | 生成階段想提升清晰度,先看取樣步數。 |
| Sampler | 用哪種數學路線擦噪聲。有的快,有的穩,有的細。 | 和 Steps 一起影響生成品質,不是 prompt 聽話程度。 |
| Checkpoint | 換一個大模型就像換一位畫家,風格與能力都會變。 | 不要把模型風格差異誤判成單一參數造成。 |
考試怎麼抓?
題目如果問「生成圖有顆粒感或模糊,僅在生成階段調整,怎麼提升清晰度?」優先看取樣步數與取樣器。Steps 太少就是去噪不夠;Sampler 是用什麼數學路線去擦噪聲。
考古題 #38:SD 生圖顆粒感與模糊,較合理的修法是增加取樣步數並選擇高品質取樣器。
陷阱:提高 CFG 不是解清晰度,它解的是「多聽 prompt」。
CFG 是什麼?AI 有多聽你的話?
CFG 全名是 Classifier-Free Guidance,可以把它想成「聽話旋鈕」。數值低,模型比較自由發揮;數值高,模型更用力貼近 prompt。但過高會讓畫面過飽和、僵硬,甚至變形。
| 參數 | 數值高 | 數值低 | 常見甜蜜點 |
|---|---|---|---|
| CFG | 越聽 prompt,過高會怪 | 越自由,可能偏題 | 7 到 8 |
| Temperature | 越放飛,過高會胡說 | 越保守 | 0.7 到 0.8 |
所以 CFG 和語言模型的 Temperature 方向剛好相反。這是讀書會現場最容易「喔原來如此」的點。
為什麼你的筆電跑得動 AI 畫圖?
答案是 VAE。Stable Diffusion 不直接在 512×512×3 的巨大像素空間中去噪,而是先把圖片壓進 64×64 的潛在空間。U-Net 在小空間裡工作,最後再由 VAE 解碼回成品圖。
這就是它叫 Latent Diffusion Model 的原因:真正的去噪發生在「壓縮後的潛在空間」,不是你最後看到的像素空間。
VAE 到 2026 還能幹嘛?
| 場景 | 為什麼還需要 VAE |
|---|---|
| SD / FLUX 類生圖模型 | 仍然需要壓縮與解碼,讓去噪工作在低維空間完成。 |
| 異常偵測 | 模型學會正常資料的潛在分布,重建失敗處常是異常線索。 |
| 藥物與分子設計 | 把複雜結構壓成可探索的潛在空間,再搜尋可能解。 |
| 語音合成 | 像 VITS 這類系統會把 VAE 與其他生成模型結合,做端到端語音生成。 |
VAE 在考題裡通常長怎樣?
VAE 會跟 GAN、Diffusion 放在一起考。抓關鍵字就好:VAE 是顯式潛在變數建模,擅長捕捉整體語意結構,但生成解析度有限、容易模糊。
考古題 #40:VAE / GAN / Diffusion 的差異。看到「顯式潛在變數建模」「解析度有限」通常就是 VAE。
AI 是怎麼「聽懂」你打的文字的?
擴散模型本身不懂文字,它需要 CLIP 把 prompt 轉成語意向量。CLIP 的訓練方式叫圖文對比學習:把圖片和文字放到共同嵌入空間,正確配對拉近,錯誤配對推遠。
這也是為什麼 CLIP 很適合圖片搜尋、影像自動標註、零樣本分類。你不必替每張圖重訓分類器,只要用文字描述去空間裡找相似的圖片。
| CLIP 任務 | 擅長程度 | 原因 |
|---|---|---|
| 圖片搜尋 | 強 | 文字和圖片在同一個嵌入空間,適合用相似度找圖。 |
| 自動標註 | 強 | 可把候選標籤當文字描述,做零樣本分類。 |
| 文字渲染 | 弱 | 它知道「有字」,但不會逐筆理解字形。 |
| 局部結構綁定 | 弱 | 長 prompt 容易被壓成粗略語意雲,關係會鬆掉。 |
那 CLIP 的弱點是什麼?
CLIP 學到的是語意,不是精準結構。它知道「有一個招牌寫著 iPAS」,但常常不知道每個字該怎麼一筆一畫排出來;它也知道「有手」,但不保證手指數量與骨架對。
考古題 #35:媒體公司導入 CLIP 做影像自動標註與搜尋,關鍵是圖文對比式學習與共同嵌入空間。
考古題 #50:手指、Logo、文字與顏色跑掉,常見根源是文字與影像編碼器在語意空間未充分對齊。
CLIP 在生圖領域怎麼被取代?
| 時期 | 文字理解方式 | 典型結果 |
|---|---|---|
| 2022-2023 | CLIP text encoder | 能抓大方向,但文字、手部、Logo 容易崩。 |
| 2023 | 雙 CLIP | SDXL 比 SD 1.5 穩,但長 prompt 仍常掉細節。 |
| 2024 | CLIP + T5 / 純 T5 | 英文 prompt 改善,句法保留更好。 |
| 2025 | LLM / 原生多模態 | 文字理解和生成開始進入同一個大模型語境。 |
怎麼不用重訓模型就能教 AI 新風格?
LoRA 是低成本微調外掛。你不需要重新訓練整個 U-Net,只要用很小的權重檔,讓原本的大模型學會某個角色、畫風或概念。
讀書會演示的重點是:同一個 prompt、同一個 seed,只是掛上不同 LoRA,畫面風格就會大幅改變。這是遷移學習與 fine-tuning 最直覺的實物版。
| 做法 | 成本感 | 適合什麼 |
|---|---|---|
| 重訓大模型 | 最貴,資料、GPU、時間都重。 | 要改變模型底層能力時才考慮。 |
| Fine-tuning | 中等成本,調整範圍較大。 | 特定領域、特定任務微調。 |
| LoRA | 相對輕量,常見檔案只有數十到百 MB。 | 風格、角色、產品視覺、特定畫法。 |
考試連結:題目問「資料量少,想讓既有模型學新任務」時,優先想到遷移學習、微調、LoRA。
考古題速查總表
| 題號 | 核心考點 | 讀書會對應段落 |
|---|---|---|
| #35 | CLIP 零樣本分類、共同嵌入空間、影像搜尋 | Q4 |
| #38 | 取樣步數、取樣器、CFG 陷阱 | Q1、Q2 |
| #40 | VAE 顯式潛在變數建模、生成解析度有限 | Q3 |
| #50 | CLIP 對齊偏差、擴散去噪限制 | Q4 |
| 資料少題型 | 遷移學習、Fine-tuning、LoRA | Q5 |