iPAS Study Club

腹肌貓咪帶你看文生圖的三年演進


從 CLIP 到 Nano Banana,重點不是「圖片模型突然變神」,而是文字理解的中間窗口一路升級,最後被原生多模態模型吃掉。

INTRO

為什麼是腹肌貓咪?

這個讀書會主題其實很嚴肅:文生圖模型從 2022 到 2025 的技術演進。但切入點故意選一個很不嚴肅的角色,因為它是最好的壓力測試。

貓存在,腹肌也存在;但「有六塊腹肌、站得像人、又保留貓頭特徵的角色」不是常見訓練資料。模型要畫對,必須組合物種、人體結構、攝影語境與服裝常識。

Q1

模型怎麼知道你要的是腹肌貓咪,不是炸雞?

Stable Diffusion、SDXL、FLUX 這類工具的核心大多是擴散模型:從一團雜訊開始,一步步降噪,最後生成一張清楚的圖。

但擴散模型本身不懂文字。它需要一個中間人,把 prompt 翻譯成圖像模型看得懂的指令。這個中間人的品質,決定了模型到底能不能抓住「腹肌貓咪」這種混合概念。

Q2

為什麼選它當測試?

因為它不能靠死背。傳統模型看過很多貓,也看過很多腹肌,但它未必看過這兩件事的正確組合。這會逼模型處理三層問題:語意理解、局部結構、世界常識。

  • 語意理解:知道 anthropomorphic cat 不是戴貓耳的人。
  • 局部結構:知道 six-pack abs 是腹部肌肉結構,不是毛色紋理。
  • 世界常識:知道寫實攝影情境中,角色即使 shirtless,也應該有合理下著。
Q3

正確的腹肌貓咪長什麼樣?

原講題先用 Google Flow × Nano Banana(Gemini 2.5 Flash Image)當 ground truth。它做對的不是單一視覺風格,而是「組合邏輯」。

Nano Banana 生成的腹肌貓咪範例
Nano Banana 版:人型身體、貓頭、清楚腹肌、合理短褲,四個條件同時成立。

這張圖重要的地方在於:它不是單純把貓和腹肌貼在一起,而是把 prompt 裡的關係讀成一個合理角色。

Q4

Nano Banana 憑什麼做得到?CLIP 差在哪?

用職場比喻最好懂:客戶是你的 prompt,CLIP 是窗口,Diffusion Model 是設計師。問題在於,CLIP 這個窗口常常只抓到大概語意,交給設計師時細節已經失真。

角色對應模組做什麼
客戶Prompt提出需求。
窗口CLIP / Text Encoder把文字轉成模型可用的語意向量。
設計師Diffusion Model真正生成圖片。

Nano Banana 的差異是:它不是用一個獨立窗口轉譯 prompt,而是原生多模態模型本體直接讀文字、理解圖片語境、再生成 image tokens。中間少一段接力,語意損耗就小很多。

Q5

這個 prompt 為什麼要這樣寫?

A realistic anthropomorphic cat standing upright like a human, muscular body with clearly defined six-pack abs, shirtless, cat head with detailed fur, full body shot, studio lighting
腹肌貓咪 prompt 拆解示意圖片
原講題中用 prompt 拆解圖片說明每個關鍵詞的作用。
關鍵字為什麼重要
anthropomorphic cat避免畫成普通四足貓。
standing upright要求角色站得像人,腹部才會可見。
clearly defined six-pack abs要求腹肌線條明確,不是毛色暗影。
shirtless避免模型給角色穿上衣遮掉考點。
cat head with detailed fur避免跑成戴貓耳的人。
full body shot, studio lighting控制構圖與光線,方便比較模型差異。
Q6

SDXL 實際跑出什麼?為什麼?

SDXL 三次生成腹肌貓咪的不同結果
同一個 prompt 跑三次,SDXL 結果差異很大:有時像擬人,有時像四足貓,有時幾乎忽略 prompt。

這就是純 CLIP 時代的典型特徵:長 prompt 被壓成一團粗糙語意雲。模型知道「貓」「腹肌」「站立」「攝影」大概相關,但不保證每個局部關係都正確綁定。

所以每次生成都像擲骰子。好的 seed 可能碰巧把概念拼對;壞的 seed 可能直接退回訓練資料裡更常見的普通貓。

Q7

CLIP 到底是什麼?怎麼學的?

CLIP 全名 Contrastive Language-Image Pre-training。它不是傳統分類器,不是被人類標註「這是貓」「這是狗」教出來的,而是從大量圖片與文字配對中學會:哪段文字和哪張圖片應該靠近。

做法傳統監督式分類CLIP 對比學習
資料來源人工標註類別,例如「貓」「狗」。網路上的圖片與旁邊文字,例如 alt text、圖說、網頁上下文。
學習目標把圖片分到固定類別。讓正確的圖文配對靠近,錯誤配對遠離。
輸出方式固定分類器。共同嵌入空間,可拿任意文字當候選答案。
反直覺點人類先定義類別。CLIP 不是被手把手教「什麼是貓」,而是從配對裡自己學相似度。

它怎麼學?

  1. 收集大量圖片與旁邊文字,例如 alt text、圖說、網頁上下文。
  2. 把圖片與文字都映射到共同嵌入空間。
  3. 用對比學習讓正確配對靠近、錯誤配對推開。

有 Transformer,為什麼還不夠聰明?

因為架構一樣,不代表訓練目標一樣。CLIP 的目標是「區分照片和圖說是否配對」,不是像語言模型一樣一路預測下一個 token。Next token prediction 會逼模型學語法、因果、常識與長距離關係;CLIP 只要抓到大方向就能拿高分。

比較CLIPLLM / VLM
訓練目標圖文配對相似度。文字序列預測、多模態推理或圖文共同理解。
資料深度大量短圖說,常是粗略描述。長文本、對話、程式、圖像語境與更完整知識。
長 prompt容易壓成語意雲。比較能保留句法、條件和局部關係。

為什麼它能零樣本分類?

給 CLIP 一張圖,再給幾個候選描述,它可以算圖像向量和文字向量誰最接近。這就是「不用重訓分類器,也能拿文字當類別」的核心。

考古題 ①:CLIP 能達成零樣本分類的關鍵,是圖文對比式學習與共同嵌入空間。

Q8

為什麼 CLIP 會畫出六根手指?

CLIP 是「差不多先生」。它知道某個區域應該像手,但不一定知道手的結構約束:五根手指、拇指位置、指節角度。它也知道 Logo 和文字大概存在,但不保證字母與顏色精準對上。

講得更準確一點:CLIP 會把整句 prompt 壓成一團粗略的語意雲。語意雲裡有「貓」「腹肌」「站立」「攝影」這些方向,但不一定保留「腹肌必須在軀幹上」「貓頭要連著人型身體」「shirtless 不代表下半身全裸」這種局部綁定。

症狀例子根源
顏色綁錯物件red cube + blue sphere 變成藍方塊紅球局部語意未對齊
數量失準three apples 畫出 2 顆或 4 顆數量結構沒有穩定保留
手指異常六根手指、手勢扭曲知道「像手」,但不懂骨架限制
文字亂碼品牌標誌寫錯字只抓語意,不會逐字排版

考古題 ②:品牌標誌顏色誤差或人物手部姿勢不自然,最可能原因是 CLIP 的文字與影像編碼器在語意空間未充分對齊。

注意:這不是「模型沒有損失函數」,也不是訓練時隨機梯度漂移;題目描述的是推論時的語意對齊失敗。

Q9

FLUX 怎麼改進?

FLUX 是介於 SDXL 和 Nano Banana 中間的過渡期:窗口還在,但窗口被升級了。

FLUX.1 生成腹肌貓咪的結果
FLUX.1:CLIP 加 T5,語句理解變好,但仍有字面理解與情境補全問題。
FLUX.2 生成腹肌貓咪的結果
FLUX.2:換成更強的 VLM,肌肉與結構更穩,但仍保留某些典型視覺偏好。

FLUX.1:CLIP + T5

T5 能吃更長文字,也比較保留句法結構,所以比純 CLIP 更能讀懂長 prompt。但它仍是外接窗口,設計師和窗口之間還有接力損耗。

FLUX.2:Mistral VLM

窗口換成真正讀過圖文的視覺語言模型,理解力與審美都更強。不過它仍會把訓練資料裡常見的視覺習慣帶進結果,例如擬人角色下半身保留動物特徵。

Q10

Transformer 出現前有多模態嗎?

有,但多半是拼裝式。早期做法像是 CNN 看圖、RNN 產生描述,或 CNN 看圖、RNN 回答問題。它能完成單一任務,但泛化能力弱。

Transformer 之後,自注意力機制可以把圖片不同區域和句子不同詞互相關聯,多模態才真正起飛。2021 的 CLIP 是重要轉折,2022 的 Stable Diffusion 接上生圖,2025 的 Nano Banana 則把理解與生成收進同一套模型。

Q11

為什麼 Google 狂推多模態和世界模型?

世界模型指的是:AI 能在內部模擬、預測真實世界如何運作。它不只要會回文字,還要理解物理、因果、時空、動作一致性。

所以多模態不是炫技,而是地基。現實世界本來就是視覺、語言、聲音、動作混在一起;如果模型只讀文字,它很難真的理解「角色該站在哪裡」「物體該怎麼掉落」「一個動作接下一個動作是否合理」。

產品線對應世界模型的哪一塊
Gemini多模態理解:文字、圖、音、影片、程式統一處理。
Veo影片生成:必須懂物理與動作一致性。
Genie生成可互動世界,往模擬環境靠近。
Nano Banana能寫對文字、合理補全情境,是世界常識的早期線索。
Project Astra即時看見周遭世界並回應。

多模態不是世界模型,但多模態是必要地基。現實世界本來就是多感官的;AI 要懂世界,就不能只讀文字。

Nano Banana 會補合理衣著,不是因為訓練資料裡有很多同款角色,而是模型開始帶著世界常識讀 prompt:寫實攝影情境裡,全裸通常不合理。這就是世界模型的早期線索。

Q12

三年的躍進,到底躍進在哪?

不是設計師變厲害,是窗口從有,到變聰明,再到被消滅。

世代代表Text Encoder狀態
純 CLIPSDXLCLIP 雙編碼器腦霧窗口,結果像擲骰子。
CLIP + T5FLUX.1CLIP-L + T5-XXL窗口加翻譯助理。
LLM / VLMFLUX.2Mistral 24B VLM窗口換成會看圖讀文的模型。
原生多模態Nano Banana無獨立 encoder沒有窗口,理解與生成合流。

最後要記的三件事

  • 畫家本身有進步,但最大躍升來自 text encoder 與多模態理解。
  • CLIP 的強項是搜尋與零樣本分類,不是精準局部結構。
  • 文生圖下一站不是單純畫更漂亮,而是往能理解世界的模型走。