為什麼是腹肌貓咪?
這個讀書會主題其實很嚴肅:文生圖模型從 2022 到 2025 的技術演進。但切入點故意選一個很不嚴肅的角色,因為它是最好的壓力測試。
貓存在,腹肌也存在;但「有六塊腹肌、站得像人、又保留貓頭特徵的角色」不是常見訓練資料。模型要畫對,必須組合物種、人體結構、攝影語境與服裝常識。
模型怎麼知道你要的是腹肌貓咪,不是炸雞?
Stable Diffusion、SDXL、FLUX 這類工具的核心大多是擴散模型:從一團雜訊開始,一步步降噪,最後生成一張清楚的圖。
但擴散模型本身不懂文字。它需要一個中間人,把 prompt 翻譯成圖像模型看得懂的指令。這個中間人的品質,決定了模型到底能不能抓住「腹肌貓咪」這種混合概念。
為什麼選它當測試?
因為它不能靠死背。傳統模型看過很多貓,也看過很多腹肌,但它未必看過這兩件事的正確組合。這會逼模型處理三層問題:語意理解、局部結構、世界常識。
- 語意理解:知道 anthropomorphic cat 不是戴貓耳的人。
- 局部結構:知道 six-pack abs 是腹部肌肉結構,不是毛色紋理。
- 世界常識:知道寫實攝影情境中,角色即使 shirtless,也應該有合理下著。
正確的腹肌貓咪長什麼樣?
原講題先用 Google Flow × Nano Banana(Gemini 2.5 Flash Image)當 ground truth。它做對的不是單一視覺風格,而是「組合邏輯」。
這張圖重要的地方在於:它不是單純把貓和腹肌貼在一起,而是把 prompt 裡的關係讀成一個合理角色。
Nano Banana 憑什麼做得到?CLIP 差在哪?
用職場比喻最好懂:客戶是你的 prompt,CLIP 是窗口,Diffusion Model 是設計師。問題在於,CLIP 這個窗口常常只抓到大概語意,交給設計師時細節已經失真。
| 角色 | 對應模組 | 做什麼 |
|---|---|---|
| 客戶 | Prompt | 提出需求。 |
| 窗口 | CLIP / Text Encoder | 把文字轉成模型可用的語意向量。 |
| 設計師 | Diffusion Model | 真正生成圖片。 |
Nano Banana 的差異是:它不是用一個獨立窗口轉譯 prompt,而是原生多模態模型本體直接讀文字、理解圖片語境、再生成 image tokens。中間少一段接力,語意損耗就小很多。
這個 prompt 為什麼要這樣寫?
| 關鍵字 | 為什麼重要 |
|---|---|
| anthropomorphic cat | 避免畫成普通四足貓。 |
| standing upright | 要求角色站得像人,腹部才會可見。 |
| clearly defined six-pack abs | 要求腹肌線條明確,不是毛色暗影。 |
| shirtless | 避免模型給角色穿上衣遮掉考點。 |
| cat head with detailed fur | 避免跑成戴貓耳的人。 |
| full body shot, studio lighting | 控制構圖與光線,方便比較模型差異。 |
SDXL 實際跑出什麼?為什麼?
這就是純 CLIP 時代的典型特徵:長 prompt 被壓成一團粗糙語意雲。模型知道「貓」「腹肌」「站立」「攝影」大概相關,但不保證每個局部關係都正確綁定。
所以每次生成都像擲骰子。好的 seed 可能碰巧把概念拼對;壞的 seed 可能直接退回訓練資料裡更常見的普通貓。
CLIP 到底是什麼?怎麼學的?
CLIP 全名 Contrastive Language-Image Pre-training。它不是傳統分類器,不是被人類標註「這是貓」「這是狗」教出來的,而是從大量圖片與文字配對中學會:哪段文字和哪張圖片應該靠近。
| 做法 | 傳統監督式分類 | CLIP 對比學習 |
|---|---|---|
| 資料來源 | 人工標註類別,例如「貓」「狗」。 | 網路上的圖片與旁邊文字,例如 alt text、圖說、網頁上下文。 |
| 學習目標 | 把圖片分到固定類別。 | 讓正確的圖文配對靠近,錯誤配對遠離。 |
| 輸出方式 | 固定分類器。 | 共同嵌入空間,可拿任意文字當候選答案。 |
| 反直覺點 | 人類先定義類別。 | CLIP 不是被手把手教「什麼是貓」,而是從配對裡自己學相似度。 |
它怎麼學?
- 收集大量圖片與旁邊文字,例如 alt text、圖說、網頁上下文。
- 把圖片與文字都映射到共同嵌入空間。
- 用對比學習讓正確配對靠近、錯誤配對推開。
有 Transformer,為什麼還不夠聰明?
因為架構一樣,不代表訓練目標一樣。CLIP 的目標是「區分照片和圖說是否配對」,不是像語言模型一樣一路預測下一個 token。Next token prediction 會逼模型學語法、因果、常識與長距離關係;CLIP 只要抓到大方向就能拿高分。
| 比較 | CLIP | LLM / VLM |
|---|---|---|
| 訓練目標 | 圖文配對相似度。 | 文字序列預測、多模態推理或圖文共同理解。 |
| 資料深度 | 大量短圖說,常是粗略描述。 | 長文本、對話、程式、圖像語境與更完整知識。 |
| 長 prompt | 容易壓成語意雲。 | 比較能保留句法、條件和局部關係。 |
為什麼它能零樣本分類?
給 CLIP 一張圖,再給幾個候選描述,它可以算圖像向量和文字向量誰最接近。這就是「不用重訓分類器,也能拿文字當類別」的核心。
考古題 ①:CLIP 能達成零樣本分類的關鍵,是圖文對比式學習與共同嵌入空間。
為什麼 CLIP 會畫出六根手指?
CLIP 是「差不多先生」。它知道某個區域應該像手,但不一定知道手的結構約束:五根手指、拇指位置、指節角度。它也知道 Logo 和文字大概存在,但不保證字母與顏色精準對上。
講得更準確一點:CLIP 會把整句 prompt 壓成一團粗略的語意雲。語意雲裡有「貓」「腹肌」「站立」「攝影」這些方向,但不一定保留「腹肌必須在軀幹上」「貓頭要連著人型身體」「shirtless 不代表下半身全裸」這種局部綁定。
| 症狀 | 例子 | 根源 |
|---|---|---|
| 顏色綁錯物件 | red cube + blue sphere 變成藍方塊紅球 | 局部語意未對齊 |
| 數量失準 | three apples 畫出 2 顆或 4 顆 | 數量結構沒有穩定保留 |
| 手指異常 | 六根手指、手勢扭曲 | 知道「像手」,但不懂骨架限制 |
| 文字亂碼 | 品牌標誌寫錯字 | 只抓語意,不會逐字排版 |
考古題 ②:品牌標誌顏色誤差或人物手部姿勢不自然,最可能原因是 CLIP 的文字與影像編碼器在語意空間未充分對齊。
注意:這不是「模型沒有損失函數」,也不是訓練時隨機梯度漂移;題目描述的是推論時的語意對齊失敗。
FLUX 怎麼改進?
FLUX 是介於 SDXL 和 Nano Banana 中間的過渡期:窗口還在,但窗口被升級了。
FLUX.1:CLIP + T5
T5 能吃更長文字,也比較保留句法結構,所以比純 CLIP 更能讀懂長 prompt。但它仍是外接窗口,設計師和窗口之間還有接力損耗。
FLUX.2:Mistral VLM
窗口換成真正讀過圖文的視覺語言模型,理解力與審美都更強。不過它仍會把訓練資料裡常見的視覺習慣帶進結果,例如擬人角色下半身保留動物特徵。
Transformer 出現前有多模態嗎?
有,但多半是拼裝式。早期做法像是 CNN 看圖、RNN 產生描述,或 CNN 看圖、RNN 回答問題。它能完成單一任務,但泛化能力弱。
Transformer 之後,自注意力機制可以把圖片不同區域和句子不同詞互相關聯,多模態才真正起飛。2021 的 CLIP 是重要轉折,2022 的 Stable Diffusion 接上生圖,2025 的 Nano Banana 則把理解與生成收進同一套模型。
為什麼 Google 狂推多模態和世界模型?
世界模型指的是:AI 能在內部模擬、預測真實世界如何運作。它不只要會回文字,還要理解物理、因果、時空、動作一致性。
所以多模態不是炫技,而是地基。現實世界本來就是視覺、語言、聲音、動作混在一起;如果模型只讀文字,它很難真的理解「角色該站在哪裡」「物體該怎麼掉落」「一個動作接下一個動作是否合理」。
| 產品線 | 對應世界模型的哪一塊 |
|---|---|
| Gemini | 多模態理解:文字、圖、音、影片、程式統一處理。 |
| Veo | 影片生成:必須懂物理與動作一致性。 |
| Genie | 生成可互動世界,往模擬環境靠近。 |
| Nano Banana | 能寫對文字、合理補全情境,是世界常識的早期線索。 |
| Project Astra | 即時看見周遭世界並回應。 |
多模態不是世界模型,但多模態是必要地基。現實世界本來就是多感官的;AI 要懂世界,就不能只讀文字。
Nano Banana 會補合理衣著,不是因為訓練資料裡有很多同款角色,而是模型開始帶著世界常識讀 prompt:寫實攝影情境裡,全裸通常不合理。這就是世界模型的早期線索。
三年的躍進,到底躍進在哪?
不是設計師變厲害,是窗口從有,到變聰明,再到被消滅。
| 世代 | 代表 | Text Encoder | 狀態 |
|---|---|---|---|
| 純 CLIP | SDXL | CLIP 雙編碼器 | 腦霧窗口,結果像擲骰子。 |
| CLIP + T5 | FLUX.1 | CLIP-L + T5-XXL | 窗口加翻譯助理。 |
| LLM / VLM | FLUX.2 | Mistral 24B VLM | 窗口換成會看圖讀文的模型。 |
| 原生多模態 | Nano Banana | 無獨立 encoder | 沒有窗口,理解與生成合流。 |
最後要記的三件事
- 畫家本身有進步,但最大躍升來自 text encoder 與多模態理解。
- CLIP 的強項是搜尋與零樣本分類,不是精準局部結構。
- 文生圖下一站不是單純畫更漂亮,而是往能理解世界的模型走。