Stable Diffusion 咒語(Prompt)是你用文字告訴 AI「要畫什麼」的指令,寫得越精準,出圖品質越高。本篇從基礎語法、權重調整、Negative Prompt 到進階 img2img 應用,搭配大量實際範例,幫你從新手快速進階成熟練的 AI 詠唱師。
看完本篇可以學到:
Stable Diffusion 是什麼?一分鐘認識 AI 繪圖工具
Stable Diffusion 是由 Stability AI 於 2022 年推出的開源 AI 圖像生成模型,使用者輸入文字描述(Prompt),AI 就能產出對應圖片。它基於潛在擴散模型(Latent Diffusion Model,LDM)技術,透過大量圖像數據訓練,讓 AI 學會理解文字與圖像之間的關係。
截至 2026 年,Stable Diffusion 已發展出多個版本:SD 1.5、SDXL、SD3,以及社群衍生的 Flux 模型。每個版本在圖像品質、解析度與提示詞理解能力上都有顯著進步。其中 SDXL 支援原生 1024×1024 解析度,SD3 則引入了 MMDiT 架構,大幅提升文字渲染與構圖能力。
與其他 AI 繪圖工具(如 Midjourney、DALL-E 3)相比,Stable Diffusion 最大優勢在於完全開源免費,且支援本地端運行,用戶對模型、數據與生成結果擁有完全控制權。
線上版 vs 電腦版:哪種方式適合你?
新手建議從線上版入門,熟悉後再轉電腦版以獲得完整功能與更快的出圖速度。兩種版本各有優缺,以下是詳細比較:
| 比較項目 | 線上版 | 電腦版(WebUI / ComfyUI) |
|---|---|---|
| 上手難度 | 低,開瀏覽器即用 | 中高,需安裝環境 |
| 硬體需求 | 無,雲端運算 | NVIDIA 顯卡 VRAM 6GB 以上 |
| 出圖速度 | 較慢(需排隊) | 快(取決於本地硬體) |
| 客製化程度 | 低 | 極高(支援 LoRA、ControlNet 等) |
| 模型選擇 | 有限 | 無限制,可自由載入 Checkpoint |
| 費用 | 免費或按量計費 | 免費(硬體成本另計) |
線上版推薦平台包括 Stable Diffusion Online、Civitai Generate、以及 Google Colab 雲端方案。電腦版目前主流介面有兩種:AUTOMATIC1111 WebUI 與 ComfyUI,後者採用節點式工作流,適合進階用戶。
Stable Diffusion 咒語基礎:Prompt 與 Negative Prompt
Prompt(正面提示詞)告訴 AI「要畫什麼」,Negative Prompt(負面提示詞)告訴 AI「不要畫什麼」,兩者搭配使用才能精準控制出圖結果。
撰寫 Prompt 時,建議按照以下結構分段組織:
- 品質詞:masterpiece, best quality, ultra detailed
- 主體描述:1 girl, solo, black dress, long hair
- 場景與動作:standing, indoors, Tokyo street, night
- 風格與光線:cinematic lighting, photorealistic, anime style
- 模型指令:LoRA 觸發詞(如有使用)
Negative Prompt 常見組合範例:
(worst quality, low quality:1.4), bad anatomy, bad hands, missing fingers, extra digits, blurry, watermark, text, signature
搭配社群開發的 Negative Embedding(如 EasyNegative、bad_prompt_version2),可以用一個觸發詞取代長串負面提示詞,大幅簡化操作。
實戰經驗:我在實際出圖時發現,Negative Prompt 對手部品質的影響遠大於正面提示詞。與其在 Prompt 裡寫 “perfect hands”,不如在 Negative Prompt 加入 “bad hands, missing fingers, extra digits”,再搭配 EasyNegative embedding,手指崩壞率能降低約 60-70%。這是多數新手忽略的關鍵技巧。
咒語權重調整語法:精準控制每個元素
透過權重語法,你可以強調或弱化特定關鍵字的影響力,讓 AI 更精準地呈現你要的畫面。以下是完整的權重調整語法表:
| 語法 | 效果 | 範例 |
|---|---|---|
(keyword) |
權重 x1.1 | (blue eyes) 稍微強調藍色眼睛 |
((keyword)) |
權重 x1.21 | ((long hair)) 明顯強調長髮 |
(((keyword))) |
權重 x1.33 | (((masterpiece))) 大幅提升品質 |
[keyword] |
權重 x0.91 | [glasses] 弱化眼鏡出現機率 |
(keyword:1.5) |
直接指定 1.5 倍權重 | (red dress:1.5) 精確控制紅色洋裝強度 |
(keyword:0.6) |
直接指定 0.6 倍權重 | (background:0.6) 降低背景影響 |
[A|B] |
A 與 B 交替融合 | [red|blue] hair 產出紅藍混色髮 |
權重建議控制在 0.5 至 1.8 之間。超過 2.0 容易導致圖像失真或出現色塊偽影。對於新手,建議先用括號語法微調,熟練後再使用精確數值控制。
人物特徵咒語大全:從髮型到服裝
人物描述是 Stable Diffusion 最常見的應用場景,掌握特徵關鍵字能讓角色細節更加到位。以下按類別整理常用咒語:
| 類別 | 常用關鍵字範例 |
|---|---|
| 髮型 | ponytail, bob cut, twin tails, braid, bun, pixie cut, wavy hair, straight hair |
| 髮色 | blonde, silver hair, pink hair, gradient hair, black hair, brown hair |
| 眼睛 | blue eyes, heterochromia, detailed eyes, glowing eyes, closed eyes |
| 表情 | smile, blush, shy, serious, crying, laughing, wink |
| 服裝 | school uniform, black dress, hoodie, armor, kimono, maid outfit, casual wear |
| 頭飾 | crown, headband, hair ribbon, tiara, beanie, flower hairpin |
| 體型 | slim, muscular, petite, tall, curvy |
以下是一組實際範例,展示人物特徵咒語的效果:
範例 Prompt:((masterpiece)), ((high quality)), realistic, ultra detail, 1 girl, solo, hoody, cute, look up, professional lighting, sitting, long hair, perfect body, blush, shy, short pants, outdoor, low angle
只要替換髮型、服裝等關鍵字,就能產出風格完全不同的角色。更多案例可參考 AI 電繪關鍵字查詢和大量實際案例。
咒語撰寫方式彙整:4 種核心語法
Stable Diffusion 的提示詞支援自然語言與關鍵字標籤兩種撰寫方式,以下是 4 種最常用的語法結構。
| 語法類型 | 說明 | 範例 |
|---|---|---|
| 關鍵詞分隔 | 使用英文逗號分隔不同標籤 | 1girl, long hair, London street, ponytail, wearing skirt |
| 要素混合 | 用 | 融合多個要素 |
1girl, |pink black hair|, ponytail |
| 權重調整 | 用括號或數值控制關鍵字強度 | (1girl:1.2), (bow headband:1.1), (queen dress:0.9) |
| 分步描述 | 指定關鍵詞從第幾步開始渲染 | [London_street:girl:10] 前 10 步畫街景,之後加入人物 |
實務上,大多數使用者以「關鍵詞分隔」為主,搭配「權重調整」微調細節。分步描述適合需要控制構圖層次的進階場景。
進階應用:img2img 圖生圖功能
img2img 是 Stable Diffusion 的核心進階功能,讓你以一張現有圖片為基礎,透過咒語指令進行局部或整體改造。這項功能適合以下場景:
- 更換人物服裝或背景
- 調整圖片風格(寫實轉動漫、動漫轉油畫)
- 修正 txt2img 產出的局部瑕疵
- 以手繪草稿為底,生成精緻成品
以下是一組實際案例,使用 img2img 將背景從巴黎公寓陽台換到紐約高樓:
使用咒語:on the top of building, new york skyline in the background, sunset


img2img 的關鍵參數是去噪強度(Denoising Strength):數值越高(接近 1.0),改動越大;數值越低(接近 0.1),越接近原圖。一般建議從 0.4-0.6 開始嘗試。
更多案例與詳細做法可以參考 Stable Diffusion img2img 教學(附大量案例)
安裝 Stable Diffusion 的硬體需求與方式
安裝 Stable Diffusion 電腦版需要 NVIDIA 顯卡(VRAM 至少 6GB),或者可選擇零硬體門檻的 Google Colab 雲端方案。
方式一:安裝在本機
本機安裝的最低硬體需求:
- 顯卡:NVIDIA GTX 1660 以上(VRAM 6GB),建議 RTX 3060 12GB 或更高
- 記憶體:16GB RAM(跑 SDXL 建議 32GB)
- 硬碟:SSD,至少預留 20GB 空間(含模型檔案)
- 軟體:Python 3.10+、Git、最新版 NVIDIA 驅動(含 CUDA)
AMD 顯卡用戶可透過 DirectML 或 ROCm 方案運行,但相容性與效能仍不及 NVIDIA。Apple Silicon(M1/M2/M3)用戶則可透過 MPS 後端運行,出圖速度約為同級 NVIDIA 顯卡的 50-70%。
方式二:Google Colab 雲端(零硬體門檻)
Google Colab 提供免費的雲端 GPU 運算環境,流程如下:
- 開啟 GitHub 上的開源 Colab 筆記本(如 camenduru 的 SD WebUI Colab)
- 點擊「在 Colab 中開啟」,連接 Google 帳號
- 執行安裝 Cell,等待環境自動建置(約 3-5 分鐘)
- 取得 WebUI 連結,在瀏覽器中開始使用

詳細教學請參考 免費安裝 Stable Diffusion:iPhone、手機、Mac 都能跑
AI 詠唱師:從興趣到職業的新路徑
熟練掌握 Stable Diffusion 咒語的人被稱為「AI 詠唱師(Prompt Engineer)」,這已從網路迷因發展為一個真實的職業方向。
根據 2025 年人力銀行數據,台灣「AI 圖像生成」相關職缺年增超過 40%,涵蓋電商視覺、遊戲原畫、廣告素材、社群內容等領域。AI 詠唱師的核心能力不只是會寫 Prompt,更包括:
- 理解不同 Checkpoint 模型的特性與適用場景
- 熟悉 LoRA、ControlNet、IP-Adapter 等進階控制工具
- 具備基礎美學素養(構圖、色彩、光影)
- 能將客戶需求轉化為精準的 Prompt 組合
更詳細的 AI 溝通技巧,可以參考學會用精準關鍵字 Prompt 跟 AI 溝通。
常見問題 FAQ
Stable Diffusion 咒語一定要用英文嗎?
是的,目前主流的 Stable Diffusion 模型(SD 1.5、SDXL、SD3)僅支援英文提示詞。因為訓練數據以英文圖文配對為主,使用中文會導致模型無法正確理解指令。建議用 ChatGPT 或 Google 翻譯將中文構想轉為英文 Prompt。部分社群模型(如中文特化版)可支援有限的中文輸入,但效果不穩定。
Negative Prompt 怎麼寫才有效?
最有效的做法是「通用品質排除 + 針對性瑕疵排除 + Negative Embedding」三層組合。第一層寫 (worst quality, low quality:1.4);第二層針對你遇到的問題加入對應詞(如手部問題加 bad hands, missing fingers);第三層載入 EasyNegative 或 bad_prompt_version2 等 embedding,它們封裝了數百個負面詞彙。
權重數值設多少最適合?
一般建議控制在 0.6 至 1.5 之間,超過 1.8 容易導致圖像失真。對於細微調整(如稍微強調眼睛顏色),用 1.1-1.2 即可。對於需要明顯改變的元素(如強制特定服裝),可用 1.3-1.5。低於 0.5 的權重幾乎沒有效果,高於 2.0 則會產生色塊、偽影等異常。
SD 1.5、SDXL、SD3 該選哪個版本?
2026 年的主流推薦是 SDXL,兼顧品質與生態成熟度。SD 1.5 模型數量最多(Civitai 上超過 10 萬個),適合需要特定風格 LoRA 的場景。SDXL 原生支援 1024×1024,畫質顯著提升,社群生態快速成長中。SD3 品質最高但生態尚未成熟,適合追求最新技術的進階用戶。
沒有顯卡也能用 Stable Diffusion 嗎?
可以,透過 Google Colab 免費方案或線上版即可零硬體使用。Google Colab 免費帳戶提供 T4 GPU(15GB VRAM),足以運行 SD 1.5 和 SDXL。但免費版有使用時數限制,重度使用者建議升級 Colab Pro(月費約 US$10)或購買一張 RTX 3060 12GB(二手約 NT$5,000-7,000)作為長期方案。
Stable Diffusion 生成的圖片有版權問題嗎?
Stable Diffusion 開源授權下,生成圖片的版權歸使用者所有,可商用。但需注意:若使用的 Checkpoint 模型或 LoRA 有特殊授權限制(如禁止商用),則需遵守該模型的授權條款。此外,生成與真實人物高度相似的圖像可能涉及肖像權問題,商用前建議確認法律風險。
如何讓 Stable Diffusion 出圖更像真人照片?
選擇寫實風格的 Checkpoint 模型(如 Realistic Vision、ChilloutMix)是最關鍵的一步。搭配以下 Prompt 技巧可進一步提升真實感:加入 photorealistic, RAW photo, 8k uhd, DSLR 等品質詞;使用 film grain, depth of field, bokeh 模擬相機效果;Negative Prompt 排除 painting, drawing, anime, cartoon 等繪畫風格詞。
Stable Diffusion 咒語實戰操作指引
以下是從零開始寫出高品質 Prompt 的完整步驟,照著做就能產出滿意的 AI 圖像。
- 確定主題與風格:先想清楚要畫什麼(人物/風景/物件)以及風格(寫實/動漫/油畫),這決定了你要選用的 Checkpoint 模型
- 組織正面 Prompt:按「品質詞 → 主體 → 場景 → 風格 → 模型觸發詞」順序撰寫,關鍵元素放前面,重要度由左至右遞減
- 設定 Negative Prompt:加入品質排除詞(worst quality, low quality)與常見瑕疵詞(bad hands, extra fingers),建議搭配 EasyNegative embedding
- 調整權重:對不夠明顯的特徵加
(keyword:1.2)強調,對過於強烈的特徵用(keyword:0.8)弱化,避免超過 1.8 - 批次生成與篩選:一次產出 4-8 張圖,從中挑選構圖最佳的,再用 img2img 或 Inpaint 微調細節
- 建立個人咒語庫:將測試成功的 Prompt 組合存成模板,標註使用的模型與參數,方便日後快速套用

