AI 圖像生成:Midjourney / Stable Diffusion / Firefly
上一篇聊到 LLM 處理文字,這篇換個心情看 AI 畫圖。你會發現「畫圖」和「聊天」背後其實是不同類型的模型(上篇《什麼是生成式 AI》提過的 Diffusion)。這篇文章帶你理解原理、比較工具、學會寫提示詞。
原理回顧:Diffusion 是怎麼畫的?
記憶一下:Diffusion 模型從全雜訊的圖片開始,反覆「去噪」一步步清成清晰圖像,而你給的描述會引導清理的方向。所以 AI 畫圖本質上是從隨機噪音中,把你想看的東西慢慢顯現出來。
三大工具比較
| 工具 | 類型 | 優點 | 適合誰 |
|---|---|---|---|
| Midjourney | 線上服務 | 藝術感、美感強、風格化佳 | 設計師、想要高完成度插畫的人 |
| Stable Diffusion | 開源、可本地 | 免費、可自訂、可本地部署(本站另有 ComfyUI 實作教學) | 想深度控制、玩本地部署的技術人 |
| Adobe Firefly | 線上服務 | 商業授權安全、與 Photoshop 整合 | 專業設計、商用素材、怕版權問題的人 |
怎麼寫好的圖像提示詞?
跟文字 Prompt 原相通,但更強調「視覺元素」。一個完整公式:
主題 + 細節 + 風格 + 燈光 + 構圖 + 品質修飾詞
範例對比:
- ❌ 「一隻貓」
- ✅ 「一隻橘貓坐在窗台上,油畫風格,溫暖的夕陽光,景深效果,高細節,傑作」
常用修飾詞:
- 風格:
水彩 (watercolor)、像素風 (pixel art)、3D 渲染、賽博龐克 (cyberpunk)、扁平插畫 (flat illustration) - 燈光:
自然光、霓虹燈、黃金時刻 (golden hour)、影棚光 - 構圖:
特寫、廣角、俯視角、對稱構圖 - 品質:
高細節、4K、傑作 (masterpiece)
兩個重要觀念
負向提示詞(Negative Prompt)
告訴模型「不要什麼」,能有效減少 unwanted 的元素。例如:低品質、模糊、多手指、水印。這個設定在後續的 ComfyUI 實作教學裡會實際用到。
種子(Seed)
每次生成都是隨機的。固定 seed 就能重複出同一張圖,方便你在現有基礎上微調。這是「改一點點」而不是「重畫」的關鍵。
接上本站的 ComfyUI 實作教學
本站先前介紹過《Mac 使用 ComfyUI》,Stable Diffusion 最強大的地方就是能在本地用 ComfyUI 完成從設定到出圖的完整流程:
- Img2Img(圖生圖):給一張基圖,調整去噪強度(denoising),讓 AI 在原有基礎上變化。這與影片生成「圖生影片」的思路雷同。
- ControlNet:用線稿或姿勢來精確控制構圖。
- 擴充/重繪(Inpainting):只改圖片的某個區域,例如換背景、修細節。
如果還沒實際操作 ComfyUI,可以把這篇學到的提示詞技巧直接套進教學裡的 workflow 試試。
一定要知道的:授權與版權
- 商用前看清授權:Midjourney 付費方案才具商用權;Firefly 因用授權資料訓練,商業最安全。
- 別生成侵權內容:模仿特定註冊角色、商標或有版權的風格,可能有法律風險。
- 各地法規不同:AI 生成內容的版權歸屬目前仍在發展中,商用前最好確認當地規範。
小結
- AI 畫圖靠 Diffusion 模型,從噪音逐步顯影。
- Midjourney 美感強、Stable Diffusion 可本地自訂(本站另有 ComfyUI 實作教學)、Firefly 商用最安全。
- 好提示詞 = 主題 + 細節 + 風格 + 燈光 + 構圖,善用負向提示與 seed。
- 授權與版權一定要留意,尤其商用時。
下一篇看更動的:AI 影片與語音生成(Sora、Veo、LTX-Video、ElevenLabs)。
《AI 新時代》系列第 09 篇。上一篇:Local LLM · 下一篇預告:AI 影片與語音