AI 影片與語音生成:Sora、Veo、LTX-Video、ElevenLabs

圖像已經夠強,更動的影片和語音這兩年也爆發性進展。這篇文章把這些工具串成一個完整的「AI 多模態創作」地圖,並在文末接上本站的 LTX-Video、ComfyUI 實作教學。

AI 生成影片:技術現況

文字或圖像生成影片(Text-to-Video / Image-to-Video)是近年來進步最快的領域。2026 年主流產品:

工具 廠商 特色
Sora OpenAI 知名度最高、時長與物理真實感強
Veo Google 品質高、常附帶音軌、整合 YouTube
LTX-Video Lightricks 開源、可本地部署、速度快

兩種主要方式

  1. Text-to-Video(文字生影片):只給一句描述,模型直接生成。適合概念短片、靈感素材。
  2. Image-to-Video(圖生影片):給一張基圖 + 動機描述,讓圖片「動起來」。可控性較高,本站 LTX-Video 教學中的範例即屬此類。

接上本站的 LTX-Video 實作教學

本站先前用 Python 實際跑過開源、可本地部署的 LTX-Video,這個流程正是 AI 影片創作的標準範式:

1
2
3
4
5
6
7
8
9
# 文字生成影片
python inference.py --ckpt_path /path/to/ltx-video-2b \
--prompt "A monkey dance" --height 768 --width 1024 \
--num_frames 10 --seed 2

# 圖片生成影片
python inference.py --ckpt_path /path/to/ltx-video-2b \
--prompt "A monkey dance" --input_image_path /path/image.png \
--height 768 --width 1024 --num_frames 200 --frame_rate 20 --seed 3

注意版本:LTX-Video 更新很快,範例中的 v0.9.1 已是舊版,目前 2B 最新是 0.9.8 系列。實際檔名請到 HuggingFace(Lightricks/LTX-Video) 下載最新的 2B checkpoint 後替換。

幾個重點參數:--prompt(描述)、--seed(固定種子重複)、--num_frames(幀數,決定長度)、--frame_rate(每秒幀數)。

本地 vs 雲端怎麼選?

  • LTX-Video 本地跑:免費、隱私、可批量,但吃硬體(尤其長影片、高幀數)。
  • Sora / Veo 雲端:品質與方便度高,按量付費,不用管硬體。

實務上很多人用雲端做高品質成品,用開源模型做快速迭代測試。

AI 語音與配音

除了畫面,聲音也是創作的關鍵:

工具 用途 特色
ElevenLabs 文字轉語音(TTS) 擬真度最高、多語言、可克隆聲音
Suno AI 生成歌曲 填詞就出歌,含演唱
語音克隆(Voice Cloning) 複製特定聲音 用於配音、有聲書,但倫理風險高

AI 配音流程通常是:腳本 → TTS 產生語音 → 剪輯合成到影片。ElevenLabs 目前是這個領域的標竿。

倫理與版權(多模態更要小心)

動態內容的風險比圖像更高:

  • 深度偽造(Deepfake):用他人聲音/臉生成虛假影片,可能被用於詐騙、謠言,已有法律制裁。
  • 聲音克隆授權:複製任何人(含自己以外)的聲音做商用,需取得同意。
  • 內容標示:多地法規要求 AI 生成的影音必須標註,避免誤導。

這也是為什麼工具方都開始加入水印與偵測機制。創作自由與責任要平衡。

小結

  • AI 影片分 文字生影片圖生影片,2026 主流是 Sora、Veo、開源的 LTX-Video。
  • 本地跑 LTX-Video 用 --prompt/--seed/--num_frames/--frame_rate,雲端用 Sora/Veo 取品質(本站有完整教學)。
  • ElevenLabs 是 AI 配音標竿,可支援語音克隆。
  • 深度偽造、聲音克隆授權、內容標示是必須重視的倫理法律紅線。

學會圖、聲、影片後,最後把「能讀能做」的能力整合起來——下一篇:AI Agent


《AI 新時代》系列第 10 篇。上一篇:AI 圖像生成 · 下一篇預告:AI Agent

AI 圖像生成:Midjourney / Stable Diffusion / Firefly

上一篇聊到 LLM 處理文字,這篇換個心情看 AI 畫圖。你會發現「畫圖」和「聊天」背後其實是不同類型的模型(上篇《什麼是生成式 AI》提過的 Diffusion)。這篇文章帶你理解原理、比較工具、學會寫提示詞。

原理回顧:Diffusion 是怎麼畫的?

記憶一下:Diffusion 模型從全雜訊的圖片開始,反覆「去噪」一步步清成清晰圖像,而你給的描述會引導清理的方向。所以 AI 畫圖本質上是從隨機噪音中,把你想看的東西慢慢顯現出來

三大工具比較

工具 類型 優點 適合誰
Midjourney 線上服務 藝術感、美感強、風格化佳 設計師、想要高完成度插畫的人
Stable Diffusion 開源、可本地 免費、可自訂、可本地部署(本站另有 ComfyUI 實作教學) 想深度控制、玩本地部署的技術人
Adobe Firefly 線上服務 商業授權安全、與 Photoshop 整合 專業設計、商用素材、怕版權問題的人

怎麼寫好的圖像提示詞?

跟文字 Prompt 原相通,但更強調「視覺元素」。一個完整公式:

主題 + 細節 + 風格 + 燈光 + 構圖 + 品質修飾詞

範例對比:

  • ❌ 「一隻貓」
  • ✅ 「一隻橘貓坐在窗台上,油畫風格,溫暖的夕陽光,景深效果,高細節,傑作」

常用修飾詞:

  • 風格水彩 (watercolor)像素風 (pixel art)3D 渲染賽博龐克 (cyberpunk)扁平插畫 (flat illustration)
  • 燈光自然光霓虹燈黃金時刻 (golden hour)影棚光
  • 構圖特寫廣角俯視角對稱構圖
  • 品質高細節4K傑作 (masterpiece)

兩個重要觀念

負向提示詞(Negative Prompt)

告訴模型「不要什麼」,能有效減少 unwanted 的元素。例如:低品質、模糊、多手指、水印。這個設定在後續的 ComfyUI 實作教學裡會實際用到。

種子(Seed)

每次生成都是隨機的。固定 seed 就能重複出同一張圖,方便你在現有基礎上微調。這是「改一點點」而不是「重畫」的關鍵。

接上本站的 ComfyUI 實作教學

本站先前介紹過《Mac 使用 ComfyUI》,Stable Diffusion 最強大的地方就是能在本地用 ComfyUI 完成從設定到出圖的完整流程:

  • Img2Img(圖生圖):給一張基圖,調整去噪強度(denoising),讓 AI 在原有基礎上變化。這與影片生成「圖生影片」的思路雷同。
  • ControlNet:用線稿或姿勢來精確控制構圖。
  • 擴充/重繪(Inpainting):只改圖片的某個區域,例如換背景、修細節。

如果還沒實際操作 ComfyUI,可以把這篇學到的提示詞技巧直接套進教學裡的 workflow 試試。

一定要知道的:授權與版權

  • 商用前看清授權:Midjourney 付費方案才具商用權;Firefly 因用授權資料訓練,商業最安全。
  • 別生成侵權內容:模仿特定註冊角色、商標或有版權的風格,可能有法律風險。
  • 各地法規不同:AI 生成內容的版權歸屬目前仍在發展中,商用前最好確認當地規範。

小結

  • AI 畫圖靠 Diffusion 模型,從噪音逐步顯影。
  • Midjourney 美感強、Stable Diffusion 可本地自訂(本站另有 ComfyUI 實作教學)、Firefly 商用最安全。
  • 好提示詞 = 主題 + 細節 + 風格 + 燈光 + 構圖,善用負向提示與 seed。
  • 授權與版權一定要留意,尤其商用時。

下一篇看更動的:AI 影片與語音生成(Sora、Veo、LTX-Video、ElevenLabs)。


《AI 新時代》系列第 09 篇。上一篇:Local LLM · 下一篇預告:AI 影片與語音