AI 影片與語音生成:Sora、Veo、LTX-Video、ElevenLabs

圖像已經夠強,更動的影片和語音這兩年也爆發性進展。這篇文章把這些工具串成一個完整的「AI 多模態創作」地圖,並在文末接上本站的 LTX-Video、ComfyUI 實作教學。

AI 生成影片:技術現況

文字或圖像生成影片(Text-to-Video / Image-to-Video)是近年來進步最快的領域。2026 年主流產品:

工具 廠商 特色
Sora OpenAI 知名度最高、時長與物理真實感強
Veo Google 品質高、常附帶音軌、整合 YouTube
LTX-Video Lightricks 開源、可本地部署、速度快

兩種主要方式

  1. Text-to-Video(文字生影片):只給一句描述,模型直接生成。適合概念短片、靈感素材。
  2. Image-to-Video(圖生影片):給一張基圖 + 動機描述,讓圖片「動起來」。可控性較高,本站 LTX-Video 教學中的範例即屬此類。

接上本站的 LTX-Video 實作教學

本站先前用 Python 實際跑過開源、可本地部署的 LTX-Video,這個流程正是 AI 影片創作的標準範式:

1
2
3
4
5
6
7
8
9
# 文字生成影片
python inference.py --ckpt_path /path/to/ltx-video-2b \
--prompt "A monkey dance" --height 768 --width 1024 \
--num_frames 10 --seed 2

# 圖片生成影片
python inference.py --ckpt_path /path/to/ltx-video-2b \
--prompt "A monkey dance" --input_image_path /path/image.png \
--height 768 --width 1024 --num_frames 200 --frame_rate 20 --seed 3

注意版本:LTX-Video 更新很快,範例中的 v0.9.1 已是舊版,目前 2B 最新是 0.9.8 系列。實際檔名請到 HuggingFace(Lightricks/LTX-Video) 下載最新的 2B checkpoint 後替換。

幾個重點參數:--prompt(描述)、--seed(固定種子重複)、--num_frames(幀數,決定長度)、--frame_rate(每秒幀數)。

本地 vs 雲端怎麼選?

  • LTX-Video 本地跑:免費、隱私、可批量,但吃硬體(尤其長影片、高幀數)。
  • Sora / Veo 雲端:品質與方便度高,按量付費,不用管硬體。

實務上很多人用雲端做高品質成品,用開源模型做快速迭代測試。

AI 語音與配音

除了畫面,聲音也是創作的關鍵:

工具 用途 特色
ElevenLabs 文字轉語音(TTS) 擬真度最高、多語言、可克隆聲音
Suno AI 生成歌曲 填詞就出歌,含演唱
語音克隆(Voice Cloning) 複製特定聲音 用於配音、有聲書,但倫理風險高

AI 配音流程通常是:腳本 → TTS 產生語音 → 剪輯合成到影片。ElevenLabs 目前是這個領域的標竿。

倫理與版權(多模態更要小心)

動態內容的風險比圖像更高:

  • 深度偽造(Deepfake):用他人聲音/臉生成虛假影片,可能被用於詐騙、謠言,已有法律制裁。
  • 聲音克隆授權:複製任何人(含自己以外)的聲音做商用,需取得同意。
  • 內容標示:多地法規要求 AI 生成的影音必須標註,避免誤導。

這也是為什麼工具方都開始加入水印與偵測機制。創作自由與責任要平衡。

小結

  • AI 影片分 文字生影片圖生影片,2026 主流是 Sora、Veo、開源的 LTX-Video。
  • 本地跑 LTX-Video 用 --prompt/--seed/--num_frames/--frame_rate,雲端用 Sora/Veo 取品質(本站有完整教學)。
  • ElevenLabs 是 AI 配音標竿,可支援語音克隆。
  • 深度偽造、聲音克隆授權、內容標示是必須重視的倫理法律紅線。

學會圖、聲、影片後,最後把「能讀能做」的能力整合起來——下一篇:AI Agent


《AI 新時代》系列第 10 篇。上一篇:AI 圖像生成 · 下一篇預告:AI Agent