AI 影片與語音生成:Sora、Veo、LTX-Video、ElevenLabs
圖像已經夠強,更動的影片和語音這兩年也爆發性進展。這篇文章把這些工具串成一個完整的「AI 多模態創作」地圖,並在文末接上本站的 LTX-Video、ComfyUI 實作教學。
AI 生成影片:技術現況
文字或圖像生成影片(Text-to-Video / Image-to-Video)是近年來進步最快的領域。2026 年主流產品:
| 工具 | 廠商 | 特色 |
|---|---|---|
| Sora | OpenAI | 知名度最高、時長與物理真實感強 |
| Veo | 品質高、常附帶音軌、整合 YouTube | |
| LTX-Video | Lightricks | 開源、可本地部署、速度快 |
兩種主要方式
- Text-to-Video(文字生影片):只給一句描述,模型直接生成。適合概念短片、靈感素材。
- Image-to-Video(圖生影片):給一張基圖 + 動機描述,讓圖片「動起來」。可控性較高,本站 LTX-Video 教學中的範例即屬此類。
接上本站的 LTX-Video 實作教學
本站先前用 Python 實際跑過開源、可本地部署的 LTX-Video,這個流程正是 AI 影片創作的標準範式:
1 | # 文字生成影片 |
注意版本:LTX-Video 更新很快,範例中的
v0.9.1已是舊版,目前 2B 最新是 0.9.8 系列。實際檔名請到 HuggingFace(Lightricks/LTX-Video) 下載最新的 2B checkpoint 後替換。
幾個重點參數:--prompt(描述)、--seed(固定種子重複)、--num_frames(幀數,決定長度)、--frame_rate(每秒幀數)。
本地 vs 雲端怎麼選?
- LTX-Video 本地跑:免費、隱私、可批量,但吃硬體(尤其長影片、高幀數)。
- Sora / Veo 雲端:品質與方便度高,按量付費,不用管硬體。
實務上很多人用雲端做高品質成品,用開源模型做快速迭代測試。
AI 語音與配音
除了畫面,聲音也是創作的關鍵:
| 工具 | 用途 | 特色 |
|---|---|---|
| ElevenLabs | 文字轉語音(TTS) | 擬真度最高、多語言、可克隆聲音 |
| Suno | AI 生成歌曲 | 填詞就出歌,含演唱 |
| 語音克隆(Voice Cloning) | 複製特定聲音 | 用於配音、有聲書,但倫理風險高 |
AI 配音流程通常是:腳本 → TTS 產生語音 → 剪輯合成到影片。ElevenLabs 目前是這個領域的標竿。
倫理與版權(多模態更要小心)
動態內容的風險比圖像更高:
- 深度偽造(Deepfake):用他人聲音/臉生成虛假影片,可能被用於詐騙、謠言,已有法律制裁。
- 聲音克隆授權:複製任何人(含自己以外)的聲音做商用,需取得同意。
- 內容標示:多地法規要求 AI 生成的影音必須標註,避免誤導。
這也是為什麼工具方都開始加入水印與偵測機制。創作自由與責任要平衡。
小結
- AI 影片分 文字生影片 與 圖生影片,2026 主流是 Sora、Veo、開源的 LTX-Video。
- 本地跑 LTX-Video 用
--prompt/--seed/--num_frames/--frame_rate,雲端用 Sora/Veo 取品質(本站有完整教學)。 - ElevenLabs 是 AI 配音標竿,可支援語音克隆。
- 深度偽造、聲音克隆授權、內容標示是必須重視的倫理法律紅線。
學會圖、聲、影片後,最後把「能讀能做」的能力整合起來——下一篇:AI Agent。
《AI 新時代》系列第 10 篇。上一篇:AI 圖像生成 · 下一篇預告:AI Agent