什麼是生成式 AI?大模型、LLM、Diffusion 一次懂

最近「AI」幾乎天天出現在新聞裡,但一深入就遇到一堆名詞:生成式 AI、大語言模型(LLM)、Diffusion、Transformer、推理模型……每個都好像懂,合起來又很模糊。

這篇文章目標是讓完全沒有背景的讀者也能建立正確的心智模型,之後讀後續系列(Prompt、RAG、Agent、工具比較)才會跟得上。我們不碰公式,只用比喻和例子把概念講清楚。

從 AI 發展史看現在

要理解生成式 AI 有多革命性,先看看它站在哪些巨人肩上:

時代 代表技術 能做什麼
1950–80s 規則系統、n-gram 依程式設計師寫死的規則回應
2012 後 深度學習、神經網路 從資料「學」特徵,而非手動設定
2017 Transformer 架構 一次看長距離關聯,讓大模型成為可能
2022 後 生成式 AI(ChatGPT 引爆) 產生文字、圖片、影片、程式碼等新內容

關鍵轉折點在 2017 年 Google 提出的 Transformer 架構(論文《Attention Is All You Need》)。它讓模型能同時關注輸入的所有部分,訓練出超大型模型變得可行。之後所有的現代 AI,幾乎都建立在這個基礎上。

什麼是「生成式」AI?

生成式 AI(Generative AI) 是一類會產生新內容的 AI。它不只是把既有資料撈出來,而是學到資料背後的規律後,輸出從未出現過的:

  • 文字:對話、文章、程式碼
  • 圖片:依描述繪製的圖像
  • 影片:文字或圖片生成的動態影像
  • 音訊:語音合成、音樂

它的核心行為可以簡化成一句話:學到訓練資料的規律 → 根據你的輸入(prompt)產生新內容。

這裡有個重要區分:

  • 傳統 AI / 判別式模型:做「分類」或「判斷」。例如辨識郵件是不是垃圾信、圖片裡是貓還是狗。它只給一個答案,不產生新東西。
  • 生成式模型:「創造」內容。你給一句開頭,它幫你續寫下去。

大語言模型(LLM):會說話的模型

大語言模型(Large Language Model, LLM) 是生成式 AI 裡最出名的一種,專門處理文字(後來也擴到多模態)。

幾個關鍵概念:

  • 訓練資料:幾乎吃掉了整個網路上的文字。因為看得夠多,它學會了語言的規律與知識。
  • 預測下一個字:LLM 本質上在做的事情很簡單——根據前面的文字,預測最可能的下一個 token(一個詞或字的一部分)。別小看這個能力,重複足夠多次,就能寫出連貫的文章、程式碼甚至推理過程。
  • 參數(Parameters):模型「學到的東西」的總量,常以十億(B)、千億(100B+)來衡量。數字越大通常代表容量越大,但不等於一定更好。
  • 上下文窗口(Context Window):模型一次能「記住」的文字長度。像讀一篇長報告、問一整份文件,都受這個限制。

常見的 LLM 產品你有聽過這些:ChatGPT、Claude、Google Gemini、DeepSeek、Qwen、Kimi、Grok 等。它們背後都是不同公司訓練的 LLM。

Diffusion:畫圖的模型

LLM 處理文字,但你可能也看過 AI 畫圖、生成影片。那些多半是另一類模型——Diffusion(擴散)模型

它的原理可以這樣理解:

  1. 從一張全是雜訊(像電視無訊號的雪花)的圖片開始。
  2. 反覆「去噪」,一步步把模糊的雜訊清成清晰的圖像。
  3. 你給的描述(prompt)會引導這個清理方向,最後出現你要的內容。

文字到圖片(Text-to-Image)、文字到影片(Text-to-Video)都是這個思路。代表性產品:Midjourney、Stable Diffusion、Adobe Firefly(圖),以及 Sora、Veo、LTX-Video(影片)。

簡單記:LLM 生成文字,Diffusion 生成圖像與影片,兩者常合稱「生成式 AI」。

為什麼現在這麼強?三種驅動力

為什麼 2022 年之前 AI 感覺一般,之後突然變神?主要靠三件事:

  1. 更大的模型:運力提升,能訓練出參數驚人的大模型。
  2. 更多的資料:網路文字資料豐富,供模型學習。
  3. 更好的訓練方法:除了預訓練,還用「人類回饋強化學習」(RLHF)讓模型的回應更符合人類期望、更好用、更安全。

新關鍵:推理模型(Reasoning / Thinking Models)

這是 2025–2026 最重要的進展,也是你之後用 AI 一定會碰到的概念。

傳統的 LLM 是「想到什麼就說什麼」,追求第一時間吐出答案。而推理模型會先在內部「先想一下、一步步推導」,再給出最終答案。類似的例子:解數學題時,不是直接報數字,而是先寫出計算過程。

代表產品與系列:OpenAI 的 o1 / gpt-5-thinking 系列、DeepSeek R1 之後的思考模型、Qwen 的 thinking 版本

對一般使用者意味著什麼?

  • 適合複雜問題:邏輯、數學、程式除錯、多步驟規劃,推理模型通常更準。
  • 要換「思考模式」很多工具裡需要主動開啟 thinking / reasoning 模式,它才會慢慢想。
  • 取代之餘更貴更慢:因為要多花算力思考,速度與成本都較高。日常閒聊或簡單任務,普通模型反而更快。

主流產品地圖(2026)

不用現在全記住,先有個印象就好,下一篇會詳細比較:

廠商 代表產品 強項印象
OpenAI ChatGPT 生態完整、插件與工具多
Anthropic Claude 寫作與程式能力受好評、注重安全
Google Gemini 深度整合 Google 服務、多模態強
DeepSeek DeepSeek(中國) 高CP值、推理模型出名
Alibaba Qwen 開放權重、本地部署熱門
Meta Llama 開放權重、可自建
xAI Grok 結合 X(Twitter)即時資訊

小結

  • 生成式 AI = 會「產生新內容」的 AI,涵蓋文字、圖、影片、音訊。
  • LLM 主要處理文字;Diffusion 主要處理圖像與影片。
  • 現代 AI 建立在 Transformer 架構上,靠大模型、大資料、好訓練方法變強。
  • 推理模型是最新趨勢,擅長複雜問題,但需要主動開啟思考模式。

掌握了這些概念,你已經比大多數人懂 AI 的底層邏輯了。接下來可以依序閱讀:

  1. ChatGPT vs Claude vs Gemini vs DeepSeek 該選哪個(下一篇)
  2. Prompt Engineering:讓 AI 聽懂你
  3. RAG:讓 AI 讀你自己的文件

這是《AI 新時代》系列第 01 篇。若覺得有幫助,歡迎分享給想認識 AI 的朋友。