什麼是生成式 AI?大模型、LLM、Diffusion 一次懂
最近「AI」幾乎天天出現在新聞裡,但一深入就遇到一堆名詞:生成式 AI、大語言模型(LLM)、Diffusion、Transformer、推理模型……每個都好像懂,合起來又很模糊。
這篇文章目標是讓完全沒有背景的讀者也能建立正確的心智模型,之後讀後續系列(Prompt、RAG、Agent、工具比較)才會跟得上。我們不碰公式,只用比喻和例子把概念講清楚。
從 AI 發展史看現在
要理解生成式 AI 有多革命性,先看看它站在哪些巨人肩上:
| 時代 | 代表技術 | 能做什麼 |
|---|---|---|
| 1950–80s | 規則系統、n-gram | 依程式設計師寫死的規則回應 |
| 2012 後 | 深度學習、神經網路 | 從資料「學」特徵,而非手動設定 |
| 2017 | Transformer 架構 | 一次看長距離關聯,讓大模型成為可能 |
| 2022 後 | 生成式 AI(ChatGPT 引爆) | 產生文字、圖片、影片、程式碼等新內容 |
關鍵轉折點在 2017 年 Google 提出的 Transformer 架構(論文《Attention Is All You Need》)。它讓模型能同時關注輸入的所有部分,訓練出超大型模型變得可行。之後所有的現代 AI,幾乎都建立在這個基礎上。
什麼是「生成式」AI?
生成式 AI(Generative AI) 是一類會產生新內容的 AI。它不只是把既有資料撈出來,而是學到資料背後的規律後,輸出從未出現過的:
- 文字:對話、文章、程式碼
- 圖片:依描述繪製的圖像
- 影片:文字或圖片生成的動態影像
- 音訊:語音合成、音樂
它的核心行為可以簡化成一句話:學到訓練資料的規律 → 根據你的輸入(prompt)產生新內容。
這裡有個重要區分:
- 傳統 AI / 判別式模型:做「分類」或「判斷」。例如辨識郵件是不是垃圾信、圖片裡是貓還是狗。它只給一個答案,不產生新東西。
- 生成式模型:「創造」內容。你給一句開頭,它幫你續寫下去。
大語言模型(LLM):會說話的模型
大語言模型(Large Language Model, LLM) 是生成式 AI 裡最出名的一種,專門處理文字(後來也擴到多模態)。
幾個關鍵概念:
- 訓練資料:幾乎吃掉了整個網路上的文字。因為看得夠多,它學會了語言的規律與知識。
- 預測下一個字:LLM 本質上在做的事情很簡單——根據前面的文字,預測最可能的下一個 token(一個詞或字的一部分)。別小看這個能力,重複足夠多次,就能寫出連貫的文章、程式碼甚至推理過程。
- 參數(Parameters):模型「學到的東西」的總量,常以十億(B)、千億(100B+)來衡量。數字越大通常代表容量越大,但不等於一定更好。
- 上下文窗口(Context Window):模型一次能「記住」的文字長度。像讀一篇長報告、問一整份文件,都受這個限制。
常見的 LLM 產品你有聽過這些:ChatGPT、Claude、Google Gemini、DeepSeek、Qwen、Kimi、Grok 等。它們背後都是不同公司訓練的 LLM。
Diffusion:畫圖的模型
LLM 處理文字,但你可能也看過 AI 畫圖、生成影片。那些多半是另一類模型——Diffusion(擴散)模型。
它的原理可以這樣理解:
- 從一張全是雜訊(像電視無訊號的雪花)的圖片開始。
- 反覆「去噪」,一步步把模糊的雜訊清成清晰的圖像。
- 你給的描述(prompt)會引導這個清理方向,最後出現你要的內容。
文字到圖片(Text-to-Image)、文字到影片(Text-to-Video)都是這個思路。代表性產品:Midjourney、Stable Diffusion、Adobe Firefly(圖),以及 Sora、Veo、LTX-Video(影片)。
簡單記:LLM 生成文字,Diffusion 生成圖像與影片,兩者常合稱「生成式 AI」。
為什麼現在這麼強?三種驅動力
為什麼 2022 年之前 AI 感覺一般,之後突然變神?主要靠三件事:
- 更大的模型:運力提升,能訓練出參數驚人的大模型。
- 更多的資料:網路文字資料豐富,供模型學習。
- 更好的訓練方法:除了預訓練,還用「人類回饋強化學習」(RLHF)讓模型的回應更符合人類期望、更好用、更安全。
新關鍵:推理模型(Reasoning / Thinking Models)
這是 2025–2026 最重要的進展,也是你之後用 AI 一定會碰到的概念。
傳統的 LLM 是「想到什麼就說什麼」,追求第一時間吐出答案。而推理模型會先在內部「先想一下、一步步推導」,再給出最終答案。類似的例子:解數學題時,不是直接報數字,而是先寫出計算過程。
代表產品與系列:OpenAI 的 o1 / gpt-5-thinking 系列、DeepSeek R1 之後的思考模型、Qwen 的 thinking 版本。
對一般使用者意味著什麼?
- 適合複雜問題:邏輯、數學、程式除錯、多步驟規劃,推理模型通常更準。
- 要換「思考模式」很多工具裡需要主動開啟 thinking / reasoning 模式,它才會慢慢想。
- 取代之餘更貴更慢:因為要多花算力思考,速度與成本都較高。日常閒聊或簡單任務,普通模型反而更快。
主流產品地圖(2026)
不用現在全記住,先有個印象就好,下一篇會詳細比較:
| 廠商 | 代表產品 | 強項印象 |
|---|---|---|
| OpenAI | ChatGPT | 生態完整、插件與工具多 |
| Anthropic | Claude | 寫作與程式能力受好評、注重安全 |
| Gemini | 深度整合 Google 服務、多模態強 | |
| DeepSeek | DeepSeek(中國) | 高CP值、推理模型出名 |
| Alibaba | Qwen | 開放權重、本地部署熱門 |
| Meta | Llama | 開放權重、可自建 |
| xAI | Grok | 結合 X(Twitter)即時資訊 |
小結
- 生成式 AI = 會「產生新內容」的 AI,涵蓋文字、圖、影片、音訊。
- LLM 主要處理文字;Diffusion 主要處理圖像與影片。
- 現代 AI 建立在 Transformer 架構上,靠大模型、大資料、好訓練方法變強。
- 推理模型是最新趨勢,擅長複雜問題,但需要主動開啟思考模式。
掌握了這些概念,你已經比大多數人懂 AI 的底層邏輯了。接下來可以依序閱讀:
- ChatGPT vs Claude vs Gemini vs DeepSeek 該選哪個(下一篇)
- Prompt Engineering:讓 AI 聽懂你
- RAG:讓 AI 讀你自己的文件
這是《AI 新時代》系列第 01 篇。若覺得有幫助,歡迎分享給想認識 AI 的朋友。