Local LLM 部署:用 Ollama 在自己的電腦跑大模型
付費 API 雖然方便,但有兩個痛點:用多了要花錢,而且資料會傳到別人伺服器。如果你重視隱私、想免費測試、或需要離線環境,本地部署大模型就是答案。
這篇文章帶你用 Ollama(目前最流行的本地模型工具)在自己的電腦跑起來。你之前看過《Mac 安裝 ComfyUI》,這篇的步驟同樣簡單。
為什麼要本地部署?
- 隱私:資料永遠留在自己機器,不上傳。
- 免費:不用付 API token 費用(只有電費與硬體成本)。
- 離線可用:沒有網路也能用。
- 開發測試:接進自己的程式做原型,不用付錢調來調去。
安裝 Ollama
- 到 https://ollama.com 下載對應作業版本的安裝包並安裝。
- 安裝後開啟終端機(Mac/Linux 的 Terminal),Ollama 會自動在背景執行。
- 驗證:輸入
ollama或ollama list,沒報錯就成功了。
選一個模型跑起來
Ollama 上有大量開放權重模型。2026 年較熱門的幾個(依 Ollama 排行):
| 模型 | 適合場景 | 硬體需求 |
|---|---|---|
| Qwen3(阿里) | 多語言、程式、文字為主 | 小(8B 約 5GB),入門首選 |
| Llama 4(Meta) | 多語言、程式、原生多模態(能看圖) | 較大(Maverick 約 67GB),需較好硬體 |
初次使用建議從小尺寸開始(例如 Qwen3 的 8B 級,約 5GB),確認硬體跟得上再換大的。想測試能「看圖」的多模態模型,可以試 Llama 4(Maverick 版約 67GB,記憶體要夠)。
一行命令下載並執行
1 | # 入門:小、快,適合大多數電腦 |
跑起來後,終端機就會變成一個聊天視窗,直接打字提問即可。按 Ctrl+D 或輸入 /exit 離開。
常用指令:
1 | ollama list # 列出已下載的模型 |
你的硬體跟得上嗎?
本地跑模型最看重 RAM(記憶體) 與 VRAM(顯存,若有 NVIDIA 卡)。規則大致是:
- 模型參數越大,需要的記憶體越多。一個大概估算法:7B 模型約需 4~6GB,70B 則要 40GB 以上。
- Mac 使用者:統一記憶體(Unified Memory)越大越好,M 系列晶片對本地模型支援佳。
- 跑不動大模型? 用較小尺寸或「量化版」(檔名常帶
:b或:q),犧牲一點精度換更小佔用。
接進自己的程式(OpenAI 相容 API)
Ollama 內建一個 OpenAI 相容的本地 API,所以上一篇寫的程式碼幾乎不用改就能改用本地模型:
1 | # 預設監聽 localhost:11434 |
Python 呼叫範例(把 base_url 指向本地):
1 | from openai import OpenAI |
這樣你就用免費、離線的模型跑出了跟 OpenAI 一樣的程式。
接進開發工具
Ollama 也能直接接進編輯器與 AI 開發代理(例如 Claude Code、OpenCode),在 ollama 的整合清單裡就能看到。設定後,寫碼時調用的就是你本地的模型,既免費又隱私。
小結
- Ollama 是本地上線大模型最簡單的工具,一行命令即可。
- 2026 熱門本地模型:Qwen3(入門)、Llama 4(多模態),依硬體選尺寸。
- 重點看硬體(RAM/VRAM),跑不動就換小尺寸或量化版。
- 內建 OpenAI 相容 API,上一篇的程式碼幾乎不用改就能本地化。
學會本地模型後,你已經能免費玩各種 AI。下一篇回到創作面向:AI 圖像生成。
《AI 新時代》系列第 08 篇。上一篇:Function Calling · 下一篇預告:AI 圖像生成