免費使用的 AI Agent 整理與比較

用 AI 寫程式越來越普及,但付費訂閱動輒每月數百到上千美元,對個人開發者或學生是不小負擔。本文整理多款「可以免費使用」雲端模型的 AI coding agent——Hermes AgentFreebuffopencode,以及 ClineContinueAiderGooseKilo CodeGitHub Copilot Free,說明它們各自是如何做到免費、是永久免費還是限時額度、適合什麼情境,以及要注意的地方。

先下一個結論:這些工具的「免費」原理大致分為幾類——

  • Hermes Agent 是開源自架工具,靠切換雲端免費模型供應商來省錢。
  • Freebuff 以廣告補貼,開箱即用,官方稱永久免費。
  • opencode 本身不綁定廠商,接 OpenRouter 免費層即可零成本使用雲端模型。
  • 還有一群開源「自帶模型」Agent(Cline、Continue、Aider、Goose、Kilo Code),工具本身免費,再接 OpenRouter 免費層的雲端模型。
  • GitHub Copilot Free 是廠商提供的永久免費層,有固定每月額度。

重要:免費分為兩種——「永久免費」指該方案長期存在(如 $0/月方案、廣告補貼),只要廠商營運就一直在;「免費額度」指註冊時送的額度或每月上限,用盡或政策調整就可能改變。下文會分別標示。

一、Hermes Agent(Nous Research)

Hermes Agent 由 Nous Research 開發,採 MIT 授權開源。它的賣點是內建「自我改進」學習迴圈:會在使用中建立 skills、跨工作記憶、支援多子代理與 cron 排程,可從終端機、桌面版、GitHub Actions 或訊息平台(Telegram、Discord、Slack 等)操作。

如何免費

它本身不綁定單一模型,而是透過供應商中繼來切換,用 hermes model 一命令就能換模型,不用改程式。免費主要靠以下幾個雲端供應商的免費層:

供應商 免費額度 免費性質 適合場景
OpenRouter 27+ 個 :free 模型、200 請求/天、20 請求/分 長期免費層(有速率限制) 最推薦,一個 key 換 200+ 模型
NVIDIA NIM 註冊送額度、免信用卡、約 40 請求/分 免費額度(免信用卡) 跑 Nous Hermes 3 系列模型
Nous Portal 官方 hosted,OAuth 整合最佳 免費層(以官方為準) 與 Hermes 生態最貼合
Hugging Face 每月免費額度 每月免費額度 小眾/批量任務
Kimi / Moonshot 免費層、長上下文 免費層(以官方為準) 處理大文件、長對話

安裝方式

1
2
3
curl -fsSL https://raw.githubusercontent.com/NousResearch/hermes-agent/main/scripts/install.sh | bash
source ~/.bashrc
hermes setup

跑完 hermes setup 後選擇 OpenRouter 或 NVIDIA NIM 即可開始,兩者都免信用卡。日常開發遇到速率上限時,用 hermes model 換供應商即可。

二、Freebuff(Codebuff)

Freebuff 由 Codebuff(YC F24,創辦人 James Grugett,X 帳號 @jahooma)出品,定位是「完全免費的 coding agent」,主打替代 Claude Code、Cursor、Codex、Lovable 等付費工具。核心模式是廣告補貼:使用期間顯示文字廣告來支付模型成本,因此無需訂閱、無需 API key、無需信用卡。程式碼採 Apache 2.0 開源,背後還有付費版 Codebuff。官方首頁明確標示「$0 / yr」與「Freebuff is $0. Forever.」

五種介面

Freebuff 在同一套免費服務下提供多種使用方式:

  • CLI:終端機內直接使用,npm install -g freebuff 後執行 freebuff
  • Desktop:macOS/Windows/Linux 原生應用程式,可平行運行多個代理。
  • Web:瀏覽器內建全棧網頁應用,從提示到上線網址。
  • Cloud:雲端 IDE,連到任意 GitHub repository,含沙箱與預覽。
  • Chat:免費 AI 聊天,適合研究與深度思考。

目前使用的模型包含 DeepSeek V4 Flash、GPT 5.6 Luna、MiniMax M3 等(實際可用模型會調整)。

三、opencode

opencode 是開源(MIT)、以終端機為主的 AI coding agent,截至 2026 年 8 月已是 GitHub 上最受歡迎的 coding agent(約 193K star)。它透過 AI SDK 與 Models.dev 整合 75+ 模型供應商,最大特色是不綁定單一廠商

如何免費

opencode 本身不收錢,費用來自後端模型。零成本的做法是接入 OpenRouter 免費層:與 Hermes 相同,用 OpenRouter 標 :free 的雲端模型,一組 key 即可開始(長期免費層,有速率限制)。設定時在 opencode 的設定檔中選 OpenRouter 供應商並指定一個 :free 模型即可。

四、其他開源、自帶模型的 Agent(BYOM)

這群工具與 opencode 理念相近:工具本身免費且開源,再接 OpenRouter 免費層的雲端模型。適合已經知道要用哪個模型的人。

工具 授權 介面 免費做法 特色
Cline Apache 2.0 VS Code/Cursor 擴充、CLI 自帶 OpenRouter key,用 :free 模型 生態大、MCP 支援佳
Continue 開源 VS Code/JetBrains 擴充 接 OpenRouter 免費模型 編輯器內快速對話
Aider 開源 終端機 CLI 自帶 OpenRouter key,Git 整合強 專注 git 提交與程式開發
Goose(Block) Apache 2.0 終端機+原生桌面 15+ 供應商、70+ MCP,含免費模型 模型無關、可跑程式外自動化
Kilo Code 開源 VS Code/Cursor 擴充 接 OpenRouter 免費模型 Roo Code 停運(2026/5)後的活躍分支
  • Cline:最流行的開源擴充之一,支援 Anthropic、OpenAI、Google、OpenRouter 等,並已推出獨立 CLI。
  • Continue:強調「即插即用」的程式碼編輯器擴充,可接雲端免費模型。
  • Aider:終端機優先,與 Git 深度整合,適合習慣命令列與版本控制的開發者。
  • Goose:由 Block(Square)出品,原生桌面版+CLI,除寫碼外也能做研究、自動化等通用任務。
  • Kilo Code:Roo Code 於 2026 年 5 月停運後,由社群維護的活躍分支,延續相似操作體驗。

五、廠商官方免費層(GitHub Copilot Free)

如果不想自己管理 API key,可以直接用廠商提供的免費層。GitHub Copilot Free 經官方頁面核實為永久免費($0/月/使用者),有固定每月額度:

  • 包含內容:每月 2,000 次程式補全50 次聊天請求(含 Copilot Edits)、Copilot CLI、社群支援。
  • 可用模型:Haiku 4.5、GPT-5 mini 等。
  • 資格:個人開發者即可;持有 Business/Enterprise 席位的用戶不符合。無需信用卡。
  • 說明:這是長期存在的 $0 方案,額度每月重置,用盡可下月恢復或付費升級 Pro($10/月)。

其他廠商(如 Amazon Q Developer)也有免費層,但本會無法取得其官方頁面核實當前額度與期限,故暫不列入;如需可另行確認後再補上。

六、綜合比較

免費類型 代表工具 原理 免費性質 適合誰
切換雲端免費供應商 Hermes Agent 自架 + 換 OpenRouter/NIM 等免費層 長期免費層(速率限制) 要彈性、想學習原理
廣告補貼 Freebuff 廣告換免費,開箱即用 永久免費(官方稱 Forever) 怕設定、想快速上手
開源工具+OpenRouter免費層 opencode 接 OpenRouter :free 模型 工具永久免費+免費層 重隱私、已在用終端機
開源擴充/CLI(BYOM) Cline、Continue、Aider、Goose、Kilo Code 工具免費,接 OpenRouter 免費層 工具永久免費+免費層 想在 IDE 或直接 CLI 換模型
廠商官方免費層 GitHub Copilot Free 廠商提供固定免費額度 永久免費(每月限額) 想省事、少量使用

七、該如何選擇

  • 想快速上手、不想碰設定:選 Freebuff。安裝後就能用,適合學生、興趣專案或不想處理 API 的人。代價是用廣告換免費,且主要走雲端,需接受其隱私權政策。
  • 想要彈性、喜歡自架與學習原理:選 Hermes Agent。可自由切換雲端免費供應商,適合想深入理解 agent 運作、需要記憶/排程/多代理功能的開發者。
  • 已經在用終端機 agent:選 opencodeCline/Goose/Aider等,接 OpenRouter 免費層即可零成本使用雲端模型。
  • 只想少量使用、連 key 都不想管:選 GitHub Copilot Free,每月 2,000 次補全加 50 次聊天夠入門使用。

八、注意事項

免費使用通常伴隨以下代價,挑選前請留意:

  1. 「永久」不等於「無限」:即使是永久免費方案(如 Copilot Free、Freebuff),也有每月額度或速率上限;用盡需等待重置或付費。
  2. 速率限制:例如 OpenRouter 免費層為 200 請求/天、20 請求/分,agentic 多步任務容易觸限,需準備備用供應商。
  3. 廣告與雲端隱私:Freebuff 以廣告換免費且主要走雲端,處理機密程式碼前請閱讀其隱私權與服務條款。
  4. 模型品質與穩定性:免費層多用較小或較新的模型,品質、速度、穩定度通常不如付費方案。
  5. 政策會變動:廠商免費額度與可用模型可能隨時調整,建議不要單點依賴,保留切換能力。

總結來說,這些工具都能零成本起步:Freebuff 最省事且官方稱永久免費、Hermes 最彈性、opencode/Cline/Goose/Aider 適合已在 IDE 或終端機工作流的人,GitHub Copilot Free 則是最省手的廠商永久免費層。可依「怕不怕設定」與「重不重視隱私」來決定從哪個開始嘗試。

本地 LLM 工具比較:Ollama、LM Studio、TextGen 該選哪個

前面第 08 篇《Local LLM 部署:用 Ollama》介紹了 Ollama 這一款工具,但很多人會發現:本地跑大模型的工具其實有很多種,名字聽起來都差不多。為什麼需要這麼多工具?它們有什麼不同?我該選哪個? 這篇就是來回答這個問題。

先講結論:沒有所謂「最好」的工具,只有最適合你需求的工具。有人想要一行命令快速上手,有人想要點一點就有圖形介面,有人想要最強功能願意折騰。下面從「背後的共同原理」講到「各工具差異」,最後給你一張決策表。

如果你只想用 Ollama,直接回頭看 Local LLM 部署:用 Ollama 就好;這篇則帶你看完整生態。

為什麼有多種本地工具?

因為大家的需求不一樣,主要分成幾個取向上:

  • 圖形介面(GUI)vs 命令列(CLI):有人喜歡點按鈕、拖模型;有人習慣終端機一行指令,適合接進腳本與自動化。
  • 簡單 vs 可控:有人只想「跑起來聊天」;有人想要微調模型、接 API、做圖片生成、擴充插件。
  • 硬體限制:有人用高階 Mac 或 NVIDIA 顯卡,有人只有普通筆電,對效率與相容性要求不同。

這些取向的差異,就催生了不同的工具。而它們大多建立在同一套底層技術上——接下來解釋這個關鍵概念。

背後的共同原理:llama.cpp 與 GGUF

理解這一點,你就懂為什麼工具這麼多還長得很像。

llama.cpp 是一個用 C/C++ 寫成的開源引擎,能在各種硬體(包含只有 CPU 的電腦)上執行大語言模型。它幾乎是「本地模型」這領域的基礎設施——Ollama、LM Studio 等大多數圖形工具,底層調用的就是 llama.cpp

而模型的檔案格式叫 GGUF(llama.cpp 提出的格式)。你從各處下載的本地模型,幾乎都是 GGUF 檔。這就像:llama.cpp 是「引擎」,GGUF 是「燃料規格」,各家工具只是換了不同的「車體與儀表板」。

了解這個之後,再看各工具的差異就清楚多了:它們大多共用同一套引擎,差別在於包裝、功能與易用性。

主流工具介紹

以下四個是 2026 年最具代表性的本地模型工具。

Ollama — 最簡單,開發者首選

Ollama 用命令列為主,一行指令就能下載並跑模型(ollama run qwen3:8b),還內建 OpenAI 相容的本地 API,接進自己的程式或開發工具都方便。**詳細用法見 Local LLM 部署:用 Ollama**。

  • 優點:安裝與使用最簡單、文件多、開發者生態最強(接 API、接 Claude Code/OpenCode 等代理都方便)。
  • 缺點:原生沒有漂亮的圖形介面(雖然後來加了輕量視窗),進階功能較少。
  • 適合:開發者、想接程式、習慣命令列的人。

LM Studio — 圖形介面最順,新手友好

LM Studio 是我最推薦給「想要 GUI 又不想折騰」的人。它現在不只是下載模型的瀏覽器,還整合成能處理工作與程式的 agent,底層同時支援 MLX(Mac 高效運算)與 llama.cpp,跨 Mac/Windows/Linux。除了點點點的介面,也提供命令列 lms 與 SDK,對開發者也算友善。內建模型庫可以直接搜、直接下,免費離線、重視隱私。

  • 優點:介面清晰、模型庫好找、圖形操作順、同時有 CLI/SDK、Mac 效能佳。
  • 缺點:功能深度不及 TextGen(例如進階微調、圖片生成較弱)。
  • 適合:想要好用 GUI、又想兼顧一點開發需求的人。

TextGen(oobabooga)— 功能最強大,進階玩家最愛

TextGen(原名 Text Generation WebUI,由 oobabooga 維護)是功能最全面的一個。它不只是文字對話,還能做圖片生成、視覺理解、工具調用、提供 API、LoRA 微調模型,並有大量擴充插件。它提供易用的桌面 App 與瀏覽器 Web UI,後端還支援多種引擎,適合想深度玩本地模型的人。

  • 優點:功能最完整、擴充性強、能微調與做多模態。
  • 缺點:設定較複雜、文件偏技術、對新手不太友善。
  • 適合:進階玩家、研究者、想要一站式(文字+圖片+微調)的人。

llama.cpp — 給想要完全控制的人

就是前面提到的那個引擎本身。如果你不想依賴任何圖形工具,想自己編譯、自訂參數、在特殊硬體上最佳化,可以直接用 llama.cpp 的命令列。它是「最原始」的選擇。

  • 優點:完全可控、效率最高、相容性最廣(CPU/GPU/Mac 都能跑)。
  • 缺點:沒有圖形介面,需要命令列與技術背景。
  • 適合:開發者、研究者、想徹底理解或最佳化效能的人。

該選哪個?看這張表

你的情況 推薦工具 理由
開發者,要接程式/API Ollama(或 llama.cpp) OpenAI 相容 API、生態最完整
想要好用 GUI、點點點 LM Studio 介面清晰、模型庫好找、跨平台
想要最強功能、願意折騰 TextGen 文字/圖片/微調一站式
想完全控制、追求效率 llama.cpp 最原始、可自訂度最高

如果還是猶豫,我的建議是:開發者用 Ollama,一般使用者用 LM Studio。這兩個能涵蓋九成情境,也是本篇前面幾篇已經深入介紹過的工具。

小結

  • 本地模型工具很多,但大多共用同一套底層 llama.cppGGUF 格式,差別在包裝與功能。
  • Ollama 最簡單、開發者最愛;LM Studio 圖形介面最順;TextGen 功能最強;llama.cpp 給想要完全控制的人。
  • 選型關鍵看三件事:要不要 GUI、需不需要進階功能、是不是開發者
  • 只想用 Ollama?回頭看 Local LLM 部署:用 Ollama,那篇會帶你把一個工具玩透。

《AI 新時代》系列第 14 篇。相關:Local LLM 部署(Ollama)

How to use Cursor AI in Godot

上一篇介紹了如何在 Unity 中使用 Cursor AI,這篇換成遊戲開發者常用的 Godot。Cursor 是一個 AI 程式編輯器(基於 VS Code 打造),能幫你補碼、生成與修改程式。在 Godot 中主要用來撰寫 GDScript 或 **C#**,讓 AI 參與腳本開發。

與 Unity 不同的是,Godot 不需要安裝任何套件,只要在設定裡把 Cursor 設成「外部編輯器」即可。以下分 Mac 與 Windows 兩種平台說明。

步驟一:安裝 Cursor

  1. 前往 https://www.cursor.com/ 註冊帳號並下載對應作業版本的 Cursor 安裝。
  2. 開啟後登入,建議先到設定裡選好要用的模型(例如 Claude、GPT 等)。

步驟二:將 Cursor 設為 Godot 的外部編輯器

  1. 在 Godot 4 編輯器右上角,點擊 Editor -> Editor Settings(或直接按 Ctrl + , + ,)。
  2. 在左側展開 General,找到 Text Editor,再點開 External
  3. 勾選 Enabled,讓 Godot 允許用外部程式開啟腳本。
  4. 設定 Exe/Path(Cursor 的執行檔路徑)與 Args(傳遞給 Cursor 的參數)。

Mac 使用者

  • Exe/Path 填入:
    1
    /Applications/Cursor.app/Contents/MacOS/cursor
  • Args 填入:
    1
    {file}:{line}

Windows 使用者

  • Exe/Path 填入 cursor.exe 的路徑。如果不知道裝在哪,可以到「開始選單」找到 Cursor、右鍵選擇「開啟檔案所在位置」,即可看到執行檔,再把完整路徑複製過來。
  • Args 同樣填入:
    1
    {file}:{line}

參數說明{file} 會被替換成腳本檔案的完整路徑,{line} 則是你在 Godot 中游標所在的行號。這樣 Cursor 開啟時會直接定位到該行。

  1. 回到 Text Editor 上層,把 External -> Use External 勾選起來,確保生效。
  2. 點擊右下角的 ApplyOK 完成設定。

步驟三:在 Godot 中開啟腳本

  1. 在場景樹或檔案系統中,雙擊一支 GDScript/C# 腳本,它會在 Godot 內建的編輯器打開。
  2. 點擊右上角的「用外部編輯器開啟」圖示(看起來像一支筆或外框箭頭),Godot 就會呼叫 Cursor 在同一支檔案上打開。
  3. 之後每次改腳本,只要點該圖示,就會直接用 Cursor 開啟,方便直接使用 AI 功能。

替代做法:直接用 Cursor 開啟整個專案

如果你希望 AI 能理解整個 Godot 專案的上下文(而不只是單一腳本),可以直接用 Cursor 打開專案資料夾:

  1. 在 Cursor 中點擊 Open Folder,選擇你的 Godot 專案資料夾(包含 project.godot 的那一層)。
  2. 此時 Cursor 會把整個專案當作品程開啟,AI 能讀取所有腳本、資源與結構。
  3. 改完後回到 Godot,腳本通常會自動偵測到變更;若沒更新,按右鍵選擇 Reload 即可。

這種方式適合想讓 AI 跨檔案理解邏輯、進行重構或除錯的情境。

使用 Cursor 的 AI 功能

開啟腳本後,你可以用以下快捷鍵呼叫 AI:

  • + L(Mac)/Ctrl + L(Windows):開啟 AI 對話視窗。你可以在這裡向 AI 闡述問題或需求,讓它生成、解釋或修改程式碼。
  • + K(Mac)/Ctrl + K(Windows):在你選中的段落上直接改寫。先選取一段程式,再按快捷鍵並描述你想做的變更。
  • **Tab**:行內補碼。輸入部分邏輯時,Cursor 會建議接下來的內容,按 Tab 接受。

小結

  • Godot 4 不需要套件,只要在 Editor Settings -> Text Editor -> External 把 Cursor 設成外部編輯器。
  • Mac 路徑為 /Applications/Cursor.app/Contents/MacOS/cursor;Windows 則指向 cursor.exe,參數都用 {file}:{line}
  • 想讓 AI 理解全專案,可以直接用 Cursor 開啟整個 Godot 資料夾。
  • 常用快捷鍵:L(對話)、K(選取改寫)、Tab(補碼)。

如果你也用 Unity,可以參考上一篇〔How to use Cursor AI in Unity〕(/2024/09/22/2024-09-22-how-to-use-cursor-ai-in-unity/),兩者的核心概念相同,只是設定位置不同。


《AI 新時代》系列第 13 篇。上一篇:AI 趨勢倫理 · 相關:Cursor in Unity

AI 趨勢展望與倫理議題

這是《AI 新時代》系列的一環。前面 11 篇我們從概念、工具、實作一路走到 Agent,這篇退後一步,帶你看全局:AI 現在到哪了、未來往哪去,以及這些強大技術帶來的倫理責任。讀完你會不僅「會用」,還會「想得清楚」。

發展現況:熱情之後的冷靜

生成式 AI 在 2023 年被捧上天,但到了 2025 年,許多企業發現落地比想像難——整合不易、資料品質參差、投資報酬不明顯。分析師因此用「Gartner 炒作循環(Hype Cycle)」來形容:熱潮過後進入「幻滅谷底」,接著才是務實的成長期。

這對使用者的意義:AI 很強,但不是萬能。把它當成有專長但會犯錯的助手,搭配人的判斷,才是最健康的用法。

四個值得關注的趨勢

1. 多模態成為標準

現在的模型越來越能同時處理文字、圖片、影片、音訊,單一「只會聊天」的 AI 正被「什麼都能懂能做」的多模態模型取代。

2. Agent 生態成形

從第 11 篇的單一步驟工具調用,發展成能自主規劃、多 agent 協作的系統。AI 正在從「對話工具」變成「工作夥伴」。

3. 具身智能(Embodied AI)

把大模型的智慧裝進機器人、無人機等實體,讓 AI 不只是在螢幕裡,而是能在現實世界行動。這仍是早期,但進展迅速。

4. 開放 vs.封閉的競爭

DeepSeek、Qwen、Llama 等開放權重模型持續進步,讓個人與企業能免費本地部署(見第 08 篇),打破大廠對先進模型的壟斷。

必須面對的倫理議題

資料隱私與版權

  • AI 模型多用受版權保護的資料訓練,常未經授權,引發大量訴訟。
  • 個人資料輸入給雲端 AI,可能被記錄或用於訓練。重要資料優先選本地部署。
  • AI 生成內容的版權歸屬,目前法律尚不明確。

深度偽造(Deepfake)與假訊息

  • 能逼真模擬任何人的聲音、臉,被用於詐騙、謠言、惡搞。
  • 看不到真影片也不敢信」成為新社會風險。辨識 AI 生成內容、驗證資訊來源變得重要。

偏見與公平性

  • 模型會繼承訓練資料裡的社會偏見(種族、性別等),輸出可能不公平。
  • 需要人為審查與更多元的訓練資料。

工作與社會影響

  • 自動化會改變許多職缺,部分重複性工作受衝擊最大。
  • 與其擔心「被取代」,不如學習如何與 AI 協作——把 AI 當成放大自己能力的工具。

環境成本

  • 訓練與運行大模型耗電量大,資料中心能源消耗與水資源使用引發關注。

開發者應該準備什麼?

回到你(技術讀者)的角度,幾個具體建議:

  1. 掌握基本操作:會用 Prompt、懂 API、知道怎麼接自己的資料(RAG)。
  2. 學會審查 AI 輸出:AI 會錯、會有偏見、會被注入攻擊,人的判斷不可取代。
  3. 重視安全與隱私:key 管理、權限控制、個人資料處理都要留意。
  4. 保持學習:這個領域幾個月就大變,維持好奇心與實驗精神。

系列總整理

回顧這 12 篇你學到的主線:

階段 主題 一句話重點
觀念 01 生成式 AI 是什麼 LLM 生成文字、Diffusion 生成圖影片
觀念 02 主流產品比較 依場景選模型,沒有最好只有最適合
效率 03 Prompt Engineering 減少了模型的猜測
效率 04 AI Coding 工具 補碼、AI 編輯器、終端 Agent 三型態
實作 05 OpenAI API 發 HTTP 請求,按 token 計費
實作 06 RAG 回答前先檢索你的私人文件
實作 07 Function Calling 讓模型決定調工具,你來執行
實作 08 Local LLM Ollama 本地跑,免費隱私
創作 09 AI 圖像 Diffusion、提示詞、授權
創作 10 影片與語音 Sora/Veo/LTX、ElevenLabs
實作 11 AI Agent 規劃+工具+記憶,自主完成任務
觀念 12 趨勢倫理 強但非萬能,責任並行

小結

  • AI 正從「炒作」走向務實應用,多模態、Agent、具身智能是方向。
  • 隱私、版權、深度偽造、偏見、環境都是真實挑戰。
  • 對開發者:會用 + 會審查 + 重安全,才是長久之道。

感謝閱讀整個系列!如果這些內容幫到了你,歡迎分享給朋友。也歡迎在留言區告訴我,下一個系列你想看什麼主題。


《AI 新時代》系列第 12 篇。上一篇:AI Agent

AI Agent:讓模型自己規劃並執行多步任務

前面我們學了:RAG 讓 AI「讀資料」(第 06 篇)、Function Calling 讓 AI「調工具」(第 07 篇)。當這些能力串起來、讓模型自己決定下一步該做什麼,就變成了 AI Agent(智能體)——這可能是今年最重要的應用方向。

什麼是 Agent?

傳統的 AI 你問一句、它答一句。Agent 則是有「自主性」的 AI:給你一個高層目標,它會自己拆解步驟、選擇工具、執行、檢查結果,直到完成。

比喻:

  • 一般 LLM = 會回答問題的專家。
  • Agent = 給它一個任務、資源和工具,它能像助理一樣自己安排做完。

Agent 的三個核心元件

元件 作用 對應前面哪篇
規劃(Planning) 把大目標拆成小步驟 無,Agent 特有
工具調用(Tool Use) 執行每一步需要的動作 Function Calling(07 篇)
記憶(Memory) 記住已做什麼、結果如何 RAG / 對話歷史(06/05 篇)

有了這三個,Agent 才能「思考 → 行動 → 觀察 → 再思考」。

ReAct:最主流的 Agent 模式

ReAct = Reasoning(推理)+ Acting(行動)。它把過程明確分成循環:

1
思考 (Think) → 行動 (Act) → 觀察 (Observe) → 思考 → …… → 結論

舉例:目標是「幫我做一趟東京旅行的規劃」:

  1. Think:「我需要知道東京的熱門景點。」→ 行動:呼叫旅遊 API。
  2. Observe:拿到景點清單。
  3. Think:「再查交通票券。」→ 行動:呼叫訂票工具。
  4. Observe:拿到票券資訊與價格。
  5. Think:「整合成一日行程表。」→ 輸出最終結果。

每一步都「邊想邊做、根據回饋調整」,所以比一次生成的答案更可靠。

用框架來實作

自己從零寫 Agent 很繁瑣,通常用現成框架:

  • LangChain / LangGraph:Python/JS 最流行,工具與鏈結方便,適合各種場景。
  • AutoGen(Microsoft):強調多Agent對話,讓多個有不同角色的 agent 協作完成任務。
  • CrewAI、LlamaIndex:各自在團隊協作、資料檢索上有專長。

對你這種有 Java/Python 背景的人,從 LangChain 入手最順。

實際應用案例

  • 程式開發 Agent:讀整個 repo、自動修 bug、寫測試、做重構(接第 04 篇的 Claude Code、OpenCode)。
  • 資料分析:連資料庫、跑查詢、生成報表與圖表。
  • 自動化工作流:監控郵件 → 分類 → 摘要 → 發通知。
  • 研究助理:多網站查資料 → 交叉驗證 → 整理成報告(結合 RAG)。

要注意的現實問題

  • 會跑飛:Agent 可能執行與目標無關的操作,一定要設邊界、可中斷。
  • 累積錯誤:步驟越多,前面錯一步後面全歪的風險越高。
  • 成本與速度:每一步都是一次模型請求,多步 Agent 的 token 消耗快。
  • 安全:能執行指令/改檔案的 Agent,權限要收緊,避免被提示注入(prompt injection)操縱去做惡意動作。

小結

  • Agent = 有自主性、能自己規劃並用工具完成多步任務的 AI。
  • 三元件:規劃 + 工具調用 + 記憶;主流模式是 ReAct
  • LangChain / AutoGen 等框架加速開發。
  • 潛力大但要設邊界,注意跑飛、累積錯誤、成本與安全。

這是把前面所有能力整合的終極形態。最後一篇,我們退後一步看全局:AI 趨勢展望與倫理議題


《AI 新時代》系列第 11 篇。上一篇:AI 影片與語音 · 下一篇預告:AI 趨勢與倫理

AI 影片與語音生成:Sora、Veo、LTX-Video、ElevenLabs

圖像已經夠強,更動的影片和語音這兩年也爆發性進展。這篇文章把這些工具串成一個完整的「AI 多模態創作」地圖,並在文末接上本站的 LTX-Video、ComfyUI 實作教學。

AI 生成影片:技術現況

文字或圖像生成影片(Text-to-Video / Image-to-Video)是近年來進步最快的領域。2026 年主流產品:

工具 廠商 特色
Sora OpenAI 知名度最高、時長與物理真實感強
Veo Google 品質高、常附帶音軌、整合 YouTube
LTX-Video Lightricks 開源、可本地部署、速度快

兩種主要方式

  1. Text-to-Video(文字生影片):只給一句描述,模型直接生成。適合概念短片、靈感素材。
  2. Image-to-Video(圖生影片):給一張基圖 + 動機描述,讓圖片「動起來」。可控性較高,本站 LTX-Video 教學中的範例即屬此類。

接上本站的 LTX-Video 實作教學

本站先前用 Python 實際跑過開源、可本地部署的 LTX-Video,這個流程正是 AI 影片創作的標準範式:

1
2
3
4
5
6
7
8
9
# 文字生成影片
python inference.py --ckpt_path /path/to/ltx-video-2b \
--prompt "A monkey dance" --height 768 --width 1024 \
--num_frames 10 --seed 2

# 圖片生成影片
python inference.py --ckpt_path /path/to/ltx-video-2b \
--prompt "A monkey dance" --input_image_path /path/image.png \
--height 768 --width 1024 --num_frames 200 --frame_rate 20 --seed 3

注意版本:LTX-Video 更新很快,範例中的 v0.9.1 已是舊版,目前 2B 最新是 0.9.8 系列。實際檔名請到 HuggingFace(Lightricks/LTX-Video) 下載最新的 2B checkpoint 後替換。

幾個重點參數:--prompt(描述)、--seed(固定種子重複)、--num_frames(幀數,決定長度)、--frame_rate(每秒幀數)。

本地 vs 雲端怎麼選?

  • LTX-Video 本地跑:免費、隱私、可批量,但吃硬體(尤其長影片、高幀數)。
  • Sora / Veo 雲端:品質與方便度高,按量付費,不用管硬體。

實務上很多人用雲端做高品質成品,用開源模型做快速迭代測試。

AI 語音與配音

除了畫面,聲音也是創作的關鍵:

工具 用途 特色
ElevenLabs 文字轉語音(TTS) 擬真度最高、多語言、可克隆聲音
Suno AI 生成歌曲 填詞就出歌,含演唱
語音克隆(Voice Cloning) 複製特定聲音 用於配音、有聲書,但倫理風險高

AI 配音流程通常是:腳本 → TTS 產生語音 → 剪輯合成到影片。ElevenLabs 目前是這個領域的標竿。

倫理與版權(多模態更要小心)

動態內容的風險比圖像更高:

  • 深度偽造(Deepfake):用他人聲音/臉生成虛假影片,可能被用於詐騙、謠言,已有法律制裁。
  • 聲音克隆授權:複製任何人(含自己以外)的聲音做商用,需取得同意。
  • 內容標示:多地法規要求 AI 生成的影音必須標註,避免誤導。

這也是為什麼工具方都開始加入水印與偵測機制。創作自由與責任要平衡。

小結

  • AI 影片分 文字生影片圖生影片,2026 主流是 Sora、Veo、開源的 LTX-Video。
  • 本地跑 LTX-Video 用 --prompt/--seed/--num_frames/--frame_rate,雲端用 Sora/Veo 取品質(本站有完整教學)。
  • ElevenLabs 是 AI 配音標竿,可支援語音克隆。
  • 深度偽造、聲音克隆授權、內容標示是必須重視的倫理法律紅線。

學會圖、聲、影片後,最後把「能讀能做」的能力整合起來——下一篇:AI Agent


《AI 新時代》系列第 10 篇。上一篇:AI 圖像生成 · 下一篇預告:AI Agent

AI 圖像生成:Midjourney / Stable Diffusion / Firefly

上一篇聊到 LLM 處理文字,這篇換個心情看 AI 畫圖。你會發現「畫圖」和「聊天」背後其實是不同類型的模型(上篇《什麼是生成式 AI》提過的 Diffusion)。這篇文章帶你理解原理、比較工具、學會寫提示詞。

原理回顧:Diffusion 是怎麼畫的?

記憶一下:Diffusion 模型從全雜訊的圖片開始,反覆「去噪」一步步清成清晰圖像,而你給的描述會引導清理的方向。所以 AI 畫圖本質上是從隨機噪音中,把你想看的東西慢慢顯現出來

三大工具比較

工具 類型 優點 適合誰
Midjourney 線上服務 藝術感、美感強、風格化佳 設計師、想要高完成度插畫的人
Stable Diffusion 開源、可本地 免費、可自訂、可本地部署(本站另有 ComfyUI 實作教學) 想深度控制、玩本地部署的技術人
Adobe Firefly 線上服務 商業授權安全、與 Photoshop 整合 專業設計、商用素材、怕版權問題的人

怎麼寫好的圖像提示詞?

跟文字 Prompt 原相通,但更強調「視覺元素」。一個完整公式:

主題 + 細節 + 風格 + 燈光 + 構圖 + 品質修飾詞

範例對比:

  • ❌ 「一隻貓」
  • ✅ 「一隻橘貓坐在窗台上,油畫風格,溫暖的夕陽光,景深效果,高細節,傑作」

常用修飾詞:

  • 風格水彩 (watercolor)像素風 (pixel art)3D 渲染賽博龐克 (cyberpunk)扁平插畫 (flat illustration)
  • 燈光自然光霓虹燈黃金時刻 (golden hour)影棚光
  • 構圖特寫廣角俯視角對稱構圖
  • 品質高細節4K傑作 (masterpiece)

兩個重要觀念

負向提示詞(Negative Prompt)

告訴模型「不要什麼」,能有效減少 unwanted 的元素。例如:低品質、模糊、多手指、水印。這個設定在後續的 ComfyUI 實作教學裡會實際用到。

種子(Seed)

每次生成都是隨機的。固定 seed 就能重複出同一張圖,方便你在現有基礎上微調。這是「改一點點」而不是「重畫」的關鍵。

接上本站的 ComfyUI 實作教學

本站先前介紹過《Mac 使用 ComfyUI》,Stable Diffusion 最強大的地方就是能在本地用 ComfyUI 完成從設定到出圖的完整流程:

  • Img2Img(圖生圖):給一張基圖,調整去噪強度(denoising),讓 AI 在原有基礎上變化。這與影片生成「圖生影片」的思路雷同。
  • ControlNet:用線稿或姿勢來精確控制構圖。
  • 擴充/重繪(Inpainting):只改圖片的某個區域,例如換背景、修細節。

如果還沒實際操作 ComfyUI,可以把這篇學到的提示詞技巧直接套進教學裡的 workflow 試試。

一定要知道的:授權與版權

  • 商用前看清授權:Midjourney 付費方案才具商用權;Firefly 因用授權資料訓練,商業最安全。
  • 別生成侵權內容:模仿特定註冊角色、商標或有版權的風格,可能有法律風險。
  • 各地法規不同:AI 生成內容的版權歸屬目前仍在發展中,商用前最好確認當地規範。

小結

  • AI 畫圖靠 Diffusion 模型,從噪音逐步顯影。
  • Midjourney 美感強、Stable Diffusion 可本地自訂(本站另有 ComfyUI 實作教學)、Firefly 商用最安全。
  • 好提示詞 = 主題 + 細節 + 風格 + 燈光 + 構圖,善用負向提示與 seed。
  • 授權與版權一定要留意,尤其商用時。

下一篇看更動的:AI 影片與語音生成(Sora、Veo、LTX-Video、ElevenLabs)。


《AI 新時代》系列第 09 篇。上一篇:Local LLM · 下一篇預告:AI 影片與語音

Local LLM 部署:用 Ollama 在自己的電腦跑大模型

付費 API 雖然方便,但有兩個痛點:用多了要花錢,而且資料會傳到別人伺服器。如果你重視隱私、想免費測試、或需要離線環境,本地部署大模型就是答案。

這篇文章帶你用 Ollama(目前最流行的本地模型工具)在自己的電腦跑起來。你之前看過《Mac 安裝 ComfyUI》,這篇的步驟同樣簡單。

為什麼要本地部署?

  • 隱私:資料永遠留在自己機器,不上傳。
  • 免費:不用付 API token 費用(只有電費與硬體成本)。
  • 離線可用:沒有網路也能用。
  • 開發測試:接進自己的程式做原型,不用付錢調來調去。

安裝 Ollama

  1. https://ollama.com 下載對應作業版本的安裝包並安裝。
  2. 安裝後開啟終端機(Mac/Linux 的 Terminal),Ollama 會自動在背景執行。
  3. 驗證:輸入 ollamaollama list,沒報錯就成功了。

選一個模型跑起來

Ollama 上有大量開放權重模型。2026 年較熱門的幾個(依 Ollama 排行):

模型 適合場景 硬體需求
Qwen3(阿里) 多語言、程式、文字為主 小(8B 約 5GB),入門首選
Llama 4(Meta) 多語言、程式、原生多模態(能看圖) 較大(Maverick 約 67GB),需較好硬體

初次使用建議從小尺寸開始(例如 Qwen3 的 8B 級,約 5GB),確認硬體跟得上再換大的。想測試能「看圖」的多模態模型,可以試 Llama 4(Maverick 版約 67GB,記憶體要夠)。

一行命令下載並執行

1
2
3
4
5
# 入門:小、快,適合大多數電腦
ollama run qwen3:8b

# 多模態(能理解圖片),硬體要求較高
ollama run llama4:16x17b

跑起來後,終端機就會變成一個聊天視窗,直接打字提問即可。按 Ctrl+D 或輸入 /exit 離開。

常用指令:

1
2
3
ollama list          # 列出已下載的模型
ollama pull qwen3:8b # 只下載不立即對話
ollama rm qwen3:8b # 刪除模型

你的硬體跟得上嗎?

本地跑模型最看重 RAM(記憶體)VRAM(顯存,若有 NVIDIA 卡)。規則大致是:

  • 模型參數越大,需要的記憶體越多。一個大概估算法:7B 模型約需 4~6GB,70B 則要 40GB 以上。
  • Mac 使用者:統一記憶體(Unified Memory)越大越好,M 系列晶片對本地模型支援佳。
  • 跑不動大模型? 用較小尺寸或「量化版」(檔名常帶 :b:q),犧牲一點精度換更小佔用。

接進自己的程式(OpenAI 相容 API)

Ollama 內建一個 OpenAI 相容的本地 API,所以上一篇寫的程式碼幾乎不用改就能改用本地模型:

1
2
# 預設監聽 localhost:11434
ollama serve

Python 呼叫範例(把 base_url 指向本地):

1
2
3
4
5
6
7
8
9
10
11
12
from openai import OpenAI

client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama", # 本地模型隨便填
)

response = client.chat.completions.create(
model="qwen3:8b",
messages=[{"role": "user", "content": "解釋什麼是向量資料庫"}],
)
print(response.choices[0].message.content)

這樣你就用免費、離線的模型跑出了跟 OpenAI 一樣的程式。

接進開發工具

Ollama 也能直接接進編輯器與 AI 開發代理(例如 Claude Code、OpenCode),在 ollama 的整合清單裡就能看到。設定後,寫碼時調用的就是你本地的模型,既免費又隱私。

小結

  • Ollama 是本地上線大模型最簡單的工具,一行命令即可。
  • 2026 熱門本地模型:Qwen3(入門)、Llama 4(多模態),依硬體選尺寸。
  • 重點看硬體(RAM/VRAM),跑不動就換小尺寸或量化版。
  • 內建 OpenAI 相容 API,上一篇的程式碼幾乎不用改就能本地化。

學會本地模型後,你已經能免費玩各種 AI。下一篇回到創作面向:AI 圖像生成


《AI 新時代》系列第 08 篇。上一篇:Function Calling · 下一篇預告:AI 圖像生成

密碼產生器

本密碼產生器使用瀏覽器內建的加密隨機數(crypto.getRandomValues)生成高强度随机密码,可自定义长度、字元類型(大小寫、數字、符號)、排除易混淆字元,並即時顯示強度。全部在本地執行,密碼不會上傳或記錄。

更多開發工具:QR Code 產生器台灣測試資料產生器

QR Code 產生器

本 QR Code 產生器可將任意文字或網址即時轉換為 QR 碼,支援調整尺寸與容錯等級,並可直接下載 PNG 圖檔。全部在瀏覽器前端生成,不會上傳任何資料。

更多開發工具:密碼產生器JSON 格式化