AI Agent:讓模型自己規劃並執行多步任務
前面我們學了:RAG 讓 AI「讀資料」(第 06 篇)、Function Calling 讓 AI「調工具」(第 07 篇)。當這些能力串起來、讓模型自己決定下一步該做什麼,就變成了 AI Agent(智能體)——這可能是今年最重要的應用方向。
什麼是 Agent?
傳統的 AI 你問一句、它答一句。Agent 則是有「自主性」的 AI:給你一個高層目標,它會自己拆解步驟、選擇工具、執行、檢查結果,直到完成。
比喻:
- 一般 LLM = 會回答問題的專家。
- Agent = 給它一個任務、資源和工具,它能像助理一樣自己安排做完。
Agent 的三個核心元件
| 元件 | 作用 | 對應前面哪篇 |
|---|---|---|
| 規劃(Planning) | 把大目標拆成小步驟 | 無,Agent 特有 |
| 工具調用(Tool Use) | 執行每一步需要的動作 | Function Calling(07 篇) |
| 記憶(Memory) | 記住已做什麼、結果如何 | RAG / 對話歷史(06/05 篇) |
有了這三個,Agent 才能「思考 → 行動 → 觀察 → 再思考」。
ReAct:最主流的 Agent 模式
ReAct = Reasoning(推理)+ Acting(行動)。它把過程明確分成循環:
1 | 思考 (Think) → 行動 (Act) → 觀察 (Observe) → 思考 → …… → 結論 |
舉例:目標是「幫我做一趟東京旅行的規劃」:
- Think:「我需要知道東京的熱門景點。」→ 行動:呼叫旅遊 API。
- Observe:拿到景點清單。
- Think:「再查交通票券。」→ 行動:呼叫訂票工具。
- Observe:拿到票券資訊與價格。
- Think:「整合成一日行程表。」→ 輸出最終結果。
每一步都「邊想邊做、根據回饋調整」,所以比一次生成的答案更可靠。
用框架來實作
自己從零寫 Agent 很繁瑣,通常用現成框架:
- LangChain / LangGraph:Python/JS 最流行,工具與鏈結方便,適合各種場景。
- AutoGen(Microsoft):強調多Agent對話,讓多個有不同角色的 agent 協作完成任務。
- CrewAI、LlamaIndex:各自在團隊協作、資料檢索上有專長。
對你這種有 Java/Python 背景的人,從 LangChain 入手最順。
實際應用案例
- 程式開發 Agent:讀整個 repo、自動修 bug、寫測試、做重構(接第 04 篇的 Claude Code、OpenCode)。
- 資料分析:連資料庫、跑查詢、生成報表與圖表。
- 自動化工作流:監控郵件 → 分類 → 摘要 → 發通知。
- 研究助理:多網站查資料 → 交叉驗證 → 整理成報告(結合 RAG)。
要注意的現實問題
- 會跑飛:Agent 可能執行與目標無關的操作,一定要設邊界、可中斷。
- 累積錯誤:步驟越多,前面錯一步後面全歪的風險越高。
- 成本與速度:每一步都是一次模型請求,多步 Agent 的 token 消耗快。
- 安全:能執行指令/改檔案的 Agent,權限要收緊,避免被提示注入(prompt injection)操縱去做惡意動作。
小結
- Agent = 有自主性、能自己規劃並用工具完成多步任務的 AI。
- 三元件:規劃 + 工具調用 + 記憶;主流模式是 ReAct。
- 用 LangChain / AutoGen 等框架加速開發。
- 潛力大但要設邊界,注意跑飛、累積錯誤、成本與安全。
這是把前面所有能力整合的終極形態。最後一篇,我們退後一步看全局:AI 趨勢展望與倫理議題。
《AI 新時代》系列第 11 篇。上一篇:AI 影片與語音 · 下一篇預告:AI 趨勢與倫理