AI Agent:讓模型自己規劃並執行多步任務

前面我們學了:RAG 讓 AI「讀資料」(第 06 篇)、Function Calling 讓 AI「調工具」(第 07 篇)。當這些能力串起來、讓模型自己決定下一步該做什麼,就變成了 AI Agent(智能體)——這可能是今年最重要的應用方向。

什麼是 Agent?

傳統的 AI 你問一句、它答一句。Agent 則是有「自主性」的 AI:給你一個高層目標,它會自己拆解步驟、選擇工具、執行、檢查結果,直到完成。

比喻:

  • 一般 LLM = 會回答問題的專家。
  • Agent = 給它一個任務、資源和工具,它能像助理一樣自己安排做完。

Agent 的三個核心元件

元件 作用 對應前面哪篇
規劃(Planning) 把大目標拆成小步驟 無,Agent 特有
工具調用(Tool Use) 執行每一步需要的動作 Function Calling(07 篇)
記憶(Memory) 記住已做什麼、結果如何 RAG / 對話歷史(06/05 篇)

有了這三個,Agent 才能「思考 → 行動 → 觀察 → 再思考」。

ReAct:最主流的 Agent 模式

ReAct = Reasoning(推理)+ Acting(行動)。它把過程明確分成循環:

1
思考 (Think) → 行動 (Act) → 觀察 (Observe) → 思考 → …… → 結論

舉例:目標是「幫我做一趟東京旅行的規劃」:

  1. Think:「我需要知道東京的熱門景點。」→ 行動:呼叫旅遊 API。
  2. Observe:拿到景點清單。
  3. Think:「再查交通票券。」→ 行動:呼叫訂票工具。
  4. Observe:拿到票券資訊與價格。
  5. Think:「整合成一日行程表。」→ 輸出最終結果。

每一步都「邊想邊做、根據回饋調整」,所以比一次生成的答案更可靠。

用框架來實作

自己從零寫 Agent 很繁瑣,通常用現成框架:

  • LangChain / LangGraph:Python/JS 最流行,工具與鏈結方便,適合各種場景。
  • AutoGen(Microsoft):強調多Agent對話,讓多個有不同角色的 agent 協作完成任務。
  • CrewAI、LlamaIndex:各自在團隊協作、資料檢索上有專長。

對你這種有 Java/Python 背景的人,從 LangChain 入手最順。

實際應用案例

  • 程式開發 Agent:讀整個 repo、自動修 bug、寫測試、做重構(接第 04 篇的 Claude Code、OpenCode)。
  • 資料分析:連資料庫、跑查詢、生成報表與圖表。
  • 自動化工作流:監控郵件 → 分類 → 摘要 → 發通知。
  • 研究助理:多網站查資料 → 交叉驗證 → 整理成報告(結合 RAG)。

要注意的現實問題

  • 會跑飛:Agent 可能執行與目標無關的操作,一定要設邊界、可中斷。
  • 累積錯誤:步驟越多,前面錯一步後面全歪的風險越高。
  • 成本與速度:每一步都是一次模型請求,多步 Agent 的 token 消耗快。
  • 安全:能執行指令/改檔案的 Agent,權限要收緊,避免被提示注入(prompt injection)操縱去做惡意動作。

小結

  • Agent = 有自主性、能自己規劃並用工具完成多步任務的 AI。
  • 三元件:規劃 + 工具調用 + 記憶;主流模式是 ReAct
  • LangChain / AutoGen 等框架加速開發。
  • 潛力大但要設邊界,注意跑飛、累積錯誤、成本與安全。

這是把前面所有能力整合的終極形態。最後一篇,我們退後一步看全局:AI 趨勢展望與倫理議題


《AI 新時代》系列第 11 篇。上一篇:AI 影片與語音 · 下一篇預告:AI 趨勢與倫理