AI AgentAI Agent 教學n8nAI

AI Agent 教學:四個元件,組出會自己做事的 AI

2026年6月9日·26 分鐘閱讀

前言

想自己做一個 AI Agent 的人,工具多半都會用,卡住的是不知道一個 Agent 由哪幾塊組成、哪一塊該先做。這篇把它拆成大腦、記憶、手腳、排程四個元件,每一塊配一個我線上實際在跑的流程,再給你三種工具路線的門檻比較、第一個 Agent 的四個步驟,以及做出來之後怎麼驗、為什麼會爛掉、token 到底花在哪

AI Agent 是什麼?跟「有接了 AI」的系統差在哪

現在幾乎每個產品都說自己有 AI,但有用 AI 不等於是 AI Agent。分界點在誰決定流程。你把步驟寫死、模型只負責其中一站,那是一條資料管線;你給它一個目標、讓它自己決定下一步做什麼,才進入 Agent 的範圍。

AI Agent 自主程度光譜示意圖:從純問答、加知識庫、加工具、會自己規劃,到多代理協作,越往右自主程度越高,分水嶺在會不會自己決定下一步 AI Agent 自主程度光譜 Agent 分水嶺 1 2 3 4 5 純問答 只有大腦 加知識庫 答得出你的事 加工具 會自己去查 會自己規劃 拆成好幾步 多代理協作 幾個 Agent 分工 第一個 Agent 做到中間偏左就夠用 Q kangber
從純問答到多代理協作,越往右自主程度越高;分水嶺在第 3 格跟第 4 格中間,也就是它會不會自己決定下一步。

自主程度的光譜

Agent 不是一個開關。最左邊是純問答,只有一顆大腦,你問一句它答一句;往右加上知識庫,它開始答得出你的事;再往右它會自己呼叫工具去查;再往右它會把一個目標拆成好幾步自己走完;最右邊是好幾個 Agent 分工協作。越往右自主程度越高,中間沒有一條明確的線,比較像一根滑桿。你第一次自己做的東西通常落在中間偏左,這很正常,也比較好維護。

分水嶺:會不會自己決定下一步

真要挑一個位置當分界,就看系統會不會自己決定下一步。一般 AI 功能的路線是你定的:先做 A、再做 B、輸出 C。Agent 拿到的是目標,它會自己想「先查資料,查完發現不夠,再查一次,然後整理,最後輸出」。這種想一下、做一步、看結果、再想下一步的循環,是 Agent 跟其他東西最實際的差別。它不照寫死的步驟走,邊做邊判斷。

管線型 vs Agent 型

我手上兩套線上的東西剛好一邊一個。AI 工具排行榜網站 AICommand 的流程是:去 Reddit、GitHub、Hacker News 撈大家在討論哪些工具,用模型把每則討論抽成結構化資料(提到哪個工具、評價正負面),再算分排名。這裡確實用了模型,但它不是 Agent:流程是我寫死的,模型是管線中間負責抽取的那一站,它不會自己決定要多爬一輪,也改不了流程。

AICommand AI 工具排行榜網站實際畫面,彙整 Reddit、Hacker News、GitHub 等社群討論並依熱度排名 AI 工具
AICommand 把多個社群的討論爬下來、用模型抽取成結構化資料再排名,AI 是管線中的一站,流程由我寫死。

另一套監控 Threads 的系統就不一樣。它定時撈相關貼文,用模型判斷每則該不該回、適合怎麼回,把建議回覆寫成候選清單,然後停下來等我按核准,才真的發出去。它自己做了判斷、自己擬了行動,我只在「送出去」前面卡了一道人工閘門。

真實的 n8n「Threads 海巡 A」工作流畫布截圖:定時排程、Threads 關鍵字搜尋、Groq 分類、寫入候選表、LINE 通知共 13 個節點依序串接
海巡系統的 n8n 真實畫布:撈取→模型判斷→寫候選→通知我,流程到此為止,人工核准後才由另一條工作流發送。
比較項管線型(有接 AI)Agent 型
誰決定流程人事先寫死AI 依目標自己決定下一步
能不能中途改主意不行,固定路線可以,邊做邊判斷
AI 的角色管線裡的一個節點整套流程的主導者
適合的任務固定、重複、要穩多變、要查、要判斷
出錯時好不好抓好抓,看是哪一站壞了難抓,要回放它每一輪的想法

「AI 架構」講的是同一件事嗎

搜「AI 架構」會跑出兩種完全不同的東西。一種是雲端大廠和硬體商講的基礎建設:要多少張顯示卡、資料放哪、模型怎麼大規模訓練,那是有 MLOps 團隊的公司在煩惱的。另一種是應用層:怎麼把一個會做事的 AI 組起來。這篇講的是後者,而 AI Agent 就是應用層架構長到「會自己決定下一步」時的樣子。架構在講元件怎麼組,Agent 在講組到會自己行動的那個結果,兩個詞指的是同一件事的兩種視角。

AI Agent 由四個元件組成:大腦、記憶、手腳、排程

把 Agent 拆開,會做事的部分就是這四塊。理解它們之後,你看任何 AI 產品都可以直接問四個問題:它的大腦是誰?記不記得你的事?有沒有手腳?誰按下開工鍵?問完,它的骨架就露出來了。

AI Agent 四個元件示意圖:大腦(LLM)負責判斷、記憶(知識庫)讓它講你的事、手腳(工具)讓它能查能動、排程(觸發)決定它何時開工 AI Agent 四個元件 大腦 語言模型,負責判斷 記憶 知識庫,講你的事 手腳 工具,能查能動 排程 觸發,決定何時開工 四個到齊,再加一個決策循環 Q kangber
一套會做事的 AI=大腦+記憶+手腳+排程,四個元件缺一就少一種能力。

大腦(LLM):理解與生成

大腦就是大型語言模型,GPT、Claude、Gemini,或跑在 Groq、OpenRouter 上的那些。它負責讀懂你的話、生出回應,也負責 Agent 那個「想下一步」的判斷。只有大腦的 AI 只會聊天,它不知道你公司的事,也不能替你做任何動作,像一個腦袋很靈光但剛報到、什麼都還沒交接的新人。

挑模型時先看兩件事:支不支援 function calling(不支援就長不出手腳),以及它的回應速度跟你的場景搭不搭。要即時回客人的用快的,跑夜間批次的可以用慢一點但便宜的。

📖 延伸閱讀AI 為什麼一句指令就懂?Agent 推理與規劃

記憶(知識):讓它講你的事

要讓模型不再只講通則,得餵它知識。做法是把一份知識庫塞進它每次回答前要讀的內容裡,這是 RAG(檢索增強)的入門版。我網站上那隻助理黃小瓜瓜就是這樣組的:一個跑在 Groq 上的模型當大腦,加一份我自己寫的知識庫當記憶。它答得出「Q kangber 有哪些服務」,不是因為模型本來就認識我,是它每次回答前都先讀過那份我餵的知識

網站 AI 助理黃小瓜瓜的實際對話截圖:訪客問「Q kangber 提供哪些服務」,它讀取知識庫後回答 n8n 自動化與 AI 應用開發等服務
黃小瓜瓜的實際對話:問它服務,它答得出「兩大類:流程自動化與 AI 應用開發」,這就是大腦(模型)+記憶(知識庫)。

記憶分兩層。同一段對話裡記得你上一句講過什麼,是短期記憶;跨對話都查得到的那份資料,是長期知識庫。第一次做只需要長期那層,把常見問答整理成一份文件就能開始,不用一上來就架向量資料庫。

📖 延伸閱讀AI 為什麼總忘記你說過的話?Agent 記憶原理

手腳(工具):能查、能動

模型的知識停在它被訓練的那一刻,問它今天的事它不會知道。工具就是給 AI 裝上手腳,讓它能查即時資料、能呼叫外部服務。我幫文章找資料的那條流程裡,AI Agent 會先自己呼叫 Tavily 搜尋去查最新資料,查完才往下寫。跨過這一步,它就從「用腦袋裡的舊知識講」變成「會自己出去查了再講」。

真實的 n8n 工作流畫布:兩個 AI Agent 節點各自透過 Tool 端口連接 tavily Tool 搜尋工具
工作流裡的真實畫面:AI Agent 節點透過 Tool 端口掛著 tavily Tool,那個吊在下面的搜尋工具就是 AI 的手腳。

在 n8n 裡,工具是掛在 AI Agent 節點下面那排 Tool 端口上的;自己寫程式的話就是 function calling 的工具定義。兩邊原理一樣:你描述有哪些工具可用、各自吃什麼參數,模型自己決定什麼時候呼叫誰。

📖 延伸閱讀AI 怎麼查資料、寄信、操作資料庫?拆解 Tool Calling 運作原理MCP 是什麼?讓 Claude 直接操作你的 Figma 和 n8n

排程(任務):誰觸發、跑哪幾步

排程決定這套東西是你開口它才動,還是時間到了自己開工。監控社群那套是定時自動撈新貼文,不需要我盯著。觸發方式大致兩類:時間排程(每天早上八點半跑一次)跟事件觸發(有人填表單、收到訊息、收到 webhook 就跑)。排程決定它是被動等你的工具,還是主動幫你跑的助手

📖 延伸閱讀AI Agent 什麼時候開始動手?排程與事件觸發拆解

元件負責什麼少了它會怎樣第一次做要不要
大腦(LLM)理解語言、生成回應、判斷下一步連話都聽不懂,沒有 AI一定要
記憶(知識)讓回答貼合你的情境只會講通則,答不出你的事建議要
手腳(工具)查即時資料、呼叫外部服務被舊知識困住,不能做事第二階段再加
排程(任務)決定何時觸發、跑哪幾步永遠被動等指令,不會主動最後再加

看懂四個元件,跟真的把流程接起來、在客戶那邊跑得穩,是兩件事。

看 n8n 自動化服務

AI Agent 可以拿來做什麼?六個真的在跑的場景

下面六個都是我自己或幫客戶接過的類型,難度由低到高排。

客服與內部知識查詢

這是最好上手的一類。把公司的服務說明、報價規則、常見問答整理成一份知識庫,接上模型,就能回答八成的重複問題。只需要大腦加記憶兩個元件,不用工具、不用排程。我網站上的黃小瓜瓜就是這一類,做完之後我少回了很多「你們有做什麼」的訊息。

資料監控與通知

定時去某個地方看有沒有新東西,有的話判斷值不值得通知你。社群關鍵字、競品官網、Google Search Console 的排名變化都可以。這類要大腦、手腳、排程三塊,記憶可有可無。判斷那一層是價值所在:沒有模型的話你會收到一堆雜訊通知,加了模型它會幫你先篩。

內容產製與發布

從找資料、擬草稿到排版發布。我的電子報就是這樣跑的,模型負責選材、去重、寫短評,最後停在草稿階段等我看過。這類會用到全部四個元件,而且一定要留人工核准,因為輸出會對外。

文件解析與登錄

把照片或 PDF 丟進去,模型讀出裡面的欄位,寫進試算表。我做過施工日報表的解析流程,工地拍一張日報表照片,模型抽出日期、工項、人數這些欄位再入庫。模型讀得懂那張表,難的是外部服務會間歇性失敗,得自己補重試機制。

報表整理

從幾個來源把數字撈回來、算好、寫成一份人看得懂的摘要。廣告成效、電商訂單、網站流量都適用。這類多半用管線就夠,模型只負責最後把數字寫成人話那一段,不需要做成完整的 Agent。

開發輔助

讓 AI 讀你的專案、改程式碼、跑測試。Claude Code、Cursor 這類工具本身就是高自主度的 Agent,你不用自己組,但值得拿來當範本看:它們怎麼決定先讀哪個檔案、什麼時候停下來問你。

場景最少要哪幾個元件難度要不要人工閘門
客服與知識查詢大腦+記憶對外回覆建議要
資料監控與通知大腦+手腳+排程不用,只通知你
內容產製與發布四個都要中高一定要
文件解析與登錄大腦+手腳+排程寫進正式系統前要
報表整理大腦+排程不用
開發輔助四個都要提交程式碼前要

用什麼工具做 AI Agent?三種路線門檻差很多

同樣一個 Agent,用三種路線都做得出來,差別在你要花多少時間學、之後改起來順不順。

無程式碼:n8n

拉節點連線就能組出流程,AI Agent 是其中一個節點,模型跟工具用拉的掛上去。優點是整條流程看得見,哪一站壞了一眼就知道;而且它同時是自動化工具,串 Google Sheets、LINE、Gmail 這些都有現成節點,不用自己寫串接。缺點是要跑得穩得自己找地方架,或用它的雲端版。沒有寫程式底子的話,這條路線最快看到成果

📖 延伸閱讀n8n 從 0 到 40 分入門攻略:Zeabur 雲端部署 x 8 大基本節點全解析

半程式:Dify、Coze

介面比 n8n 更專注在 AI 應用本身,知識庫、提示詞、工具都有現成的設定頁,發佈成一個聊天機器人特別快。代價是它偏向做對話型的應用,要接一堆外部系統、做複雜的分支邏輯時會比 n8n 綁手綁腳。想做客服機器人、內部知識問答,這條路線很省事。

全程式:LangChain、Agents SDK

自己寫程式呼叫模型、自己定義工具、自己控制那個決策循環。彈性最大,要做多個 Agent 互相協作、要精細控制每一輪送什麼進去,只有這條路做得到。代價是所有錯誤處理、重試、記錄都要自己寫,第一版跑起來很快,跑得穩很慢。

路線代表工具上手時間適合誰會卡在哪
無程式碼n8n一個週末要串很多外部系統的人自架與版本維護
半程式Dify、Coze一兩個晚上只想做對話型應用複雜分支邏輯做不出來
全程式LangChain、Agents SDK數週已經會寫程式、要客製錯誤處理全部自己來

三條路線各有各的適用場合。我自己線上跑的東西幾乎都在 n8n 上,理由很現實:出事的時候我要能在畫布上一眼看出卡在哪一站,而不是翻 log。

動手做第一個 AI Agent,從四個步驟開始

下面這四步是照光譜由左往右走,每一步跑順了再加下一塊。用 n8n 示範,換成別的工具邏輯一樣。

步驟一:挑一個小到你會做完的任務

第一個 Agent 最容易死在題目太大。挑任務的標準是:你每週真的會重複做、而且做錯了不會出事。「幫我回覆所有客戶信件」不合格,「幫我把這週的產業新聞整理成五則摘要」剛好。題目小,你才有機會在一個晚上看到它跑完,那個成就感決定你會不會做第二個。

步驟二:接上大腦,先讓它會回答

在 n8n 裡拉一個 AI Agent 節點,下面掛一個 Chat Model 子節點,選你的模型、填好憑證。這時候它就是一隻純聊天的機器人,你在 Chat 面板打字它會回。先在這個狀態把提示詞調到滿意再往下走,提示詞沒調好就加工具,後面出錯你會分不清是誰的問題。

真實的 n8n 工作流畫布:Basic LLM Chain 節點下方透過 Model 端口吊著一個 Groq 模型子節點,上下兩條流程分別由每日排程與週一排程觸發
模型子節點掛上去之後的實際長相:畫布中間那個 Basic LLM Chain 節點,下面用 Model 端口吊著一顆 Groq 模型。換成 AI Agent 節點,掛法一樣。

步驟三:餵一份知識庫,讓它答你的事

把你要它知道的事整理成一份文件,內容寫得像給新同事看的交接單,不用寫成論文。接法有兩種:內容不多就直接塞進系統提示詞,量大再走向量資料庫。第一次做建議用前者,一份兩三千字的文件塞進提示詞完全跑得動,你可以省掉整套向量資料庫的設定。

步驟四:掛上工具,讓它自己去查

在 AI Agent 節點下面的 Tool 端口掛工具,搜尋、讀試算表、發訊息都算。掛上去之後最該做的一件事是把工具描述寫清楚,模型是靠那段描述決定要不要呼叫它的。這一步做完,你手上就有一隻會自己查資料再回答的 Agent;要再往前一格,就在最前面加一個排程節點,讓它自己開工。

n8n 節點類型比較:Google Sheets、Gmail、Google Drive 三個一般節點,以及最右邊的 AI Agent(LLM)節點,底下有 Chat Model、Memory、Tool 三個端口
最右邊那個 AI Agent 節點跟左邊三個一般節點的差別,就在底下多了 Chat Model、Memory、Tool 三個端口,工具掛在 Tool 那一格。

做出來之後,怎麼知道它真的做對了

第一次跑通的那個瞬間最危險,因為它成功了一次,你會以為它會一直成功。Agent 每次的路線都可能不一樣,跑通一次不代表跑得穩。

同一組輸入先跑十次

拿同一個問題連跑十次,看它十次的答案差多少。差很多代表你的提示詞或工具描述太模糊,模型每次的理解都不一樣。這件事花你十分鐘,能省掉之後好幾天的疑神疑鬼。真的要壓穩定度,把模型的 temperature 調低是最直接的做法。

把出錯那次留下來當回歸測試

它答錯的那一次,把當時的輸入抄下來存成一份清單。之後每次改提示詞、換模型,就拿這份清單重跑一遍。這是自己做 Agent 最划算的一件事:你不用寫測試框架,一個試算表分頁就夠,一欄放輸入、一欄放你期待的輸出、一欄放這次實際跑出來的。

看中間步驟,別只看最後輸出

Agent 出問題時,最後輸出常常只是「沒東西」或一段很客氣的廢話,看不出原因。要看的是它中間呼叫了哪些工具、每一輪送進去什麼。有一種狀況特別容易被漏掉:流程裡把模型名稱寫死,結果供應商把那個版本下架,呼叫開始回錯誤,但整條流程外表看起來還是跑完了。流程回報成功不等於它做對了事,這種靜默失敗只有看中間步驟才抓得到。

AI Agent 為什麼會失敗?五個最常見的原因

下面五個是我自己跌過、或幫別人看流程時最常遇到的,前三個都跟你怎麼描述任務有關。

AI Agent 五個失敗原因:任務給太大、工具描述太短、記憶塞太多、沒設停止條件、該用管線的事硬上 Agent AI Agent 五個失敗原因 1 任務給太大,它自己編流程 2 工具描述太短,它不知道何時該用 3 記憶塞太多,重點被稀釋 4 沒設停止條件,繞圈燒 token 5 該用管線的事硬上 Agent 五個裡有三個,都是任務描述沒寫清楚 Q kangber
五個原因裡,前三個都出在「你怎麼跟它描述任務」,跟模型聰不聰明沒關係。

任務給太大

「幫我處理客訴」這種指令,模型會自己編出一套它以為的流程,然後在中間某一步走偏。任務要拆到每一步都能用一句話講完該做什麼。拆不動的話,代表那件事本來就該由人做決定,不該整包丟給 Agent。

工具描述沒寫清楚,它不知道何時該用

工具掛上去了卻從來不被呼叫,或是每一輪都亂呼叫,八成是描述寫太短。模型只看得到你寫的那段文字,它得從裡面判斷「現在這個情況該不該用這個工具」。

// 模型看到的工具描述:它不知道什麼時候該用
{
  "name": "search",
  "description": "搜尋"
}

// 改寫後:查什麼、何時該用、回傳什麼都寫進去
{
  "name": "search_news",
  "description": "查詢台灣近 7 天的新聞。當問題牽涉到今天或本週發生的事、"
                 "或需要即時資訊時才呼叫。輸入一個中文關鍵字,"
                 "回傳最多 5 則標題與連結。"
}

差別在於下面那版把觸發時機寫進去了。工具描述要寫得像在交代一個新同事什麼時候該打哪支電話,不是照抄 API 文件。

記憶塞太多,重點被稀釋

知識庫不是越大越好。塞了三十頁進去,模型要在裡面找那一句關鍵的話,準確度反而掉。比較有效的做法是先只放最常被問到的那幾件事,跑一陣子看它答不出什麼,再針對性地補。

沒有停止條件,繞圈燒 token

Agent 的決策循環如果沒設上限,遇到一個它解不掉的問題時會一直「再試一次」。n8n 的 AI Agent 節點有最大迭代次數可以設,自己寫程式的話要自己加計數器。這是帳單爆掉最常見的原因,而且它通常發生在半夜沒人看的時候。

拿它做管線就能做的事

流程固定、每次都一樣的事,寫死的管線更快更便宜也更好抓錯。給 Agent 太多自由,它會在簡單任務上想太多、繞遠路。判斷方式很直接:這件事的步驟你能不能事先畫成一張流程圖?畫得出來就別用 Agent。

成本會不會失控?token 花在哪、怎麼壓

自己做的人常低估這塊,因為聊天介面用起來感覺很便宜,接成 Agent 之後帳單是另一回事。

決策循環才是主要花費

一次對話你只送一段話進去,Agent 不是這樣。它每想一輪,就要把「原本的目標+前面幾輪做了什麼+工具回傳的結果」整包重送給模型一次。跑五輪就是五次,而且每一次送進去的東西都比上一次更長。帳單是被它想了幾輪、每輪帶著多少歷史決定的。

壓成本的三個做法

設迭代上限是止血點,前面講過。再來是分層用模型:判斷「這則要不要回」用便宜快的小模型就夠,只有真正要寫成品的那一步才換貴的。第三是把不需要模型判斷的步驟拉出去用一般節點做,能用程式算的別讓模型算。

還有一件跟成本有關、但更容易痛的事:額度用完的時候,很多服務不會讓你的流程報錯,只會回一個空的結果。我的電子報就遇過整條流程照常跑完、狀態顯示成功,但內容是空的,追下去才發現是 API 額度見底。監控自己的餘額,跟監控流程有沒有跑完,是兩件要分開做的事。

AI Agent 該被允許做到哪裡?權限與安全

Agent 能動到哪裡,要在設計的時候就劃出界線。下面三件事,做客戶案子時我一件都不會省。

對外或花錢的動作留人工閘門

只要 AI 的動作會對外(發文、寄信、回客人)或會花錢,就在動作前面加一道人工核准,這就是業界說的人在迴路(human-in-the-loop)。做法上通常是把流程拆成兩段:判斷跟擬稿自動跑,送出獨立成另一段,卡在核准後面。自動化的目的是省力,不是把判斷權整包交出去。

給它最小權限的金鑰

Agent 用的憑證要單獨開,只給它這件事需要的權限。要它讀某一張試算表,就只授權那一張,不要把整個帳號的權限丟給它。這件事在出事的時候差別很大:權限開得剛好,最糟就是那張表被寫壞;權限開太大,你要查的範圍是整個雲端硬碟。

留下可稽核的紀錄

它每次做了什麼、用了哪個工具、輸出了什麼,寫進一張表。跑順的時候這張表沒用,出事的時候它是你唯一能回溯的東西。順帶一個實作細節:多個步驟同時寫同一張試算表時,寫入會互相蓋掉,得把它們錯開或改成排隊寫。

不是每件事都需要 AI Agent

Agent 聽起來厲害,但它更難控制、更貴、更容易在你沒看著的時候出包。挑對架構比挑最厲害的架構重要。

任務固定、要穩 → 一條管線就夠

「每天固定把 A 資料整理成 B 格式」這種重複又明確的事,一條寫死的管線最可靠。前面提到的 AI 工具排行榜就是這樣,流程固定,用管線最穩。

任務多變、要查要決策 → 才輪到 Agent

任務每次都不一樣、需要邊做邊查、要根據查到的東西決定下一步,這才是 Agent 的主場。像「幫我研究這個主題並寫成文章」,你沒辦法事先寫死要查幾次、查什麼,過程無法預先規劃的任務才值得讓 AI 自己跑

三個問題決定你用哪種

  1. 流程能不能事先寫死?能就用管線;每次都不一樣才考慮 Agent。
  2. 過程中需不需要查外部資料或臨機應變?需要就往 Agent 那端靠。
  3. 它的動作會不會對外或花錢?會的話不管哪種架構,都加一道人工核准。

📖 延伸閱讀RPA 是什麼?和 n8n、AI Agent 差在哪,三種自動化怎麼選

AI Agent 要不要做成全自動?這個決定我猶豫很久

做社群監控系統的時候,我掙扎過要不要做成全自動:撈到、判斷完、直接回覆,完全不用我管。我甚至已經把全自動的版本接起來測了。直到有一次測試,模型把一則只是隨口抱怨的貼文判斷成「適合推薦服務」,還擬了一段很熱情的回覆。那是測試環境,如果是正式的,它就真的用我的帳號把那段發出去了。

最後的結論很簡單:把流程拆成兩段,撈取與判斷自動跑,發送獨立成另一段、卡在人工核准後面。這個決定讓系統慢了一點,換來的是我對它的信任。AI 不是用來取代我的判斷,是把我的判斷放大,這道人工閘門就是我守住判斷權的方式。

接下來學什麼?四個元件的深入篇

這篇是骨架,四個元件各自都還有得挖。照你現在卡住的地方挑一篇看就好:

AI Agent 學習路徑圖:中間是四元件骨架,四周分別連到大腦(推理與規劃)、記憶(記得住事情)、手腳(工具呼叫)、排程(何時開工)四篇深入文章 接下來 學哪一塊 AI Agent 四個元件骨架 大腦 推理與規劃 記憶 記得住事情 手腳 工具呼叫 排程 何時開工 先看你現在卡住的那一塊 Q kangber
這篇是中間那顆,四個元件各自有一篇深入的,卡在哪塊就挑哪塊。

常見問題 FAQ

Q1:做一個 AI Agent 要不要會寫程式?

不用。用 n8n、Dify 這類工具,拉節點、填設定就能組出一個會查資料、會自己開工的 Agent,全程不用寫程式。會寫程式的差別在於能客製到多細:要做多個 Agent 互相協作、要精細控制每一輪送什麼進模型,那才需要走 LangChain 或 Agents SDK 那條路。第一個 Agent 完全不需要從寫程式開始,先用拉的做出來,遇到拉不出來的需求再說。

Q2:自己做一個 AI Agent 大概要花多少錢?

模型費用取決於它想了幾輪。一個小型的知識問答助理,一個月幾塊美金跑得動;會自己查資料、每天定時跑的監控型 Agent,量開起來一個月十幾到幾十美金都可能。工具本身另計,n8n 自架的話主機費一個月幾美金起跳。最該先做的兩件事是設迭代上限盯著餘額,帳單失控幾乎都是這兩件沒做。

Q3:第一個 AI Agent 該從什麼任務開始?

挑一件你每週真的會重複做、而且做錯不會出事的小事。整理本週產業新聞、回答內部同事的重複問題、把某張表的數字彙總成摘要,都是好起點。避開「處理客訴」「回覆客戶信件」這種一錯就影響到外部的題目。題目小,你才有機會在一個晚上看到它跑完。

Q4:AI Agent 跟 AI 架構是不是同一件事?

是同一件事的兩個視角。AI 架構在講元件怎麼組(大腦、記憶、手腳、排程),AI Agent 在講組到會自己決定下一步時的那個結果。要注意「AI 架構」還有另一種用法,指的是 GPU 叢集、資料中心那種基礎建設,跟你自己做 Agent 沒有關係。看到這個詞先分清楚對方在講哪一種。

Q5:讓 AI Agent 自己做事,會不會失控?

會,所以要設計。最實用的三道防線:動作會對外或花錢就加人工核准;憑證只給這件事需要的最小權限;每一輪做了什麼都寫進紀錄表。我自己的系統就是這樣設計的,AI 負責判斷和擬草稿,真正按下發送的永遠是人

總結

一個 AI Agent 就是大腦、記憶、手腳、排程四個元件,加上一個會自己決定下一步的循環。要動手的話,照光譜由左往右走:先讓它會回答,再讓它答得出你的事,然後讓它會自己查,最後讓它自己開工。每一步跑順了再加下一塊,出錯時你才知道是誰的問題。

做出來之後真正花時間的是後面那半段:同一組輸入跑十次看穩不穩、把錯過的那次留成回歸清單、設迭代上限、盯餘額、對外的動作留一道人工閘門。會跑起來的 Agent 很多人做得出來,跑得穩的比較少,差別幾乎都在這幾件不起眼的事上。

手上有流程還在靠人工重複做,歡迎看看我的 AI 自動化開發服務,一起看那段該交給哪一種工具。想看這四個元件組起來實際長什麼樣子,也可以到作品集看幾套真實上線的系統。

每週的 AI 新聞精選與短評,會整理進電子報

參考資料