AI 代理人AI AgentAI Agent 是什麼AI 代理Agentic AI

AI 代理人是什麼?從 ChatGPT 到會自己動手的 AI,細說 AI 進化史

2026年9月18日·17 分鐘閱讀

前言

AI 代理人(AI Agent)指的是一種會自己動手的 AI:你給它一個目標,它自己決定下一步要做什麼、自己去叫工具(查資料、開網頁、寄信、改試算表),做完再檢查結果。

這篇文章會用一條時間線整理 2022 年底到 2026 年 AI 代理人的七個重大進步、每一步多了什麼能力,最後看三份報告怎麼講未來趨勢。

AI 代理人從 2022 年只會回答的 ChatGPT,進化到 2026 年會自己動手完成工作的時間線示意
AI 代理人的進化,關鍵是從「會回答」變成「會動手」

AI 代理人是什麼

新聞裡的「AI 代理人」、廠商簡報上的「AI 代理」、工程師嘴裡的「Agent」,講的是同一種東西。它跟聊天機器人的差別只有一個:拿到目標之後,下一步要做什麼是它自己決定的,你不用一步一步告訴它。

AI 代理人、AI 代理、AI Agent 三種叫法

三個詞在台灣是這樣分工的。媒體寫新聞用「AI 代理人」,因為讀者看得懂「代理」兩個字是「替你出面做事」;廠商的產品頁多半寫「AI 代理」或直接寫英文 Agent,因為產品名稱要跟國外對齊;工程師之間就講 Agent,不翻譯。搜尋的時候三個詞會混在一起出現,Google 也把它們當同一件事處理,所以不用糾結哪個才是正式名稱。

另外有一個容易搞混的詞叫 Agentic AI(代理式 AI),它講的是「有代理能力的 AI」這個大方向,比較像形容詞;AI 代理人講的是一個一個具體的程式。廠商在簡報裡常把兩個詞交替用,看到的時候知道是在講同一個方向就好。

會自己決定下一步的 AI

你叫 ChatGPT「幫我看一下這份輿情報告有沒有負評」,它會讀你貼進去的內容然後回答。你叫 AI 代理人做同一件事,它會自己去信箱找那封報告、打開附件、逐條判斷、把負評寫進試算表,做完回你一句「今天有三條,最嚴重的是這條」。中間開信箱、開附件、寫表格這些動作,你沒有教它每一步,它是照著「找出負評」這個目標自己排出來的。

能做到這件事需要三樣東西:一個會推理的模型當腦、一組它能呼叫的工具當手、一個記得前幾步做了什麼的記憶。這三樣的細節(每一樣怎麼設計、用什麼工具做)我在另一篇拆過,這篇不重複。

📖 延伸閱讀AI Agent 教學:四個元件,組出會自己做事的 AI

從 ChatGPT 到 AI 代理人的時間線

下面這張圖是我整理的七個重大進步。每一步都是 AI 多了一種「碰到外面世界」的能力:先是能叫工具,再來能看螢幕,然後工具的接法統一,接著變成一般人帳號裡就有的功能,最後是長任務做得準、還能分身同時做。

AI 代理人從會回答到會動手 只會回答 ChatGPT 上線 2022.11 2023.06 Function Calling 能穩定叫工具 能看螢幕操作電腦 Computer Use 2024.10 2024.11 MCP 發布 工具接法統一 一般帳號就有代理人 ChatGPT Agent 模式 2025.07 2025.12 操作電腦超過人類 能精準做長任務 能分身同時做多件事 Agent Teams 2026.02 每一格都是代理人多了一種新能力 Q kangber
AI 代理人的七個重大進步,2022 年 11 月到 2026 年 2 月

2022 到 2023 年的 AI 只會回答

2022 年 11 月 30 日 ChatGPT 上線的時候,它能做的事只有一件:你打字,它回字。它碰不到你的信箱、看不到你的網頁、不能幫你按任何按鈕。那時候所有「用 ChatGPT 自動化」的做法,都是人自己把資料貼進去、再把答案貼出來,中間的搬運全是人工。

AutoGPT 跑得起來卻跑不完

2023 年 3 月底,一個叫 AutoGPT 的開源專案在 GitHub 上爆紅。它的做法是把 GPT-4 包在一個迴圈裡:你給它一個目標,它自己拆成小任務、自己執行、自己看結果再決定下一步。這是第一次有東西長得像今天講的 AI 代理人。多數人跑過之後的結果差不多:它會在同一個步驟繞圈、會把簡單的事拆成二十步、跑一個小時燒掉幾美元然後告訴你它做不到。

AutoGPT 的價值在於讓所有人看見「AI 自己跑迴圈」這個畫面,也讓所有人看見它為什麼跑不完:模型不知道什麼時候該停、叫工具的格式不穩定、記不住自己十步前做過什麼。後面三年的進步,幾乎都是在解這三個問題。

Function Calling 讓模型穩定叫工具

2023 年 6 月 13 日,OpenAI 推出 Function Calling(函式呼叫,讓模型用固定格式說「我要叫哪個工具、帶什麼參數」)。在這之前,要讓模型叫工具得靠提示詞求它照格式輸出,十次裡總有一兩次格式跑掉、整條流程就斷。有了 Function Calling 之後,模型會回一段結構固定的資料,程式可以放心接。

對一般使用者來說,這一步當時感覺不到,因為它是給開發者用的。但 n8n、Zapier 這些工具能在 2024 年把「AI 節點」做得可靠,底層靠的就是這個。它在時間線上最不起眼,後面每一步都靠它。

📖 延伸閱讀AI 為什麼能查資料、寄信、操作資料庫?Tool Calling 運作原理一次看懂

2024 年 AI 開始碰得到外面的東西

2023 年的代理人只能叫「你事先寫好的」工具。2024 年下半年發生的兩件事,讓它能碰到沒有事先準備好的東西:一個是直接看螢幕操作電腦,一個是工具的接法有了統一標準。

Computer Use 看螢幕操作電腦

2024 年 10 月 22 日,Anthropic 發布 Computer Use:Claude 可以截圖看你的螢幕、移動滑鼠、打字、點按鈕,像人一樣操作沒有 API 的軟體。當時官方公布在 OSWorld(一套用真實電腦操作任務測 AI 的評測)的成績是 14.9%,人類是 72.36%。數字很低,但它證明沒有 API 的老系統也能交給代理人去點。

幫客戶接系統的時候,最麻煩的一直是那些只有網頁後台、沒有 API 的平台。Computer Use 出來之前,這種平台只能請人工去點;出來之後可以交給它點,但人得在旁邊看。到 2026 年,人還是得在旁邊看。

MCP 把工具接法統一

2024 年 11 月 25 日,Anthropic 開源 MCP(Model Context Protocol,模型上下文協定,一套讓 AI 跟外部工具溝通的共同規格)。在 MCP 之前,每一個 AI 產品要接 Google Drive、接資料庫、接你的內部系統,都得各自寫一套接法;MCP 之後,工具那邊寫一次,所有支援 MCP 的 AI 都能用。

這一步對代理人的意義是「手」變多了。我現在的工作環境裡,Claude Code 同時接著 n8n、Google Search Console、Google Drive、本機的圖片生成工具,全部走 MCP。2024 年初要做到同樣的事,每一條都得自己寫串接。

📖 延伸閱讀MCP 是什麼?讓 Claude 直接操作你的Figma和n8n

2025 年代理人變成一般人買得到的產品

2024 年為止,要用 AI 代理人你得會寫程式,或至少會用 n8n 這類工具把它組起來。2025 年的變化是廠商把組好的代理人直接放進一般人的訂閱方案裡。

Operator、Deep Research 與 Agent 模式

2025 年 1 月 23 日 OpenAI 推出 Operator,一個會自己開瀏覽器幫你訂餐廳、買東西的代理人;2 月 2 日推出 Deep Research,你丟一個題目,它自己查幾十個網頁、花十幾分鐘寫一份帶引用的報告;7 月 17 日兩者合併成 ChatGPT 的 Agent 模式,付費帳號打開就能用。

這三個產品放在一起,代表的是代理人第一次不需要使用者懂任何技術。Deep Research 對寫文章這件事影響最直接:先丟給它跑一輪,再自己去核對它引的來源有沒有寫錯。核對這步不能省,它會把來源的數字記錯。

代理人進到瀏覽器

2025 年 8 月 26 日 Anthropic 推出 Claude for Chrome 擴充功能,10 月 21 日 OpenAI 推出自己的瀏覽器 ChatGPT Atlas,兩家都把代理人放進你每天在用的瀏覽器裡,讓它能直接操作你已經登入的網站。同一個月 Anthropic 推出 Skills,讓你把一套做事的 SOP 寫成檔案,代理人遇到對應的任務就自己載入來用。

📖 延伸閱讀Agent Skills 是什麼?SKILL.md 怎麼寫、跟 MCP 差在哪

瀏覽器這一步同時帶來時間線上第一個大規模的資安討論:代理人在你登入的狀態下操作網站,網頁裡藏的指令(這類攻擊叫 prompt injection,提示詞注入,把惡意指令藏在網頁文字裡騙 AI 執行)就有機會讓它做你沒要它做的事。兩家在發布時都花了一半篇幅講防護,2023 年 AutoGPT 那時候沒人想過這件事。

2025 年底到 2026 年,代理人多了兩種能力,也碰到邊界

2025 年 10 月之後到 2026 年 9 月,沒有哪一天出現像 Computer Use 那樣的單一事件,但代理人多了兩種 2024 年沒有的能力:長任務做得準了,還能分身同時做好幾件。同一段時間,它的邊界也第一次被量出來。

能精準做長任務

OSWorld 這套用真實電腦操作任務測 AI 的評測,人類的成績是 72.36%。2024 年 10 月 Computer Use 剛出來是 14.9%,2025 年 9 月 Claude Sonnet 4.5 到 61.4%,2025 年 12 月第一次有代理人超過人類,72.6%,2026 年領先的系統已經在 82% 到 86% 之間。同一套題目,兩年從七分之一到超過人。

任務長度也在拉長。METR(一個獨立的 AI 評測機構)量的是「人要花多久做的工作,AI 能不能做完」。2026 年 1 月更新的資料裡,人要花半天做的工作,交給最新的模型有一半機率做得完,而且這個長度從 2024 年起每三到四個月翻一倍,比他們 2025 年初估的七個月快一倍。

我自己的體感對得上:2024 年讓代理人跑一個十分鐘的任務就會歪掉,2026 年 Claude Code 一個任務跑幾個小時是日常。

能分身同時做多件事

2025 年 7 月 Claude Code 加入子代理人(一個主代理人把工作派給幾個小的,各自做完回報),2026 年 2 月 5 日隨 Claude Opus 4.6 推出 Agent Teams(代理人小隊,幾個代理人平行跑、彼此傳話、共用一張任務清單)。差別在於任務不用再排隊:改一個網站,一個代理人查資料、一個改頁面、一個跑測試,同時進行。

這個能力直接改變了人的工作方式。我自己的順序是 2025 年用 Cursor 在編輯器裡讓 AI 補程式,後來大部分工作搬到 n8n 用節點組流程,2026 年起這個網站的改版幾乎全部是 Claude Code 在改,我做的事是講清楚要什麼、看它改完的結果、決定要不要收。人的工作從「寫」變成「驗收」,這是 2024 年還沒有的分工。

📖 延伸閱讀Claude Code 教學:安裝、費用到資料安全一次搞懂

代理人的效能邊界

METR 同一份資料還有另一個數字:要它十次做對八次,它能接的是人做一小時的工作;只要求做得完就好、對錯一半一半,它能接人做半天的工作。中間差十倍,這十倍就是邊界。代理人能做很長的事,但你要它八成以上做對,它能做的事就短很多。

邊界的形狀看的是「結果能不能自動驗證」,跟任務長短關係不大。寫程式有測試可以跑,改錯了測試會紅,所以敢放它跑幾小時;判斷一則貼文是不是負評沒有測試,它九成時間是對的,但你不知道是哪一成錯,所以我的輿情流程到現在還是每天看一眼。

第二條邊界是錢。單價在降,但用量漲得更快。Gartner 在 2026 年 8 月 17 日發布的預測是每條代理人工作流的推論成本到 2028 年會漲超過五倍,理由是代理人每個決定都要多跑幾次模型,任務越複雜、繞的圈越多。越靠近第一條邊界的任務,燒錢越快。

同一件工作在 2023、2024、2026 年怎麼做

我幫一個甜點電商客戶跑的輿情整理是最好的對照。他們訂了一份輿情日報,每天下午信箱會收到一封附件,裡面是當天社群上提到品牌的幾十則貼文,要的答案只有一個:今天有沒有負評、哪一條要處理。這件事在三個時間點各是這樣做的:

做法 2023 年:手動貼給 ChatGPT 2024 年:n8n 固定流程(現在還在跑) 2026 年:交給代理人(部分)
誰開信箱 n8n 每天 15:00 自動抓 代理人自己抓
誰判斷負評 ChatGPT,但要人一段一段貼 模型節點逐條分類,規則寫死 代理人逐條判斷,遇到不確定的會自己翻原文
誰寫進表格 n8n 自動 append 代理人自動寫
出錯時 人當場看到 寫入失敗會重試三次,還是失敗就通知我 它會自己重試,但重試幾次、失敗了誰知道,要另外設計
每天人要花的時間 約 20 分鐘 0,出事時才看 0,但我還是每天看一眼它的判斷

2024 年那一欄兩年來出過的事都很具體:模型服務的每分鐘額度只有 6000 個 token,一次餵超過十則貼文就整條掛掉;Google Sheets 偶爾回 503,整批資料沒進表;一次補多天的資料,連結全部掉成純文字。這些問題全出在接在 AI 外面的東西,跟 AI 聰不聰明無關。

2026 年那一欄我只交了一部分出去,理由是它做錯的時候我不一定知道。固定流程做錯會停下來、會報錯;代理人做錯的時候會很有信心地繼續往下做。要讓它獨立負責,得先把「它怎麼知道自己錯了」這件事設計好,而這件事到 2026 年還沒有標準做法。

進步裡哪些是真的,哪些是行銷

每年都有人說今年是 AI 代理人元年,2023、2024、2025 都說過。分辨的方法是看有沒有公開的、別人可以重跑的數據。

看數字不看發布會

上一節的 OSWorld 跟 METR 是兩組,第三組是價格:2023 年 GPT-4 每百萬個輸入 token 收 30 美元,2026 年主流模型多半在 1 到 3 美元之間,2026 年 9 月 Claude Fable 5.1 又把快取讀取(重複讀同一段內容的收費)降到前一代的四分之一。

代理人每做一步都要把前面的步驟重讀一遍,價格降比模型變聰明更能決定它跑不跑得起來。這三組數字別人都可以重跑,發布會上講的「更聰明、更自主」沒有一個可以。

把模型變聰明包裝成代理人變強

行銷最常用的一招是把「模型答得更好」講成「代理人變強」。答得更好是腦的事,代理人強不強看的是手跟記憶:能不能叫到工具、叫錯了會不會發現、記不記得自己做過什麼。看到一個新的代理人產品,先問這三個問題,多數宣傳會在第二個問題卡住。

AI 代理人的未來趨勢

三家立場不同的機構今年各發了一份數字:Stanford 是學術單位、Deloitte 做企業調查、Gartner 做產業預測。

三份報告各自看到什麼

來源 日期 數字 代表什麼
Stanford AI Index 2026 2026-04-13 代理人在真實任務評測(Terminal-Bench)的成功率,一年從 20% 到 77.3%;做家事類實體任務只有 12% 能力在螢幕裡進步很快,出了螢幕還很慢
Deloitte 代理人轉型調查 2026-08-12 只有 15% 的企業做到跨部門的多代理人協作;5% 說自己的流程「準備好了」;70% 不覺得能信任跟管住代理人;67% 說整合太貴太複雜 技術跑在前面,公司的流程跟治理跟不上
Gartner 2025-06-25 2027 年底前,超過 40% 的代理人專案會被取消,原因是成本失控、看不到價值、風險管不住 一半會死在上線之後
Gartner 2026-08-17 每條代理人工作流的推論成本到 2028 年漲超過五倍 誰能讓代理人少繞圈,誰的成本就低

三份放在一起的結論

能力那邊 Stanford 量到的是夠了,公司這邊 Deloitte 量到的是多數還沒準備好,兩邊的落差就是 Gartner 那個四成。接下來三年決定代理人成敗的是流程跟治理,模型排在後面。對想開始用的人來說,該先想清楚的是它做錯的時候你怎麼知道、它花的錢你怎麼看得到。

常見問題 FAQ

Q1:AI 代理人跟 ChatGPT 是同一個東西嗎?

ChatGPT 是一個產品,AI 代理人是一種能力。2025 年 7 月之後 ChatGPT 裡面有 Agent 模式,打開它 ChatGPT 就會自己開瀏覽器做事,這時候它就是一個代理人;沒開的時候它是聊天機器人。同一個產品可以兩種都是,差別在你有沒有讓它自己動手。

Q2:為什麼每年都說是 AI 代理人元年?

因為每一年都真的跨過一個門檻:2023 年模型能穩定叫工具、2024 年能操作電腦、2025 年一般帳號就有代理人、2026 年長任務做得準還能分身。每個門檻都讓一群原本做不到的事變成做得到,所以每年都有人覺得「就是今年」。真正的分水嶺是 2023 年 6 月的 Function Calling,後面每一步都建在它上面。

Q3:不會寫程式的人現在能用 AI 代理人嗎?

可以,分兩種。要用現成的,ChatGPT 的 Agent 模式、Claude for Chrome 這類產品付費帳號打開就能用,適合一次性的任務(查資料、比價、填表)。要做一個每天自動跑的,用 n8n 這類工具拉節點就能組起來,不用寫程式,但要花時間學節點怎麼接。我幫客戶做的輿情、客訴、出貨流程全是 n8n 組的。

Q4:2026 年的 AI 代理人跟 2024 年差在哪?

差在三件事。2024 年只有開發者用得到,2026 年一般訂閱方案裡就有;2024 年每個工具要各自串接,2026 年多數工具支援 MCP 接一次就好;2024 年一個任務跑十分鐘就會歪,2026 年能跑幾個小時、還能分成好幾個同時跑。沒變的是可靠度:要它八成以上做對,能接的任務長度就縮到十分之一。

Q5:AI 代理人會自己亂做事嗎?

會,多數時候是它把你的意思理解錯了還是照做。我自己遇過把要「潤稿」的文字當成問題直接回答的狀況。所以只要代理人的動作會影響到外面(寄信、發文、下單、改客戶資料),中間一定要留一道人工核准:它先做完、放到 LINE 或試算表給人看過,人按了才真的送出。2026 年還沒有人能保證它不會理解錯,這道閘門省不得。

總結

AI 代理人從 2022 年只會回答的 ChatGPT,走到 2026 年會自己開信箱、開瀏覽器、寫表格的程式,七個重大進步全是 AI 多了一種能力:能叫工具、能看螢幕、接法統一、變成產品、進了瀏覽器、長任務做得準、能分身同時做。進步有 METR 跟 OSWorld 的數字可以查;沒解決的是它做錯時你不一定知道,任務越長成本漲越快。現在該做的是先把它做錯時你怎麼發現這件事設計好,然後從一件小事開始交給它。

如果你手上已經有一件每天重複、想交給 AI 代理人跑的事,可以看看我幫客戶實際上線的自動化案例,裡面每一條都寫了它是怎麼被監控的。

參考資料

同主題文章

AI Agent