電腦操作 AI Agent 是什麼?現在能做到什麼程度?

沒有人碰滑鼠,螢幕上的游標卻自己一格一格移動,視窗接連切換,表單欄位也被依序填好。第一次看到這個畫面的人,十之八九以為電腦中毒,或者以為自己被誰遠端操控了。這不是故障,而是一種新型態的 AI Agent 正在動手做事:它靠著直接「看」螢幕截圖,自己判斷該點哪裡、自己模擬打字,跟人操作電腦幾乎是同一套動作。這種操作手段,業界稱它為電腦操作 AI Agent(Computer Use)。

連打造這套技術的 Anthropic,自己都曾在錄製示範片段時鬧過烏龍。AI 一個不小心點掉了正在進行的螢幕錄影,整段畫面就此消失;還有一次,它做到一半忽然岔題,自顧自瀏覽起黃石國家公園的風景照,把原本的程式編寫示範晾在一邊。這些花絮說明了一件事,這項技術雖然新奇,也還在犯很多人類根本不會犯的錯。

接下來要說清楚兩件事:電腦操作 AI Agent 實際上怎麼做到「看畫面、動手做」,以及它現在真的能做到什麼程度,不誇大也不低估。先從它為什麼會出現講起,再一路拆到現在能拿它做什麼、又該提防什麼風險。

為什麼過去的自動化,一碰到沒有 API 就卡關?

要弄懂電腦操作 AI Agent 為什麼會出現,得先看看它想解決的舊問題。多年來,想讓程式自動處理電腦上的工作,幾乎只有兩條路可走。第一條是叫程式直接呼叫軟體開放的 API,拿到結構化的資料、下達明確的指令;第二條是靠 RPA(機器人流程自動化),把人操作滑鼠的座標、按鍵的順序整套錄下來,之後依樣重播。

這兩條路有一個共同的罩門。世界上大多數軟體根本沒開放 API,介面也常常說改就改,沒有 API 的系統就自動化不了;而 RPA 依賴的固定 UI 選擇器或座標,只要應用程式的版面一動,整套流程就會壞掉,得重新錄一次。Microsoft 官方技術文件把這個弱點講得直白,傳統 RPA 依賴固定的選擇器或座標,應用程式一改版就會壞;能依情境判讀介面、面對版面變化仍可調整,才是新一代電腦操作型 Agent 的強項。

長期下來,這形成一大塊自動化的長尾需求,老舊系統、內部工具、沒有 API 的網站,過去只能靠人工手動一個個點。OpenAI 官方文章形容,這類電腦操作型 Agent 讓系統得以觸及過去多數 AI 模型碰不到的長尾使用情境,能適應任何原本是為人類設計的軟體環境。

電腦操作 AI Agent 補上 API 呼叫與 RPA 都涵蓋不到、根本沒有開放接口的自動化空白
有 API 就直接呼叫、最快最準;電腦操作 Agent 補的是 RPA 也搞不定、根本沒有 API 的那一塊。

Anthropic 官方研究文章談到開發這套技術的理念轉折時,講得更直接。過去的做法是讓工具遷就模型,為每個任務打造專屬工具;現在反過來,讓模型遷就工具,直接使用人類日常在用的軟體。換句話說,電腦操作 AI Agent 的定位不是要取代 API 整合,有 API 可用的場景,直接呼叫 API 通常還是更快更準;它專門補上的,是「沒有 API 可用」的這塊空白。搞懂它想補的洞在哪裡,才更容易理解它實際上是什麼、又是怎麼運作的。

電腦操作 AI Agent 是什麼?

電腦操作 AI Agent(Computer Use / Computer-Using Agent,英文縮寫常見寫成 CUA)指的是一種不靠 API、而是直接「看」螢幕截圖,再輸出模擬滑鼠與鍵盤動作來操作電腦或任何軟體的 AI Agent。核心概念很單純,把「螢幕畫面加上滑鼠鍵盤」這套原本是設計給人類用的介面,直接當成 AI 與軟體溝通的標準介面。軟體不必另外開放任何串接窗口,AI 就能像人一樣打開瀏覽器、點連結、填表單、切換視窗。

Anthropic 官方公告對這項能力的說法就是這麼白話,開發者可以指示 Claude 像人一樣使用電腦,靠看螢幕、移動游標、點按鈕、打字來完成任務。OpenAI 官方文章給的定義也呼應同一個核心,直接處理原始像素資料理解畫面上發生的事,並用虛擬滑鼠鍵盤完成動作,不需要作業系統或網頁專屬的 API。

順帶一提,這是一種操作手段,而不是另一種 AI。本質上它仍是同一批大型語言模型,只是多裝了一套視覺辨識畫面加上輸出座標指令的能力。目前主要由幾家公司各自實作:Anthropic 把它做成 Claude 的 Computer Use 工具;OpenAI 先推出獨立的 Operator,2025 年年中已併入 ChatGPT agent;Google 的 Project Mariner 後來也併入了 Gemini Agent。這幾個名字只是讓讀者知道「這個類型長什麼樣子」的例子,做法原理相通,不在這裡比較誰做得好。

跟一般 AI Agent 有什麼不同?

先釐清跟「一般 AI Agent」的關係,免得混為一談。廣義的 AI Agent 泛指所有能自主規劃、執行多步驟任務的 AI 系統,電腦操作型只是其中一種操作手段,差別出在「感知輸入」與「行動輸出」的形式。一般 AI Agent 常見的做法是呼叫結構化的 API 或工具,拿到的是乾淨的資料、回傳的是明確的 function call;電腦操作型 Agent 拿到的卻是一張張螢幕截圖,是像素,輸出的也不是資料,而是座標與按鍵這種模擬人類動作的指令。

實務上還有一層優先順序值得知道。像 Claude Code 這類系統,若軟體有對應的整合管道可用(例如已經串接好的服務,或設定好的 MCP server),系統會優先走那條更快更準的路;真的沒有整合管道可用時,才會退回用「看螢幕、動滑鼠鍵盤」這個辦法。Claude Code 官方文件把這個順序列得很清楚,有 MCP server 就用 MCP,任務是下 shell 指令就用 Bash,是瀏覽器工作且有設定對應工具就用它,以上都不適用時才輪到電腦操作,因為它是最廣泛、也最慢的方式。

跟 RPA 有什麼不同?

跟傳統 RPA 的差異,是讀者最容易搞混的一組概念,值得攤開來講清楚。RPA 把人操作的固定座標或選擇器整套錄下來,依樣重播,介面一改版、彈窗位置一變,整個流程很容易就失敗;電腦操作 AI Agent 則是每一步都重新「看」當下的畫面,依畫面內容判斷該做什麼,不是照本宣科重播錄好的腳本,理論上介面改版後也能自己調適。

這不代表電腦操作型 Agent 就會取代 RPA。固定、重複、量大的流程,RPA 依然更快更穩定;電腦操作型 Agent 更適合用在介面常變動、或規則說不清楚的例外情境。Microsoft 官方技術文件也直接建議混合使用,固定的高量流程交給 RPA,需要例外處理與跨系統協調的部分才輪到電腦操作型 Agent。弄清楚它跟哪些技術不一樣之後,接下來看它實際上是怎麼「看畫面、做決定」的,這是整套技術最核心的運作機制。

電腦操作 AI Agent 的核心迴圈:看螢幕、算下一步、動手做

這節要拆的是整篇最核心的技術機制,不是抽象地講「AI 很聰明」,而是講清楚它實際上怎麼看、怎麼想、怎麼動。整個過程是一個不斷重複的迴圈:先截一張螢幕畫面,AI 判讀畫面內容、想接下來要做什麼,例如要點哪個按鈕、要打什麼字,再把決定輸出成具體的座標與按鍵指令,交給執行環境真的移動滑鼠、按下按鍵。動作做完,立刻再截一張新畫面,重新判讀、決定下一步,如此反覆,直到任務完成,或者需要人確認為止。

電腦操作 AI Agent 靠截圖、判讀決策、輸出座標按鍵、執行動作的迴圈反覆操作電腦
看螢幕、算下一步、動手做,做完立刻再截圖確認,這個迴圈一直跑到任務完成或需要人確認為止。

有幾個技術細節,值得讓讀者具體看懂,而不只是聽個大概方向。第一、AI 輸出的是要把游標移動幾個像素這種座標指令,訓練這種數算座標的能力本身並不容易,Anthropic 官方研究文章自己形容,這跟語言模型常搞不清楚 banana 這個字裡有幾個字母 a,是類似的老問題。第二、螢幕畫面在送進模型前通常會先縮圖,例如某款十六吋筆電原生 3456×2234 的畫面,會先縮到約 1372×887 再送出,字太小看不清楚時,可以再局部放大讀。第三、整個過程其實是一張張截圖拼接而成的翻頁書式畫面,不是連續的影像串流,這一點也最容易被忽略,某些一閃即逝的畫面或提示,AI 是真的看不到,就像只看一連串照片、不是連續影片的人,同樣會漏掉某些瞬間動作。

每走一步,都重新截圖確認結果對不對

這類 Agent 並不是盲打,而是每做完一個動作,就要重新截圖檢查有沒有達到預期效果,錯了就重試,或者換個做法。Claude 開發者文件建議的使用方式,就是要求模型在每一步之後明確講出自己怎麼評估這一步,例如先確認「我已經評估過第 X 步」才進到下一步,而不是悶著頭一路往下做。

Anthropic 官方研究文章也提到一個有趣的觀察,模型會在遇到阻礙時自我修正、重新嘗試,不需要人特別去教。這代表它多少具備發現不對勁就自己調整的能力,雖然還談不上完美,但已經不是單純照表操課。

看不清楚的小字,會先放大局部再讀

補一個具體、讀者容易有畫面感的細節。畫面上太小的文字,比如側邊欄的檔名、分頁標題、狀態列文字,縮圖後常常會糊到認不出來,這時系統會先局部放大該區域再判讀,而不是憑猜測動作。Claude 開發者文件把這個功能叫做 enable_zoom,讓模型可以針對特定區域看清楚細節。

同一份文件也整理了點擊失準的除錯建議,其中最常見的成因就是解析度太低、畫面被過度縮圖,導致目標雖然在對的區域附近,細節卻已經模糊到判斷不出精確位置,建議的解法是開啟局部放大,或者用更高的解析度截圖。實務上,這也是「明明看起來點對地方,結果點歪了」最常見的原因之一。更實際的問題是,這一整套機制實際跑得多準、多快,這就要看公開的跑分怎麼說。

現在的電腦操作 AI Agent,做得到什麼程度?

要知道這類 Agent 現在真的能做到什麼程度,最誠實的方法是看公開跑分,而不是被行銷式的示範影片牽著走。國際學術評測 OSWorld 是目前這個領域最常被引用的標準之一,它出了 369 個真實的 Ubuntu、Windows、macOS 電腦任務,模型必須靠截圖判讀畫面、實際操作滑鼠鍵盤去完成,而人類基準大約能完成 72.36% 的任務。

把這幾年的進展攤成一條時間軸,幅度相當驚人。2024 年這個評測剛出現時,當時最好的模型只能完成 12.24% 的任務;同一年 10 月,Claude 3.5 Sonnet 剛推出電腦操作功能時拿到 14.9%,若放寬步驟數限制、讓它多試幾步再判定,成績會提高到 22.0%;到了 2025 年初,OpenAI 的 CUA 拿到 38.1%;2025 年 9 月,Claude Sonnet 4.5 拿到 61.4%,而僅僅四個月前的上一代 Sonnet 4 還只有 42.2%;到了 2026 年,Anthropic 用更新過的評測方式量出 Opus 系列模型已經來到 82.3%。

OSWorld 電腦操作任務完成率兩年內從 12.24% 升到 82.3%,已逼近並超越人類 72.36% 基準
電腦操作 AI Agent 兩年內從一成多爬到八成多,末段 82.3% 採用更新版評測(資料來源:OSWorld/OSWorld-Verified)。

這裡要補一句誠實的但書,後段 82.3% 用的是更新版的評測方法,業界稱為 OSWorld-Verified,跟最早期的原始評測分數不完全是同一把尺,兩者不能拿來做嚴格的一對一對比。但「兩年內從一成多進步到八成多」這個進步幅度本身是真實、公開可查的,不是誇大的行銷說法。

還有一個常被跑分掩蓋的面向,值得提醒。跑分看的是「最後有沒有做對」,不代表做得快。學術評測 OSWorld-Human 實際比較了這類 Agent 跟人類完成同一件任務所花的步驟數,發現就算是表現最好的 Agent,也常常要比人類多花 2.7 到 4.3 倍的步驟;任務做得越長,中後段每一步耗的時間可能是一開始的 3 倍。整體算下來,人類幾分鐘就能做完的事,這類 Agent 常常要跑上數十分鐘。也因為這樣,現階段它更適合用在不趕時間的背景性工作,不太適合對即時性要求高的場景。跑分講的是整體平均,實務上真正影響感受的,是任務類型本身,同一個系統面對不同性質的工作,表現落差可以很大。

規則清楚的任務它做得順手,臨場判斷的任務容易卡關

把上一節的抽象跑分,換成讀者能想像的具體任務類型對照,才回答得了「所以我現在能拿它做什麼」這個實際問題。步驟固定、規則清楚、重複性高的操作,例如照清單把資料一項項填進表單、依固定格式建立多筆項目,成功率很高,幾乎每次都能完成。反過來,需要臨場判斷、指令模糊,或是面對它訓練時較少見的介面,例如複雜試算表要逐格精準選取、指令只給模糊條件沒講清楚要用哪個篩選功能,就容易卡關,成功率大幅下滑。

這裡可以直接用 OpenAI 官方公布的實測案例當通則情境說明,不是杜撰,是官方自己公開的評測紀錄。像「建立一份購物清單待辦事項」這種重複性單純的操作,實測 10 次裡有 10 次成功;但換成「在特定條件下搜尋找房網站的物件」這種需要多重篩選與臨場判斷的任務,10 次卻只成功 3 次。同一份評測還有一個對照有意思,同樣是訂場地這個任務,指令講得越清楚,例如明確講出要用哪個篩選功能,成功率就有明顯提升;同一個任務換成模糊的指令,成功率就掉了下來。

規則清楚的重複任務電腦操作 Agent 幾乎每次都成,臨場判斷與模糊指令任務成功率大幅下滑
同一套系統,建購物清單 10 次全成功、模糊條件找房 10 次只成功 3 次(資料來源:OpenAI Operator System Card)。

重複性強的操作:填表單、建清單、跑比對

具體列出目前這類 Agent 做得穩的任務型態,讀者比較容易有「原來可以拿來做這個」的畫面。把已知的資料逐格填進申請表、依固定格式建立多筆待辦或清單項目、在不同頁面之間搬移資料做交叉比對,這些任務規則明確、步驟可預期,是目前電腦操作型 Agent 表現最一致的區域。OpenAI 官方案例也指出,這類重複、簡單的介面互動任務可以高度穩定地重複執行,拿來自動化瑣碎但重複的工作,相當合適。

生疏介面或模糊指令,最容易卡關

對照著看,容易失敗的情境也講清楚。OpenAI 官方文件對這類情況的說明很直白,面對訓練時較少接觸的少見介面,例如特殊的線上編輯器、專業排版工具,AI 容易大量試錯、動作沒效率,文字編輯的精準度也不夠;指令本身如果含糊,沒講清楚要用畫面上哪個功能,同樣容易走錯路。

給讀者一個實用的結論,跟這類 Agent 溝通,指令講得越具體,例如講明要用篩選區塊裡的哪一個選項,成功率就會明顯提升。與其丟一句籠統的要求,不如把該用哪個功能、篩選哪個條件都先講清楚。知道它在什麼情境下順手、什麼情境下卡關,只是操作層面的評估。更重要的是,這類 Agent 因為是真的在動滑鼠、按鍵盤,一旦做錯,後果比純聊天嚴重得多,這牽涉到另一層必須先弄懂的風險。

AI 動滑鼠鍵盤前,這些風險與煞車機制要知道

真的動手操作電腦,代價自然比純聊天高,可能是誤送出表單、誤下單、誤刪檔案,或者依照畫面上被植入的惡意指令去做不該做的事。這節要誠實講清楚兩件事:風險具體是什麼,以及目前業界怎麼把煞車做進系統裡,而不是只靠使用者自己小心。

電腦操作 AI Agent 有誤送出、誤下單、誤刪、視覺提示注入等風險,並以確認、沙盒隔離、可中斷煞車因應
真的動手就有誤送出、誤刪、被畫面假指令帶走的風險,系統以先確認、沙盒隔離與關不掉的中斷鍵當煞車。

畫面裡藏著的指令,AI 可能會信以為真

具體解釋一下「視覺提示注入」是什麼。如果一個網頁或畫面裡藏著看起來像指令的文字,例如偽裝成系統訊息,AI 判讀畫面時有可能把這段內容誤認成使用者真正下的指令去執行,而不是單純把它當成畫面上的一段資訊。Anthropic 官方研究文章對這種攻擊手法的說明也很清楚,惡意指令混在 AI 接觸到的內容中,讓模型誤以為是合法指令去執行,偏離原始意圖。

這是這類 Agent 特有、聊天型 AI 比較不會遇到的風險,因為它的工作方式就是看畫面、照做。Claude 開發者文件也提醒,畫面或網頁上的指令有時會覆蓋原本設定的指令,導致模型出錯,需要採取隔離措施降低風險。

系統內建的煞車:確認、隔離、隨時喊停

列出目前主流實作已經內建的防護機制,讓讀者知道這不是沒人管的裸奔狀態。關鍵、不可逆的動作,例如送出訂單、寄信,會先跳出來要求使用者確認才會真的執行;執行環境本身建議跑在隔離、沙盒化的空間裡,降低出錯時波及的範圍;使用者隨時可以按下中斷鍵立刻喊停,而且這個中斷鍵本身設計成不會被畫面裡的惡意指令關掉。

OpenAI 官方安全機制的做法是,要求使用者在送出訂單、寄出郵件這類有外部影響的動作前先確認,對特別敏感的網站要求使用者全程盯場監看,並且另外設有監控模型偵測可疑的畫面內容、暫停執行。Claude Code 官方文件描述的安全邊界也是同一個思路,一次只能控制使用者當場核准過的應用程式,授予敏感權限的應用程式會先跳出警示,全域的中斷鍵可以隨時從任何地方喊停,而且這個按鍵本身會被消耗掉,所以畫面裡的提示注入沒辦法反過來把這個緊急停止鍵關掉。

把這些拼在一起看,電腦操作 AI Agent 現在比較像一個已經能自己跑腿、但還在學走路的新手。規則清楚的重複工作,可以放心交給它去做;牽涉到送出、刪除、付款這類回不了頭的動作,還是該讓人在旁邊點頭確認過,才按下去。這個分寸,大概會是接下來一段時間裡,人跟這類 Agent 一起工作時最實際的相處方式。

資料來源
  1. When to use Windows 365 for computer-using agents (CUA) vs. robotic process automation (RPA) — Microsoft
  2. Computer-Using Agent — OpenAI
  3. Operator System Card — OpenAI
  4. Developing a computer use model — Anthropic
  5. Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku — Anthropic
  6. Introducing Claude Opus 4.7 — Anthropic
  7. Let Claude use your computer from the CLI — Claude Code
  8. Computer use tool — Claude
  9. OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments — OSWorld
  10. OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents — OSWorld-Human