多數企業評估 AI 客服上不上得了檯面,用的還是一張真人客服的舊考卷:滿意度、處理時間、解決率全部混在同一組數字裡看,結果 AI 表現得好不好,反而是最說不準的一件事。Ada 與研究機構 NewtonX 合作,在 2026 年訪問了 2,000 名消費者與 500 位企業 CX、AI 決策者,發現 44% 的企業把 AI 與真人客服的表現放在同一組指標裡衡量;同一份調查裡,只有四分之一的消費者確定自己的問題是被 AI 獨立解決掉的,完全不需要真人再介入。兩個數字擺在一起,落差就很清楚:企業測的是「整體客服好不好」,消費者感受到的卻是「AI 這一段有沒有用」,兩件事根本不是同一回事。
AI 客服 KPI 追蹤要先解決的正是這個落差,不是隨便挑幾個舊指標套上去,而是重新界定哪些數字該分開算、哪些指標對 AI 特別敏感,又該多久盤點一次。搞懂這套架構,才看得出 AI 實際上解決了多少問題,也才有依據判斷追蹤方式該不該調整。先從最容易被忽略的地方講起,AI 一上線,原本用得好好的客服指標,可能第一個就先失真。
AI 客服上線後,原本的客服指標為什麼會失真?
AI 通常最先接走的,是密碼重設、訂單查詢、退換貨規則這類重複性最高、最好回答的問題。留給真人的,反而是那些 AI 判斷不了、情緒比較激動,或牽涉例外狀況的難案。
這樣的分工方式,會讓平均處理時間(Average Handle Time,AHT)這項傳統指標整個變調。真人客服手上的案件組成變了,同樣是一通電話,現在留在真人手裡的案件平均起來就是比以前難、比以前花時間;AHT 只要沒有把案件難度拆開來看,很容易被誤讀成客服效率變差,實際上只是案件組成換了一批。等到自動化流程成熟、AI 能接住的案件比例愈墊愈高,AHT 才會真正回落。
第一次回應時間(First Response Time,FRT)問題更明顯。AI 幾乎是秒回,傳給客戶的第一句話不用等,FRT 這項數字一夕之間就會趨近於零。這聽起來像進步,但 FRT 原本的作用是拿來區分客服反應快不快,當幾乎每家公司套上 AI 都能把 FRT 壓到差不多低,這個指標就失去了原本的鑑別力,沒辦法再用它來判斷服務好壞。
Salesforce《State of Service》報告的調查印證了這個轉變的速度。客服團隊估計,AI 目前平均已經處理 30% 的服務案件,且預期到 2027 年這個比例會再拉高到 50%。案件分配持續往 AI 傾斜,舊指標若不重新拆解,只會愈用愈失真。
與其死抱著舊指標不放,不如先問一個更根本的問題,AI 有沒有真的把問題解決掉,不用勞煩真人再出手?
Containment Rate 怎麼算,才算是真的解決?
涵蓋率(Containment Rate)算的是 AI 獨立完成、全程沒有轉真人的對話,占 AI 對話總數的比例。分子是 AI 獨立完成的對話數,分母是 AI 對話總數。
涵蓋率 =(AI 獨立完成的對話數 ÷ AI 對話總數)× 100
假設某個月 AI 客服總共接了 1,000 通對話,其中 650 通從頭到尾都沒有轉真人,涵蓋率就是 65%。
這個數字看起來很直覺,好用之處是能快速看出 AI 接住了多少對話,但它有一個常被忽略的漏洞。AI 只要用一句籠統的答案把對話結束掉、不讓客戶轉真人,帳面上照樣算涵蓋成功,即使問題根本沒有真的被解決。涵蓋率量的是「有沒有轉真人」,不是「問題有沒有被解決」。這兩個問題聽起來像同一件事,實際上是兩回事,下一節會把它跟另外兩個常被搞混的名詞一起拆開講。
現階段業界的自動化程度落在什麼水準?Gartner 在 2025 年的一份預測指出,到 2029 年,具備自主判斷能力的 agentic AI 將能在完全不需要人力介入的情況下,獨立解決 80% 的常見客服問題。對照前面提到 Salesforce 的調查(AI 目前平均處理 30% 案件、預期 2027 年成長到 50%),就能看出這中間還有一段路要走。現在多數企業的涵蓋率,離「常見問題八成自動解決」的目標還有明顯差距,這也是為什麼涵蓋率要當成一個持續追蹤、逐季往上推進的指標,而不是設一次就不管的門檻。
Containment、Deflection、FCR,公式其實不一樣
同一場會議裡,涵蓋率、分流率、FCR 三個詞常常被交替著用,好像在講同一件事,其實三個公式的分子、分母完全不同。
涵蓋率只看 AI 對話裡有多少沒有轉真人,分母鎖定在 AI 對話本身,如同前面一節算過的例子。
分流率(Deflection Rate)看的範圍更大,分母是整體工單量的變化,連客戶自己在說明中心、自助頁面找到答案、根本沒開工單求助的情況都算進去。
分流率 =(因自助服務而未產生的工單數 ÷ 原本預期會產生的工單總數)× 100
因為分流率把客戶自己解決、連對話都沒開始的情況也算進去,數字通常會比涵蓋率高一截,兩者拿來直接比較沒有意義。
首次接觸解決率(First Contact Resolution,FCR)則是三者裡唯一要求客戶自己認定問題真的解決了的指標,而且通常要橫跨 AI 與真人一起算,不能只挑 AI 那一段來算才公平。
FCR =(第一次接觸就解決、後續沒有再回頭聯絡的案件數 ÷ 總接觸案件數)× 100

北美 call center 基準研究機構 SQM Group 長期追蹤 FCR 與滿意度的關聯,發現 FCR 每提升 1%,顧客滿意度大約也會跟著提升 1%;業界公認健康的 FCR 區間落在 70% 到 79% 之間,目前產業平均值約在 70%,也就是將近三成的來電得靠客戶回撥才能真正解決。研究同時指出,問題在第一次接觸就被解決掉的顧客,有 95% 會繼續回頭消費。這個比例遠比只看涵蓋率或分流率算出來的數字,更能反映客戶的真實去留。

把三個公式分清楚之後,還有一個更根本的分岔沒處理,滿意度該怎麼統計,才能看出 AI 客服真正的表現,不被真人客服的分數稀釋掉?
AI 客服的滿意度,不能跟真人客服的分數混在一起算
開頭提到的那份 Ada 研究,點出了不少企業在做滿意度調查時最常犯的一個動作,把 AI 獨立完成的對話,跟轉交真人處理的對話,通通塞進同一份滿意度問卷、算成同一組平均分數。
正確的做法是把兩種對話分開發送調查:AI 全程獨立完成、沒有轉真人的對話,發一份滿意度調查;轉交真人接手的對話,另外發一份,兩組數字分開統計、分開看趨勢走向,不合併成單一平均值。
混著算會失真,原因在於兩邊案件的起跑點本來就不對等。AI 接走的多半是重複性高、規則清楚的簡單案件,真人接手的則是 AI 判斷不了的難案,兩種案件的滿意度基準本來就不一樣;合併平均之後,「AI 這一段做得如何」這個問題反而被洗掉,分不清楚分數的高低究竟來自 AI 表現好壞,還是案件難度本身的落差。
這也是為什麼那份調查值得留意,企業裡有 44% 把 AI 與真人客服的表現混著算,但消費者端只有四分之一確定自己的問題是被 AI 獨立解決、完全不需要真人再介入。調查裡另一個數字也值得對照,只有 32% 的消費者,把自己最近一次 AI 客服的體驗,在滿分 10 分的量表上評為 8 分以上。企業測出來的整體滿意度可能還過得去,真正拆開來看 AI 這一段的表現,滿意度其實沒有帳面數字那麼漂亮,只是被合併平均遮住了。分開看,才看得到這個落差。

滿意度分開算,只解決了「看得準不準」的問題。還有一種訊號,會比滿意度分數更早示警,那就是客戶得花多少力氣才能把問題講清楚。
為什麼「客戶要花多少力氣」比滿意度更早示警?
客戶費力度(Customer Effort Score,CES)量的不是客戶滿不滿意,而是客戶解決這個問題花了多少力氣。收集方式通常是一題式問卷,在對話結束後問一句「解決這個問題有多輕鬆,還是多費力」,用 5 等尺度作答,再統計回答「輕鬆」的比例。
這項指標對 AI 客服特別重要,原因在於 AI 客服最容易踩的一個雷,就是逼客戶把同一個問題換句話重講好幾次。客戶可能得試第二次、第三次,AI 才終於聽懂問題、給出正確答案。最後對話結束時,客戶拿到的答案是對的,滿意度問卷可能還是會給出不低的分數,但過程中反覆重講的那股疲憊,滿意度分數量不出來,CES 卻會先抓到。
這正是 CES 被稱為領先指標的原因。問題還沒嚴重到拖累滿意度分數之前,費力度已經先出現異常。等到滿意度分數也跟著下滑,通常代表這個裂縫已經拖了一段時間,不是剛發生的事。
客戶費力度會被廣泛採用,源頭是《哈佛商業評論》(Harvard Business Review)在 2010 年一篇經典研究——Dixon、Freeman 與 Toman 三位作者發現,低費力度的客戶,忠誠度反而比那些被「取悅」到很滿意、卻過程很費力的客戶更高。這份研究後來成為客服體驗衡量圈子裡,持續被引用的重要依據。
CES 抓到的是體驗上的裂縫,還有一塊完全沒被前面幾個指標碰到。AI 客服算不算划算,需要一個具體的成本數字才有答案。
AI 客服一次解決,實際成本要怎麼算?
每次解決成本(Cost per Resolution)的算法是把支援總成本,除以實際被驗證解決的對話數。支援總成本包含平台訂閱費,以及維運人力投入的時間換算成本。
每次解決成本 = 支援總成本(平台訂閱費 + 維運人力時間換算)÷ 實際被驗證解決的對話數
這條公式最容易算錯的地方在分母。分母要放的是「有驗證的解決」,不是 AI 接過的所有對話數。如果把大量根本沒解決、只是被籠統答案結束掉的空對話也算進分母,算出來的每次解決成本會被稀釋得很低,看起來效益很好,實際上只是拿一堆沒用的對話墊高分母,把真實成本美化掉了。
有了這條基準線,還需要一個對照對象,才知道算出來的數字划不划算。顧問公司 Forrester 兩份獨立的 Total Economic Impact(TEI)委託研究提供了參考範圍。針對 Zendesk 平台的一份研究算出,真人客服處理一次詢問的滿載成本平均約 5.61 美元;另一份針對 Azure OpenAI Service 的研究,則算出真人接手一通電話的成本約 10 美元。兩份研究的方法與產業樣本不同,數字自然有落差,但都可以當成真人成本大概落在哪個範圍的參考基準,拿 AI 算出來的每次解決成本去對照。
這裡談的只是怎麼計算「這一個」追蹤指標,拿它當日常監控的基準線;完整的投資回本試算,牽涉到導入初期的建置成本、學習曲線、逐月攤提,是另一件需要單獨拆解的事,這裡不展開。
從涵蓋率、分流率、FCR,到滿意度、費力度、成本,前面談了六種不同角度的數字。指標一多,最怕的反而是每個都追、每個都淺,最後沒有一個看得深。
指標這麼多,該追蹤哪幾個、多久盤點一次?
前面談過的六種角度數字,合起來要收攏成一套完整的 AI 客服 KPI 追蹤架構,而不是每個指標各追各的、各看各的。
Google 研究團隊提出的 HEART 使用者體驗衡量框架,原本用來衡量網頁應用程式的體驗,拿來整理客服指標也很好用。這套框架把體驗拆成五個分類:Happiness(愉悅度)、Engagement(參與度)、Adoption(採用度)、Retention(回訪率)、Task Success(任務完成度)。
把前面談過的指標對號入座:Happiness 對應滿意度與費力度,量的是客戶主觀感受;Task Success 對應涵蓋率與 FCR,量的是問題有沒有真的被解決;Retention 則對應客戶會不會帶著同一個問題回頭聯絡,或是乾脆轉向別的管道。這樣分類之後,追蹤架構不再是一長串平行的數字,而是分成「客戶感受」「問題有沒有解決」「會不會回頭」三個層次,各自看各自的訊號。

檢視節奏也不必每個指標都用同一套頻率。跟營運直接相關的核心數字,像涵蓋率、每次解決成本,適合每週盯著看,一旦某週數字異常,通常代表 AI 邏輯或知識庫剛好出了問題,愈早發現愈好處理。跟體驗相關的數字,像滿意度與費力度,波動本來就比較慢,單看一週的數字容易被雜訊帶著跑,改成每月看一次趨勢線,才看得出真正的走向。
指標本身不會說謊,會讓數字失真的,是「怎麼分組去算它」。先把 AI 獨立完成的對話跟真人接手的對話分開算,這條線畫清楚了,AI 客服 KPI 追蹤才有意義,也才有資格談後面要不要再加更多指標、要不要投入更多心力優化這套架構。
