AI 客服對話設計:4 個鬼打牆原因+3 個解法一次看

顧客在官網的對話框打了一句「我的訂單什麼時候會到」,AI 客服回了一段物流查詢連結。他心裡還是沒底,換個說法再問一次「訂單大概幾天能收到」,這次 AI 卻自顧自切進了退換貨流程,答非所問。他有點不耐煩,打了句「你是不是聽不懂我在問什麼」,結果換來第三種、還是文不對題的回覆。三個回合、三種答案,沒有一個真的解決他的問題。

這種狀況背後常被誤會成「AI 不夠聰明」,其實問題多半出在 AI 客服對話設計這件事上,也就是要不要把「同一件事」的處理路徑先訂清楚,讓意圖判斷、記憶、知識庫、回覆語氣這幾層各自對得上,而不是每次都讓模型現場自由發揮。設計沒顧到,不只讓顧客多花時間繞圈子,還會讓他認定這套系統整體不可靠,連帶影響他對品牌的信任;反過來說,把這幾層搭好,答案不一致的情況其實有明確的方法可以收斂,不必只靠模型愈訓愈聰明。

先從同一個問題為什麼換來不同答案講起,再一路拆進背後的四個常見病灶,以及能對症下藥的三個解法。

同一個問題,AI 客服為什麼每次回答都不一樣?

多數企業遇到 AI 客服答非所問,第一個反應通常是懷疑模型不夠聰明,或者知識庫塞的資料不夠多。但從設計的角度看,真正拖累回答一致性的,常常是「對話設計」這個中間層沒有先搭好,而不是模型本身的語言能力不足。

對話設計包含好幾層,各自負責不同的工作:意圖辨識(intent recognition)負責判斷顧客這句話想問什麼;對話狀態(dialogue state)負責記住前面講過的內容、判斷現在進行到哪一步;知識庫負責決定要拿哪一份資料當答案的依據;生成語氣則負責把找到的答案組織成一句自然的話。鬼打牆通常不是單一原因,而是其中一層、甚至好幾層同時出了問題,不是「AI 笨」這麼單純一句話能解釋。

AI 客服對話設計的中間層由意圖辨識、對話狀態、知識庫、生成語氣四層接力,四層都對得上答案才會一致
AI 客服對話設計其實是意圖辨識、對話狀態、知識庫、生成語氣四層在接力,任一層沒搭好,同一個問題就會換來不同答案。

很多企業以為答非所問是知識庫不夠完整,於是不斷往裡面塞更多常見問答,結果顧客還是被繞。Nielsen Norman Group 一份針對對話機器人易用性的研究就指出,多數對話機器人本質上是「線性流程加上有限分支」的設計,使用者的用詞或順序只要稍微偏離腳本預期的寫法,系統就容易答非所問,這正好說明同一個問題換句話問就換答案,根源常常在流程設計本身,而不是資料塞得夠不夠多。

這裡還要分清兩件事:回答不一致,跟回答錯誤,並不是同一回事。同一個問題被系統給出三種不同答案,對顧客信任感的傷害,往往比給一個雖然不夠完整、但前後一致的答案還要大,因為顧客懷疑的不再是「這次沒答對」,而是這套系統整體可不可靠。這正是 AI 客服對話設計要解決的核心問題。

AI 客服鬼打牆,通常卡在這 4 個原因

上面這幾層拆解偏抽象,實際落地時,鬼打牆通常會具體卡在下面四個環節。看懂這四點,不只工程團隊,店家自己也能一眼看出問題出在哪個環節,後面三個解法也是針對這四個病灶而設計。

AI 客服鬼打牆常卡在意圖沒固定路徑、對話沒記性、知識庫矛盾過舊、生成太自由這四個環節
鬼打牆通常卡在這四個環節,看懂了就能一眼判斷答非所問是哪一層出了問題。

原因一:意圖判斷沒有固定路徑,每次都靠模型「現場猜」

意圖辨識如果沒有先把常見問題收斂成一份有限、明確的分類清單,同一句話換個說法問,系統等於每次都要重新猜一次對方的意圖。猜對猜錯,幾乎全看當下的狀態,自然會產生三種不同的答案。

Nielsen Norman Group 同一份研究裡記錄了幾個實際觀察到的例子:達美樂披薩(Domino’s Pizza)的訂購機器人被使用者問到住的地方是公寓還是房子時,對方打了「townhome」這個字,機器人完全聽不懂,只回了一句自己沒辦法理解;另一個例子是精品品牌 Burberry 的客服機器人,使用者只打了「Belt」想找皮帶商品,系統卻回了一串訂單取消的說明。這兩個例子的共同點,都是意圖判斷沒有先收斂出固定的路徑,系統只能照當下認得的關鍵字硬猜,猜偏了就答非所問。

原因二:對話沒有記性,前後文接不起來

多輪對話要順暢,AI 得記住三件事:顧客剛剛講過什麼(context)、目前已經蒐集到哪些資訊(槽位,slot)、進度走到哪一步(對話狀態,dialogue state)。少了這三樣,AI 每次回覆都像重新開一段新對話,顧客換句話再問一次,系統等於從零重算,答案自然對不上。

Rasa 在〈How To Build Multi-Turn AI Conversations〉裡指出,多輪對話需要意圖辨識、槽位填充(slot filling)、對話狀態管理,加上離題處理(handling digressions)這四個構件才撐得起來;文中也點出根本原因,多數基礎的 AI 系統把每一句輸入都當成獨立事件處理,不會回頭參考前面說過的內容,只看最新這一句。這也解釋了顧客為什麼常被要求把訂單編號、問題內容重講一次,因為系統根本沒有把上一輪的資訊留下來。

原因三:知識庫互相矛盾或版本過舊

不少企業的 AI 客服背後接了好幾個資料來源:常見問答文件、舊版政策頁面、內部信件範本,彼此更新的時間點都不一樣,版本也沒有同步。AI 檢索的時候撈到哪一份,就照哪一份回答,同一個問題自然會撈到不同版本的說法,有時候連客服人員自己都搞不清楚哪一份才是最新的。

Gartner 的研究顯示,資料品質不佳平均讓企業每年損失約 1290 萬美元。這個數字說明資料品質從來不是 IT 部門私下處理的小事,而是有具體代價的營運風險;對 AI 客服而言,知識庫要有唯一版本、定期盤點汰換過期內容,才不會讓 AI 檢索到早就作廢的舊答案。

原因四:生成太自由,同一件事換句話講就換答案

當生成式 AI 沒有被限制在一個固定的框架裡組織回覆,同一件事換個問法,模型表達的方式就可能整個不一樣,細節甚至彼此矛盾。這跟「幻覺」屬於同一類風險,但更常見的表現不是明顯捏造事實,而是用詞與結論一路飄移,讓顧客覺得系統每次的立場都不太一樣。

Sparkout Tech 整理的一份 AI 客服常見錯誤診斷表裡,把「相似問題卻給出不同回覆」列為一項獨立症狀,指出常見成因是提示詞不一致,或者資訊來源分散在好幾個地方;對應的解法是統一提示詞範本、把知識來源集中管理。這四個原因不管是哪一個沒顧到,只要放著不處理,接下來要付出代價的就不只是這一次的對話。

答非所問放著不處理,會先流失哪些顧客?

顧客被同一個問題繞了兩三圈,通常不會再給第三次機會,而且離開之前,他們往往還會留下一則負評,或是一筆客訴紀錄。這不只影響這一次的生意,還牽動後面每一個看到評論的潛在顧客的第一印象。

這也是為什麼前面提到的「回答不一致」比「回答錯誤」更傷,因為同一個問題被系統前後給出好幾種不同答案時,顧客認定的不是「這次沒答對」,而是「這整套系統不可靠」;信任一旦動搖,再多正確答案也很難拉回來。Zendesk 的客服統計顯示,消費者在經歷多次不佳的客服體驗後,有 73%會轉向競爭對手,而只要一次不好的體驗,就有超過一半的消費者會考慮轉單。這個比例說明,放著鬼打牆不處理,流失的不會只是一兩個顧客,而是一整批本來願意留下來的熟客。

與其等顧客用腳投票,不如把前面四個病灶逐一解決。第一個該補的,是讓每個問題都能找到同一條處理路徑。

解法一:先畫「意圖地圖」,讓每個問題只對應一個標準答案

先把過去的客服對話紀錄、常見問答整理出來,看使用者實際上會用哪些不同的說法問同一件事,再把這些說法歸納成一份有限的意圖清單。每個意圖對應唯一一套標準答案的骨架,可以是一份能重複套用的範本,不必是逐字照本宣科的固定台詞,讓生成模型在這個骨架裡組織語言,而不是每次都自由發揮去猜顧客要什麼。把這些意圖收斂整理好,就是一份可以持續更新的意圖地圖。

整理意圖清單的起點,是把過去的對話紀錄拿出來分析,找出被問最多次的問題,以及同一件事有哪些不同的問法變體。找到之後,「同一個意圖、不同問法」要收斂成同一條處理路徑,不能各自獨立處理,不然就等於同一件事被拆成好幾套邏輯,答案自然對不上。

比較麻煩的是意圖邊界模糊的情況,例如顧客只打了一句「我要換」,系統不知道是要換貨還是退貨。這時候該做的不是讓系統各憑印象猜一個答案,而是設計成主動追問。Rasa 在〈How to Create Effective Chatbot Conversation Designs〉裡就示範過類似的做法:當使用者說「我要轉帳」這種意思不夠明確的請求時,系統該反問對方是一次性轉帳,還是要設定成週期性扣款,而不是自己認定一種答案就往下走。這個原則放到客服情境一樣成立,意圖模糊時,多問一句比自己亂猜更能守住答案的一致性。

意圖地圖把同一件事的不同問法收斂成一個意圖對應一套標準答案,意圖模糊時先主動追問而不是亂猜
把不同問法收斂成同一條路徑、模糊時主動追問一句,同一件事就永遠對應同一個標準答案。

意圖判斷對了,只是解決鬼打牆的第一層;顧客問完一次後,AI 記不記得住剛剛講過的內容,是接下來要顧的下一關。

解法二:讓 AI 有「記性」,別讓顧客自己重講一次

替對話加一層狀態追蹤,記住顧客剛剛提供過的資訊,例如訂單編號、問題類型,也記住目前進行到流程的哪一步。這樣顧客換個方式再問一次,不會被要求整個重新自我介紹一遍;系統也要能辨認出「顧客只是換句話問同一件事」,而不是把它當成一個全新的問題重新處理。

這裡有兩個名詞值得先弄清楚。槽位(slot)指的是系統需要蒐集的關鍵資訊,像訂單編號、聯絡電話、想查詢的日期,都是一個個槽位;對話狀態(dialogue state)則是指目前對話走到流程的哪一步、哪些槽位已經填好、哪些還缺。少了這兩層,AI 每答一句都像重新開機,前面問過的資訊全部歸零。

AI 客服用槽位記住訂單編號等關鍵資訊、用對話狀態記住進度,顧客換句話再問也不必重講一次
靠槽位與對話狀態記住講過的內容和進度,顧客換個說法再問,系統仍接得上、不必重報一次編號。

顧客中途離題或臨時補充資訊時,也要設計成先把這段內容記下來,再把對話帶回原本的任務,而不是整段對話直接中斷重來。Rasa 在〈How To Build Multi-Turn AI Conversations〉裡把槽位填充、對話狀態管理,跟離題處理並列為多輪對話不可或缺的構件,理由正是這幾層合起來,才能讓系統不必要求使用者一再重複同樣的資訊。

記性顧好之後,還有一種情況兩者都救不回來,那就是當 AI 真的判斷不出意圖、卡住的時候,接下來怎麼回應,才是留住顧客的最後一道防線。

解法三:設計「復原機制」,別讓每次卡關都回同一句「我不明白」

當 AI 辨識不出使用者的意圖時,常見的做法是每次都丟出一模一樣的萬用句,像是「抱歉我不太明白,請換句話說」。比較好的設計,是根據當下最接近的幾個可能意圖,直接列出來讓顧客選,不必要求顧客自己再想一次該怎麼問。這種做法業界稱為復原優先設計(fall-forward),同時也要準備清楚的跳出選項,像是重新開始、換個問法、轉真人客服,避免顧客卡在同一個死胡同裡繞不出去。

通用的錯誤訊息,跟「根據當下語境給出最接近的選項」,是完全不同層級的設計。如果同一種萬用回覆連續出現兩次以上,就代表這個環節該觸發不同的處理路徑,不能第三次還是丟出同一句話;復原機制也該跟情境掛鉤,不同任務卡關時該給的選項也不一樣,不是所有情境共用同一套罐頭句。

加拿大蒙特婁銀行(BMO)的客服機器人是個具體的前後對照案例。UX Content Collective 整理的一篇文章指出,BMO 的機器人原本超過一半的對話都被判定成無法辨識,只要比對分數低於 50%,系統就直接丟出「我不太明白,麻煩換個問法」,顧客常常被卡在原地。後來設計團隊把做法改成信心不足時,直接顯示幾個最接近使用者需求的選項讓對方點選,顧客不用從頭再問一次就能找到出路——同一套邏輯,換了一個呈現方式,結果差很多。

復原機制前後對照:每次卡關都回同一句我不明白讓顧客卡死,改成列出最接近選項並提供轉真人客服才有出路
不是每次卡關都丟同一句罐頭回覆,而是列出最接近的選項、再備好轉真人客服的出路,顧客才不會繞不出去。

這三個解法把眼前的鬼打牆解決了,但顧客的問法會一直變,系統也不會永遠站在原地不動。

上線不是終點——怎麼從對話紀錄揪出還在鬼打牆的地方?

意圖地圖、記性、復原機制這三個解法上線之後,不會一次就到位,一定要定期回頭看真實的對話紀錄,才能持續把「同一個問題卻換來好幾種答案」的情況收斂到最少。

具體要做的,是從對話紀錄裡挑出「同一個意圖、不同問法卻被分類到不同處理路徑」的案例。把這些案例找出來,才知道意圖地圖哪裡還沒收斂完整,該補進哪些說法變體。Rasa 在〈How to Create Effective Chatbot Conversation Designs〉的「Test and Refine with Feedback」段落裡建議,持續監看對話分析數據,包括完成率、滿意度、復原機制觸發的頻率,用這幾個訊號找出哪個環節還需要調整。

上線前也不必等系統成熟才開始測試。找少數幾位真人實際操作,觀察他們實際卡在哪一步,是成本相對低、卻很有效的做法。Nielsen Norman Group 同一份研究本身用的方法就是如此,找了 8 位使用者實際上機操作,觀察真實的卡關情境,而不是靠團隊內部憑空想像可能的問題。把這些觀察結果回頭補進意圖地圖,系統上線前就能先擋掉一部分明顯的漏洞。

至於多久該回顧一次對話紀錄,沒有固定的標準答案,但幾個訊號值得持續追蹤:同一個問題被反覆問了幾次才問到滿意的答案、對話中途放棄的比例有沒有升高、復原機制被觸發的頻率有沒有異常增加。這些數字一旦出現變化,通常就是系統又開始鬼打牆的第一個訊號。

AI 客服會不會鬼打牆,考驗的從來不是模型多聰明,而是背後有沒有人把「同一件事該怎麼回」這條路先想清楚、寫下來,並且定期回頭檢查。意圖地圖畫得再完整,也會隨著顧客問法變化、產品規則調整而慢慢跟不上,AI 客服的對話設計因此不是上線那天就結案的專案,而是要跟著真實對話持續維護的長期紀律。願意把這件事當成日常工作的一部分,答非所問的情況才會愈來愈少,顧客也才會漸漸相信,不管換哪種問法,得到的答案都是同一套可以信任的說法。

資料來源
  1. The User Experience of Chatbots — Nielsen Norman Group
  2. How To Build Multi-Turn AI Conversations — Rasa
  3. How to Create Effective Chatbot Conversation Designs — Rasa
  4. Data Quality: Why It Matters and How to Achieve It — Gartner
  5. 92 Customer Service Statistics You Need to Know in 2026 — Zendesk
  6. 17+ AI Chatbot Mistakes That Hurt Accuracy, CX & Revenue — Sparkout Tech
  7. Designing chatbots: how to design fallback logic — UX Content Collective