一份文件同時交給三位譯者,各自翻譯成中文,三份稿子交回來,每個字都看得懂,語法也都通順,差別卻藏在細節裡。有的讀起來像在地人寫的,用詞抓得很準;有的字裡行間還留著另一種腔調,句子順但味道不太對。挑譯者的人靠試讀幾段就分得出高下,換成 AI 聊天助手就沒那麼直覺,因為每一款工具打出來的都是繁體字,乍看都「正確」。
這其實就是 AI 聊天助手繁體中文道地程度最容易被忽略的地方。同一個問題丟給不同工具,答案表面上都通順,細看用詞卻可能悄悄帶進對岸慣用的說法。這篇不打算排名哪一款的中文最道地,同一款工具在不同任務上表現本來就不一樣;比較有用的是先搞懂落差從哪裡來,再學會自己怎麼核對、不同情境該留意哪些工具的哪些長處。先從落差的成因講起,再一步步拆到怎麼核對、怎麼下指令改善。
AI 為什麼常常「說」出簡體用語?
主流的大型語言模型在訓練的時候,吃進去的中文語料裡,簡體中文的份量遠遠超過繁體中文,這是繁體中文使用者常遇到怪異用詞的根本原因。台灣大學研究團隊在開發 Taiwan-LLM(一款專門優化繁體中文的語言模型)時就指出,主流模型多半以英文與簡體中文作為主要訓練語料,導致模型對繁體中文使用者慣用的語感與用字不夠敏感。這不是哪一家做得比較差,而是訓練資料本身分布不均的結果——全球中文網路內容裡,簡體中文的產出量本來就比繁體中文多出許多,模型學到的「預設直覺」自然更貼近對岸用法。
這個落差不是猜測。羅徹斯特大學與康乃爾大學的研究團隊在 2025 年一場探討人工智慧公平性與問責的學術會議(ACM FAccT)上,發表了一份稽核 11 款主流商用與開源模型的研究,其中一項任務要求模型針對在中國大陸與台灣有不同稱呼的物品選出用詞。結果多數受測模型即使被要求用繁體中文回答,選出的用詞仍不成比例地偏向對岸慣用說法。研究團隊把這個落差歸因於訓練資料的語言比例、模型內建的用字偏好,以及分詞(tokenization,把句子切成模型可處理的最小單位)機制上的差異。這幾個因素疊加起來,才讓「打出繁體字」跟「用詞道地」變成兩件不必然同時成立的事。

換句話說,看到 AI 聊天助手偶爾冒出簡體用語,不必急著認定是哪一款工具特別粗心。真正該做的,是學會自己怎麼一眼看出這些殘留。
怎麼一眼看出回答裡藏著簡體用語?
比起等別人告訴你「這句怪怪的」,自己會核對更實用,而且核對的方法並不複雜,重點放在那些即使打出來是繁體字、用詞習慣卻是對岸那一套的詞彙。教育部《重編國語辭典修訂本》附錄的「常見大陸地區語詞對照表」,收錄了不少這類科技與日常詞彙,其中幾組在 AI 回答裡特別容易出現:
| 常見的大陸慣用說法 | 台灣慣用說法 |
|---|---|
| 計算機 | 電腦 |
| 軟件 | 軟體 |
| 磁盤 | 磁碟 |
| 數據庫 | 資料庫 |
| 存儲器 | 記憶體 |
| 操作系統 | 作業系統 |
| 窗口 | 視窗 |
| 智能 | 智慧 |
| 字符 | 字元 |
把這幾組詞記住,下次看到 AI 聊天助手回答裡出現「軟件安裝」「數據庫連線」這類說法,就能立刻認出來,不必猜。不過出現一兩個不代表整段答案就不能用,用字習慣本來就會被上下文帶著跑,偶爾滑一兩個詞很常見;真正該留意的是同一段裡密集出現好幾組,那通常代表這段內容背後參照的語料本身就偏向對岸用法,值得整段重新檢查用詞,而不只是挑幾個字改掉。
這份清單放在手邊,看任何一款工具的回答時都能派上用場,接下來幾個情境會再回頭用到它。
重視在地用語與即時資訊的情境,該看哪一種能力?
如果查的是台灣在地的生活資訊,例如特定路段有沒有事故、附近店家幾點打烊、某個新聞事件的最新進度,這類需要跟上當下脈絡的問題,比較值得留意的不是哪一款工具的中文比較漂亮,而是它有沒有把即時搜尋與在地服務接得上。
Google 的 Gemini 從 2025 年 1 月起,Gemini Live 的語音對話正式開放繁體中文,同時擴充功能也同步支援繁體中文,能連到 Google 日曆、Google Tasks、Google Keep 這類服務,直接把查到的資訊放進使用者原本就在用的行事曆或清單裡。這件事跟語感道不道地看似無關,實際上關係不小。當一款工具能把即時搜尋與在地服務接得上,它給出的答案本來就比較不需要從遙遠的訓練語料裡翻譯過來,讀起來生硬的翻譯腔機率也會跟著降低。
另一個值得留意的做法是 Perplexity。根據 Perplexity 官方說明,它的每一個回答都會附上可以點開查證的來源連結,讀者不必照單全收,可以自己回頭核對這段用詞是不是真的貼近台灣的語境,還是引用了偏向對岸脈絡的資料來源。這兩種取向解決的是不同問題,一個靠接進在地服務降低翻譯腔,一個靠附上來源讓使用者自己判斷,沒有哪一種天生比較適合這個情境,端看想自己核對還是想讓工具直接幫忙把資訊接上。
看重正式文件語感穩定,該用什麼判準?
換成要寫商業文案、正式信件這類講究語感穩定的用途,情境就不一樣了。這裡沒有哪一款工具中文比較好的簡單答案,比較有用的是自己抓幾個判準,拿同一份草稿實際跑過一輪再判斷:
- 用詞道地度:對照前面那份清單,看有沒有出現「軟件」「數據庫」這類殘留。
- 語序自然度:句子讀起來順不順,有沒有那種翻譯過的生硬感,例如把英文語序直接套進中文句子。
- 慣用語混雜度:有沒有夾雜台灣少用的說法,像是特定的量詞用法或口語習慣。
三個判準都過關,這份草稿才算真正貼近台灣讀者的閱讀習慣。

前面提到,同樣的落差來自訓練資料的代表性、用字偏好與分詞機制的差異,這也是同一款工具在不同任務上表現不一定一致的原因。擅長整理資料的工具,不代表寫出來的商業文案語感就穩;語音對話流暢的工具,也不保證正式文件的用詞就道地。因此正式文件產出後,建議一定要用前面「怎麼一眼看出簡體用語」那份清單再核對一次,把 AI 產出當草稿,而不是能直接送出的終稿。
要在文件裡直接修稿,順手比什麼都重要
有些時候問題不是哪一款中文比較道地,而是根本不想離開手上的檔案。草稿已經寫在 Word 裡、報價單已經開在 Excel 裡、簡報已經排在 PowerPoint 裡,這時候比起切換到另一個聊天視窗貼上貼下,更實際的需求是能不能直接在原本的文件裡修潤用詞。
Microsoft 的 Copilot 目前把繁體中文列進支援的語言清單裡,能在 Word、Excel、PowerPoint 這類辦公室軟體裡直接讀取並修改文件內容,不必另外開視窗。這種整進工作流程裡的做法,省下的是反覆複製貼上的時間,對常常要處理正式文件的人來說是實際的效率差異。
不過這裡有個容易誤會的地方。介面顯示繁體中文,不等於它改出來的內容語感就道地。介面語言是產品設定,內容語感是模型生成時的用字習慣,兩件事各自獨立,裝了繁體中文介面不代表改出來的段落就通過前面那三個判準。修完之後,還是得回頭用「怎麼一眼看出簡體用語」那份清單核對一遍,才知道這次改稿是真的貼近台灣用語,還是只是介面翻對了。
語感能不能變道地,關鍵是怎麼下指令,不是換工具
與其一直換工具找一款天生道地的,不如換個角度。同一款工具,只要下對指令,產出的繁體中文往往能穩定不少。這件事對任何一款聊天助手都適用,而且比選工具更根本。
以 ChatGPT 為例,設定裡有「自訂指令」這個功能,分成兩個問題讓使用者填寫,一個是希望 ChatGPT 了解使用者的哪些背景,另一個是希望 ChatGPT 用什麼方式回答。這個功能其實很適合拿來處理用詞落差。把它填清楚,例如明確寫上「請一律使用台灣繁體中文回答」,再列出幾個常見的簡體用詞請它避開,像是把「軟件」換成「軟體」、「數據」換成「資料」,並提醒不要套用對岸慣用的語法習慣。設定一次之後,之後每一次對話都會沿用這份偏好,不必每次重新交代。

其他聊天助手也有類似的個人化設定,只是名稱和路徑可能不一樣,有的叫個人化,有的叫已儲存的資訊,實際名稱與設定位置會隨版本更新調整,使用前上該工具的官方說明頁確認一下最準。原則是相通的,把用台灣繁體中文、避開哪些簡體用詞講清楚,任何一款工具穩定產出道地繁體中文的機率都會提高不少。
回到最前面那三位譯者的例子。真正決定稿子道不道地的,從來不是誰的學歷比較高、履歷比較長,而是交稿之後有沒有人願意坐下來,一句一句核對用詞。AI 聊天助手也是同樣的道理,沒有哪一款天生就寫出最道地的繁體中文,道地感終究來自使用的人願不願意花時間核對,以及願不願意把指令下清楚。下次貼上一段 AI 回應之前,不妨把前面那份詞彙對照表存下來,順手核對一次,養成習慣之後,這件事花不了太多時間。
