人工智慧

AI token 是什麼?搞懂中英文差異、計費與記憶上限

把一份自己覺得「應該還好」的提案書貼給 AI,視窗卻跳出一行提示:「內容過長,請縮短後再試」;或者,那個月的 AI 訂閱與 API 費用,比預期高出一截。多數人下意識以為 AI 是照著文字的多寡在計算份量,一份文件字數差不多,AI 吃下去的份量也該差不多,但事實不是這樣。

AI 並不是像人一樣直接「讀」文字,而是先透過一套機制,把輸入拆成一塊塊碎片,再把每個碎片換算成數字去運算,這些碎片就叫做 token。AI token 是什麼,關係到的不只是概念本身。它同時決定 AI 這次要收你多少錢,也決定它還能再讀多少內容。同一段中文,換算出來的 token 數量常常比看起來的字數還多,這正是不少人覺得帳單莫名其妙變貴的關鍵。

先弄懂 AI 怎麼把文字拆成 token、中英文的換算為什麼不一樣,再回頭看它怎麼影響你付的錢與 AI 能記住的份量,前面那種「明明沒寫很多,怎麼就超過了」的疑惑就會有答案。先從 AI 怎麼「看」文字講起。

AI 眼中的文字,其實是一塊塊 Token

AI 處理文字時,實際上手上握的不是一句一句完整的話,而是一塊塊被切開的碎片,也就是 token。token 是 AI 模型處理與產生文字時最小的運算單位,可能是一個完整的單字,也可能只是一個字的一部分(子詞),甚至一個空格、一個標點符號都算一個 token。

這個切碎的動作,是由一套叫做分詞器(Tokenizer)的機制負責。AI 模型不是像人一樣一眼掃過去就懂意思,而是先讓分詞器把輸入的文字切成一段段 token,再把每個 token 對應成一個數字,模型實際運算、預測、生成下一個字的對象,是這些數字,不是文字本身。

換個角度想像會更清楚。一段話就像一整張拼圖,分詞器是負責把整張圖裁成一片片的人。裁完之後,模型手上拿到的只是一片一片的拼圖碎片,它看不到、也不需要看到完整的那張圖,它要做的只是根據拿到的碎片,判斷下一片該接哪一塊。

分詞器先把一段文字切成 token,再把每個 token 換算成數字,模型只拿數字運算
AI 讀文字的順序是文字先切成 token、再換算成數字,模型從頭到尾只對數字運算,不是直接讀懂文字。

先釐清一點,token 不等於一個字,也不完全等於一個單字。常見、簡短的詞常常整個字就是一個 token,但比較長、比較少見的單字,可能要拆成兩、三個 token 才能表達完整,這一點下一節會用實際例子攤開來看。

另外提一句,AI 處理圖片、音訊、影片時,也會先把這些內容換算成 token 才能運算,Google 的 Gemini API 官方文件就說明過這套換算方式,只是那已經是另一個層次的計算,這裡先不展開。

AI 為什麼只看得懂數字,不看得懂文字?

電腦本質上只認得數字,不認得文字本身。分詞器把一段話切成一個個 token 之後,每個 token 都會被指定一個對應的數字代號,模型後續的預測與生成,靠的就是這些數字之間的運算關係。

簡單來說,這個順序是文字先變成 token,token 再變成數字,模型再拿數字去運算。至於模型內部怎麼靠這些數字學會語言、怎麼把每個數字轉換成更複雜的向量表示,是完全另一層的機制,不在這裡展開,先掌握「文字轉 token、token 轉數字」這個順序就夠用。

Token 和字數,為什麼常常對不起來?

很多人以為「一個字就是一個 token」,這個假設其實站不住腳。常見、簡短的字詞,常常整個字就對應一個 token;但比較長、比較少見的單字,可能會被拆成兩、三個 token 才能表達完整。

以 OpenAI 官方公布的實例來看,冰球名將 Wayne Gretzky 那句常被引用的名言「你沒出手的球,100% 都不會進」,換算下來是 11 個 token;篇幅長得多的美國《獨立宣言》,則是 1,695 個 token。抓感覺的話,大約 1 到 2 個句子換算出來接近 30 個 token,一個段落則接近 100 個 token。

常見短詞整塊就是一個 token,較長少見的單字會被拆成兩到三個 token
常見短詞整塊就是 1 個 token,較長、少見的字才會被拆成好幾塊,這就是 token 數常和字數對不上的原因(token 數資料來源:OpenAI)。

同一句話,換一個模型、換一套分詞器,算出來的 token 數也可能不一樣,這不是誰計算錯了,純粹是每家模型切法本來就不同。以 Anthropic 的 Claude 為例,官方文件就提到,較新一代模型換上新的分詞器之後,同一段文字算出來的 token 數,會比舊版模型多出大約三成,這個差距單純來自新舊兩套分詞器切法不同,並不是文字本身變多了。

中文為什麼比英文更耗 Token?

原因出在文字本身的結構。英文單字之間本來就用空格隔開,分詞器容易判斷該從哪裡斷開,常常能切成完整或接近完整的單字;中文的字與字之間沒有空格,加上繁體、簡體的差異,分詞器要判斷「這幾個字該不該合成一組」相對困難得多。實務上,中文內容常常比看起來的字數更快用完 token 額度。

如果是英文,OpenAI 官方提供了幾個可以直接拿來抓感覺的經驗法則:大約 1 個 token 對應 4 個字元,1 個 token 大約對應四分之三個單字,換算下來 100 個 token 大約是 75 個單字,大約 1,500 個單字則對應 2,048 個 token。Anthropic 針對 Claude,也給出類似的估算方式:官方文件寫明,平均下來大約每 3.5 個英文字母就對應 1 個 token。

英文有空格、分詞器好斷詞,token 數較少;中文沒有空格又有繁簡差異,同樣內容更耗 token
中文更耗 token 不是因為字比較多,而是沒有空格、分詞器更難判斷字該不該合成一組(英文經驗法則資料來源:OpenAI、Anthropic)。

中文的部分,目前找不到 OpenAI、Anthropic、Google 這幾家官方文件白紙黑字公布的固定換算比例,只能質化地說,同樣的內容,中文通常比英文更耗 token。真的想要準確數字,與其套一個不知道從哪裡來的公式,不如直接找官方的 tokenizer 工具,拿一小段自己常用的文字實測,結果會準得多。

Token 數量,為什麼決定你要付多少 AI 費用?

主流的國際 AI 供應商,大多採取「用多少算多少」的計價方式。帳單會分成兩類:輸入(Input)token 與輸出(Output)token,而且輸出 token 的單價,通常明顯高於輸入 token,原因是生成一段新內容需要的運算,比單純讀懂輸入的內容複雜得多。

抓一個簡單的公式來理解就好,總花費等於輸入 token 乘以輸入單價,加上輸出 token 乘以輸出單價。也就是說,同一次對話,你問得越長、AI 答得越長,兩邊的 token 數都會往上疊加,最後反映在帳單上。

部分平台還會針對「重複用到的長文本」提供快取(cached)token 折扣。如果你反覆拿同一份長資料去問 AI,例如同一份產品手冊、同一份會議記錄,善用這個機制就能把重複詢問的成本壓低。

一次對話的花費等於輸入 token 乘單價,加上輸出 token 乘單價,輸出單價通常明顯較高
一次對話的總花費,是輸入和輸出兩邊的 token 各自乘上單價再相加,而生成內容的輸出單價通常明顯高於輸入。

Token 數量,為什麼也決定 AI 一次能記住多少內容?

Token 除了決定你要付多少錢,還決定 AI 一次能記住、能處理多少內容。每個模型都有一個以 token 數計算的上限,這個上限是輸入加上輸出合併計算的,一旦超過,AI 就沒辦法再接收新的內容,也沒辦法再產出新的回答。

這也呼應前面提到的中英文差異。同樣篇幅的內容,中文因為更耗 token,常常比英文更快逼近這個上限。同一份文件,換成中文版本貼給 AI,更容易先碰到「裝不下」的狀況,而不是英文版本先超過。

模型的 token 上限由輸入加輸出合併計算,中文比英文更快填滿而裝不下
輸入和輸出共用同一條 token 上限,一旦填滿就裝不下;同一份內容換成中文,更容易先碰到上限。

至於模型內部怎麼決定保留哪些對話、捨棄哪些內容,牽涉到更完整的記憶管理機制,這裡先不展開。眼前只要記得,用掉的不只是額度,還有 AI 這一次能看的份量。

省 Token 的關鍵,不是砍字數,而是砍對地方

知道 token 怎麼算之後,下一步是把它省在對的地方,而不是一味砍字數。幾個具體可行的方向:

  1. 精簡輸入內容再交給 AI:把冗長的背景資料先整理成重點摘要,而不是把整份文件原封不動貼進去。文件裡常有大量跟這次任務無關的段落,原封不動貼上去,等於讓 AI 多花 token 去消化根本用不到的內容。
  2. 明確限制輸出長度:請 AI 用幾點列出重點、設一個字數上限,避免模型自由發揮,寫出比實際需要更長的回答。
  3. 檢視重複使用的內容:重複使用的系統指令或知識庫內容,評估能不能改用摘要,或搭配前面提到的快取機制,減少每一次送進模型的內容量。

不過,省 token 真正該砍的,是贅字、寒暄與不必要的重複背景,不是任務條件、格式要求這類關鍵資訊。資訊被刪過頭,模型理解錯誤、來回重問好幾次,反而更浪費 token,也更浪費時間。

省 token 靠精簡輸入、限制輸出長度、檢視重複內容,但別砍掉任務條件與格式要求
省 token 該砍的是贅字、寒暄和重複背景,任務條件和格式要求這類關鍵資訊要留著,砍過頭反而更浪費。

下次要把一大段文字貼給 AI 之前,不妨換個角度想一想。貼進去的不是「字」,而是一塊塊要被拆解、計價,也會被拿來計算 AI 還記得住多少的 token。想知道自己常用的內容大概要花多少 token,與其憑印象猜,不如直接找官方的 tokenizer 工具,實測一小段最準。

資料來源
  1. What are tokens and how to count them? — OpenAI
  2. Token counting — Anthropic
  3. Glossary — Anthropic
  4. Understand and count tokens — Google