學習中心/術語一次搞懂·11 分鐘

AI 的 token 是什麼?為什麼跟費用有關?

// 一句話回答

在 AI 裡,token(詞元)是 AI 處理文字的最小單位 —— AI 不是一個字一個字讀,而是把文字切成一塊塊 token 來理解與生成。它同時是 AI 的「計費單位」和「記憶長度單位」:用多少 token、能記多少 token,都直接影響成本與效果。

AI 怎麼「讀」文字

人是一個字一個字讀,AI 不是。AI 會先把句子「切成一塊塊」再處理,每一塊就叫一個「token(詞元)」。這個切的動作,技術上叫「分詞」——你不用記這個詞,只要知道「AI 會把文字拆成小塊來讀」就好。

一個 token 可能是一個字、半個詞,或一個標點符號。粗略換算:英文大約每 4 個字元約等於 1 個 token;中文大約 1 個字約等於 1 到 2 個 token(依不同 AI 的分詞方式而異)。所以 token 數跟你直覺的「字數」不會完全一樣。

重要提醒:不同 AI、甚至同一家的不同版本,切法都可能不一樣。所以「這段文字幾個 token」沒有一個放諸四海皆準的答案,要精算就用你實際要用的那個 AI 官方提供的計算工具。

實際感受一下:常見的內容大概多少 token

下面是粗略的量級感,用來建立直覺,不是精確數字。實際會因語言、格式、是否含程式碼而有明顯差異:

  • 一句短問句(約 20 個中文字):大約數十個 token
  • 一封中文 email(約 300 字):大約數百個 token
  • 一份 10 頁的中文報告(約 5,000 字):大約數千到一萬個 token
  • 一份含表格與程式碼的技術文件:同樣字數會更耗 token,因為符號、縮排、標記都要算
  • 一段完整的會議逐字稿(1 小時):常常是數萬個 token 起跳

為什麼 token 跟你的荷包有關(計費)

AI 服務幾乎都「按 token 計費」,而且分成兩種:「輸入 token」(你餵給它的內容,例如你的問題、你貼進去的資料)和「輸出 token」(它回給你的內容)。通常輸出比輸入貴。

所以餵越長的資料、要越長的回答,就用掉越多 token=花越多錢。這也是為什麼「精準給重點、要它講重點」往往比「整包塞給它、讓它長篇大論」更省錢。

具體單價各家不同、也會隨版本調整,這裡不寫死數字,請以你使用的服務官方最新價目為準。你真正要記住的是結構:成本 ≈(輸入量 × 輸入單價)+(輸出量 × 輸出單價)。

看懂帳單:三種常見的 token 名目

打開 AI 服務的用量頁面,通常會看到不只一個數字。它們的意思是:

  • 輸入 token(input):你送進去的所有內容,包含這次的問題、你貼的資料、以及前面整段對話的歷史。這是最容易被低估的一項
  • 輸出 token(output):AI 生成回給你的內容。單價通常最貴
  • 快取相關的 token(cache):如果你反覆用同一大段固定內容(例如同一份公司規範),有些服務支援把它「快取」起來重複使用,讀取快取的單價會明顯便宜。適合固定前綴+變動問題的情境

為什麼多聊幾輪,費用會越來越貴

這是最多人踩到、卻最少人知道的一件事:AI 本身沒有記憶。它之所以記得你前面說過什麼,是因為每問一次,系統就把「整段對話歷史」重新送一次給它。

所以第 1 題可能只送 500 個 token,到第 20 題時,送進去的可能已經是好幾千個 token——即使你這次只打了一句話。對話越長,每一輪的成本就越高。

實務對策很簡單:換主題就開新對話。不要一個聊天視窗從年頭用到年尾。

token 也是「記憶長度」:認識 context window

AI 一次能處理的 token 有上限,這個上限有個名字叫「context window(上下文視窗)」。你可以把它想成 AI 的「短期記憶容量」——它一次能「同時記在腦子裡」的內容有多少。

把對話和檔案不斷塞進去,一旦超過這個視窗的上限,最前面的內容就會被擠掉,或需要被「壓縮」(濃縮成摘要)。視窗越大,代表 AI 一次能讀進、記住越多資料,越適合處理長文件。

視窗滿了會有什麼徵兆? 最典型的是:它開始「忘記」你前面交代過的規則、或前後說法不一致。遇到這種情況,比起繼續糾正它,更有效的是開一個新對話,把真正必要的前提重新講一次。

七個實際有效的省 token 做法

  • 換主題就開新對話:避免無關的歷史一直被重複送進去,這是最省力也最有效的一招
  • 先篩再餵:別把整份 100 頁的檔案丟進去問一個小問題。先挑出相關的那幾頁
  • 明確指定輸出長度:講「請用 5 條、每條一句話」,比放任它自由發揮省很多輸出 token(輸出通常最貴)
  • 重複性的長前綴用快取:如果每次都要附上同一份規範或範例,看看你的服務有沒有提供快取機制
  • 簡單任務用小模型:分類、擷取、格式轉換這類單純工作,不需要動用最強最貴的模型
  • 批次處理:與其一筆一筆問,不如整理成一次問完;也可看看服務有沒有提供離線批次處理的較低費率
  • 設用量上限與告警:在服務後台把預算上限設好。這不會省錢,但能避免出意外時帳單失控

一鍵複製:讓 AI 幫你把長資料壓成重點再用

先用一次便宜的呼叫把長文濃縮,再拿濃縮結果去做真正的分析,整體常常比直接丟原文更省、也更準。

長文壓縮提示詞・一鍵複製

請把下面這份資料壓縮成一份「重點摘要」,供我接下來拿去做進一步分析用。 要求: 1. 只保留和「(在這裡寫你接下來要做的事,例如:判斷這份合約有沒有付款風險)」有關的內容 2. 完整保留所有數字、日期、金額、人名、專有名詞與條款編號,一個都不能改、不能省略 3. 與上述目的無關的敘述、客套話、重複段落,一律刪除 4. 用條列式輸出,每條一句話 5. 如果原文中有任何你不確定或看起來矛盾的地方,另外列一段「需人工確認」標出來 6. 不要加入原文沒有的推論或補充 【資料開始】 (把你的長文貼在這裡) 【資料結束】

⚠️ 另一個同名的「token」:存取憑證

這裡要特別提醒,避免搞混:在「API/登入」的語境裡,token 指的是完全不同的東西——一段用來證明你身分的「存取憑證(access token)」,功能類似一組臨時密碼。

所以看到「API token」「存取 token」時,講的是這個「憑證」,不是 AI 的詞元。它們只是剛好同名。判斷方式很簡單:講 AI 讀多少字、算多少錢,是「詞元」;講登入、身分、金鑰,是「憑證」。

三個常見的誤會

  • 「token 就是字數」:不是。中英混雜、含程式碼或表格時差距很明顯。要精算一定要用官方計算工具
  • 「context window 越大越划算」:不一定。視窗大只是「能塞得下」,塞進去的每個 token 你還是要付費,而且內容太雜有時反而稀釋重點、讓答案變差。夠用就好
  • 「我沒上傳檔案,所以用得很少」:不一定。長對話的歷史累積、以及系統預設加上去的指令,都算輸入 token。真正的用量要看服務後台的數字,不要憑感覺

常見問題

中文和英文哪個比較耗 token?

通常中文每個字換算的 token 會比英文多一些,所以同一段意思,中文往往比英文吃更多 token。實際仍依各家 AI 的分詞方式而定,成本敏感的情境建議實測比較。

怎麼粗估一段文字大概幾個 token?

英文可抓「字數 ÷ 0.75」或「字元數 ÷ 4」;中文可抓「字數 × 1 到 2」。要精確就用該 AI 官方提供的 token 計算工具實際算——尤其在做預算評估時,別只靠粗估。

context window(上下文視窗)越大越好嗎?

大視窗能一次讀更多資料很方便,但塞進越多 token 通常也越貴,有時內容太雜反而稀釋重點。夠用就好,不是越大越划算。

token 和「字數」是一樣的嗎?

不一樣。token 是 AI 的切分單位,跟人類算的「字數」不一定對得起來,尤其在中英混雜或含程式碼時,差距會更明顯。

為什麼我只問了一句話,用量卻很高?

最常見的原因是對話太長。AI 沒有記憶,每問一次都要把整段對話歷史重送一遍,所以第 20 輪的輸入量遠大於第 1 輪。換主題時開新對話,用量會明顯下降。

用網頁版聊天也要算 token 嗎?

訂閱制的網頁版通常是固定月費、不按 token 計價,但仍有使用量限制,背後一樣是 token 在計算。真正按 token 逐筆計費的,是透過 API 串接的用法。兩者的計費方式請以官方最新說明為準。

延伸閱讀

想讓整個團隊真的會用 AI?

我把自己經營公司在用的 AI 實戰,做成企業內訓 —— 帶團隊用真實任務當場做出成果。

看企業 AI 內訓