中文 Tokenization 公平性探索器
Chinese Tokenization Fairness Explorer
同樣語義的內容,寫成台灣繁體、中國簡體、香港繁體三種變體後, 被現代 LLM 的 BPE tokenizer 切分出的 token 數可能不同。 這意味著相同的 API 費用、不同語言變體拿到的 context window 也不同, 這種隱性差異也算是某種「方言稅 / variant tax」。
ⓘ HK 變體採「香港書面中文」(傳統字 + 港式詞彙如「的士/薯仔」), 不混入粵語書面化(如「我哋/冇/畀」),以聚焦詞彙差異。