Heaps' Law · Herdan's Law
新詞
越來越少
一本書讀下去,「沒見過的詞」會迅速變稀有。稀有得有規律,規律到可以寫成一行公式。
縱軸 = 你已經見過幾個「不同的詞」
先分清楚兩種「詞數」。
下面這段話,每個粉紅色的詞是第一次出現,灰色的是之前看過的。往後讀,粉紅色明顯變少。
TOKEN 詞例49總共唸出幾個詞
TYPE 詞型27其中幾種不一樣的詞
TTR = V / N0.55比值,會一直往下掉
同一段話的累積曲線 — 一開始幾乎每步都往上,後面常常原地不動
為什麼會這樣?因為詞頻極度不公平。
少數幾個詞不停重複出現,把版面吃光;剩下幾萬個詞擠在極薄的尾巴裡。
英語裡 the 一個詞就佔掉全部詞例的 6% 上下
你翻開新的一頁,大機率又是 the、of、and。要撞到全新的詞,得等到那條又薄又長的尾巴。
整條規律,就這一行。
β 小於 1,所以曲線一定會彎。β 就是「彎的程度」。
把 β 轉轉看。
β = 1 是虛線那條直線:每個詞都是新的。往下拉,曲線就彎,新詞就開始變稀有。
5 萬讀完 100 萬詞後,認識的詞型數
25 個在第 100 萬詞附近,每讀 1000 個詞才冒出的新詞
K 固定在 50。這條公式只在 N 夠大時才準 — 讀前十個詞的時候它會胡說八道。
知道了以後,有三件事會變。
- 01
不要直接比較 TTR。長文本的 TTR 天生就低。拿 500 字的作文跟 5000 字的論文比「詞彙豐富度」,量到的其實是長度。要比就先切成等長的片段。
- 02
語料庫永遠收不完。V 沒有上限,再加一億字還是會冒出新詞 — 新造詞、錯字、專有名詞、火星文。詞表「做完了」是錯覺。
- 03
可以先估算再動手。知道 K 跟 β,就能預測索引要多大、標注要花多少人力、字典大概會膨脹到哪。Heaps 當年正是為了資訊檢索寫下它的。
同一條定律,有兩個名字:
語言學家先寫下了它,資訊檢索的人又寫了一次。