Heaps' Law · Herdan's Law

新詞
越來越少

一本書讀下去,「沒見過的詞」會迅速變稀有。稀有得有規律,規律到可以寫成一行公式。

每個詞都沒重複的話 ↗ 讀得越多 → 真實的文本 0 字 100 萬字
縱軸 = 你已經見過幾個「不同的詞」

先分清楚兩種「詞數」。

下面這段話,每個粉紅色的詞是第一次出現,灰色的是之前看過的。往後讀,粉紅色明顯變少。

TOKEN 詞例49總共唸出幾個詞
TYPE 詞型27其中幾種不一樣的詞
TTR = V / N0.55比值,會一直往下掉
同一段話的累積曲線 — 一開始幾乎每步都往上,後面常常原地不動

為什麼會這樣?因為詞頻極度不公平。

少數幾個詞不停重複出現,把版面吃光;剩下幾萬個詞擠在極薄的尾巴裡。

the of and to …剩下的五萬個詞在這裡 一半的詞型,整本書只出現過一次
英語裡 the 一個詞就佔掉全部詞例的 6% 上下

你翻開新的一頁,大機率又是 the、of、and。要撞到全新的詞,得等到那條又薄又長的尾巴。

整條規律,就這一行。

V = K · Nβ
V 詞型數 N 詞例數 K 常數 · 約 10–100 β 約 0.4 – 0.6

β 小於 1,所以曲線一定會彎。β 就是「彎的程度」。

把 β 轉轉看。

β = 1 是虛線那條直線:每個詞都是新的。往下拉,曲線就彎,新詞就開始變稀有。

0.50

5 萬讀完 100 萬詞後,認識的詞型數

25 個在第 100 萬詞附近,每讀 1000 個詞才冒出的新詞

K 固定在 50。這條公式只在 N 夠大時才準 — 讀前十個詞的時候它會胡說八道。

知道了以後,有三件事會變。

同一條定律,有兩個名字:
語言學家先寫下了它,資訊檢索的人又寫了一次。