LING5006 · 大型語言模型的語言學基礎W04 · 10/01
第四週講義 · 模組 01 單位、表徵與兩種語言觀
向量表徵
從分類器到詞向量 — 理解 LLM 的第二步
Vector representations: from classifiers to word embeddings
本週的語言學問題
分布假說能撐起多少語意?剩下的部分會是誰在扛?
一個 LLM 是怎麼學文字接龍 (吐出下一個詞) 的?
把流程拆成六步。深色框是我們這週要打開的黑盒子。
輸入文字「我今天想吃」
W03切成詞元我|今天|想|吃
本週 · 第三部查表變向量每個詞元一排數字
W05Transformer 層詞與詞互相參考
本週 · 第二部softmax換成機率分布
輸出「火鍋」P = 0.14
整條流程在做的,基本上是分類工作:看完前文,從詞彙表裡挑出下一個詞。而模型怎麼「學會」挑,靠的是第二部的損失函數與梯度下降。
四部分
01
機器學習與文本分類1-1 從例子學 · 1-2 文本分類 · 1-3 貝氏 · 1-4 評估與代價
零件:「預測下一個詞」本身就是分類
02
統計基礎與邏輯迴歸2-1 機率工具箱 · 2-2 向量與內積 · 2-3 邏輯迴歸 · 2-4 sigmoid 與 softmax · 2-5 損失 · 2-6 梯度下降 · 2-7 神經網路
零件:神經元、softmax、訓練目標
03
詞嵌入3-1 詞義的面向 · 3-2 分布假說 · 3-3 詞–脈絡矩陣與餘弦 · 3-4 word2vec · 3-5 嵌入空間
零件:詞元→向量的那張表
04
語言學反思4-1 靜態嵌入的極限 · 4-2 分布語意學的地位 · 4-3 討論、閱讀與作業
零件:判斷 LLM「懂不懂」的工具
每頁固定三種記號:
ELI5用生活例子講數學
→ 通往 LLM這頁在大模型裡的位置
動手試試一題就好
教材依據:Jurafsky & Martin, Speech and Language Processing 3rd ed. draft(2025 年 8 月版投影片)0-1
LING5006 · W04 向量表徵 · 導覽0-2
導覽 · 隨時翻回來查
符號小抄:本週會遇到的 14 個記號
A cheat sheet for the notation
公式只是把一句話寫短寫精準。每個符號都能翻成一句白話,看不懂時,先查這張表。
符號讀作白話見頁
x輸入/特徵描述一份文件的一排數字,例如「正面詞出現 3 次」2-3
y、ŷy、y-hat正確答案;戴帽子的是模型猜的答案1-1
w權重 weight每個特徵「講話多大聲」;正的支持、負的反對2-3
b偏差項 bias還沒看任何證據前,本來就有的傾向2-3
Σsigma,加總把一串東西全部加起來2-3
w·x內積 dot product對應位置相乘,再全部加起來;衡量兩排數字多「同調」2-2
σ(z)sigmoid把任何數字壓進 0 到 1 之間的函式2-4
e自然常數約等於 2.718 的一個數;e 的任何次方都是正數2-1
log對數把乘法變加法;機率越小,log 越負2-1
P(A|B)條件機率已知 B 發生了的世界裡,A 的機率1-3
L損失 loss模型錯得多離譜;越小越好2-5
∂L/∂w偏微分/梯度把 w 動一點點,損失會變多少、往哪邊變2-6
ηeta,學習率每次調整權重時,步伐跨多大2-6
cos θ餘弦兩支箭頭的方向有多一致:1 同向、0 垂直、−1 相反3-3
讀任何公式的三個問題
①輸入是什麼?(通常是 x,一份文件或一個詞)
②哪些是要「學」的?(通常是 w、b — 訓練前不知道,訓練後才定下來)
③輸出落在什麼範圍?(任意數字?0 到 1 的機率?一整排加起來等於 1 的分布?)
符號依 SLP3 慣例;「內積」即英文 dot product0-2