想像一下,你剛教出一個記憶力超群的學生,他背下了整座圖書館的書,也能模仿老師寫出漂亮的作文。但這時他還有一個致命缺點:
他不知道什麼叫「好」,什麼叫「對」,他只是在玩機率遊戲。
為了讓這個「書呆子」變成一個真正懂人心、有底線的智慧助手,我們需要進入後訓練的核心階段——強化學習 (Reinforcement Learning)。
本區塊透過廚藝訓練的生動比喻,帶您快速理解 LLM 訓練的三個關鍵階段。點擊下方標籤切換階段,觀察 AI 是如何一步步晉升的。
在圖書館讀了幾萬本食譜。他知道「糖」後面通常接「醋」,知道各種食材的關聯性。
師傅示範做了一百道菜,他照著模仿。他學會了基本動作,能寫出像樣的回答了。
這就是 美食評論家登場 的時刻。他做出一道菜,評論家不給正確答案,只給「分數」或「好壞排序」。他開始學會察言觀色、通曉人情世故。
要跑通這套流程,我們需要三樣東西在「實驗室」裡不斷運作。點擊下方卡片深入了解各個角色的任務。
這就是我們要訓練的目標模型。
它的最終目標是:賺取最高的分數。
它會針對同一個問題,嘗試給出不同的回答,像是一個不斷嘗試新食譜的廚師。
RL 階段最酷的地方:訓練另一個小模型當裁判。
怎麼訓練裁判? 我們讓人類標註員看兩個 AI 的回答 (A 和 B),問標註員:「你覺得哪個比較好?」
裁判學會了人類的口味(偏好)。它雖然不會寫文章,但它非常擅長打分數。
通常是 PPO 演算法或最新的 DPO。
教練會根據裁判給的分數,回過頭來告訴學生:
「你剛才那句開場白拿了 90 分,以後多用這種語氣!」 或 「那個回答太囉唆了,減分!」
這裡模擬了 RLHF (人類回饋強化學習) 的實際運作流程。點擊「下一步」來觀察模型如何透過評價自我進化。
為什麼不能只靠 SFT(模仿老師)就好?透過下方雷達圖,看看加入 RL 後,AI 能力的多維度提升。
SFT 只是模仿人類寫作。但 RL 能讓模型在千萬次的嘗試中,發現連人類都沒想到的、更優雅的表達方式。
我們可以特別訓練裁判對「胡說八道」扣重分。AI 慢慢就會學會:「不知道就說不知道,否則會被扣分。」
這是 AI 安全的守護神。如果 AI 給出了危險建議(如製造毒藥),裁判會給予極低分,讓 AI 徹底學會「這條路不能走」。
透過強化學習,LLM 不再只是冷冰冰的文字預測器,它學會了什麼是幽默、什麼是冒犯、以及如何在複雜的人類對話中,找到那條最體貼、最精準的對話路徑。