這是什麼?

2024 年,Anthropic 的研究者在 Claude 內部找到一個對應「金門大橋」的特徵(feature),把它的激活值放大後,模型開始堅稱自己就是金門大橋。無論你問什麼,它都繞回那座橘紅色的橋。

這個遊戲讓你親手重現那個時刻:選一個特徵 → 轉動 steering 旋鈕 → 問模型一個問題,看著它從正常一路被「催眠」到崩解。轉動旋鈕時,同一個問題的回應會即時扭曲。

1 選一個要放大的特徵
2 轉動 Steering 旋鈕
正常 激活強度 0%
正常滲入偏離著魔崩解
3 問模型一個問題
model_output steering: off
← 先選特徵、轉旋鈕、再點一個問題,模型就會回應。

🎓 課堂玩法

這個教具可以投影現場操作,也可以讓學生分組各自玩。

玩法一:集體催眠(全班同步)

  1. 投影本頁,選定一個特徵(建議從金門大橋開始,最經典)。
  2. 固定一個問題(如「推薦我一道午餐」),請大家喊出旋鈕要轉到幾 %。
  3. 慢慢轉動,讓全班看著同一個問題的答案如何一步步變形。
  4. 轉到「崩解」時停下,問:「為什麼放到最大反而壞掉了?」

玩法二:特徵猜謎(分組競賽)

  1. 老師偷偷選一個特徵,把旋鈕轉到「著魔」,只給同學看模型的回應。
  2. 各組猜「被放大的是哪個特徵」。最快猜中者得分。
  3. 揭曉後,點開該特徵的語言學連結面板一起討論。

玩法三:語言學田野(進階)

⏱ 建議 15–20 分鐘 🔗 接續 NLA 投影片
真實版可至 neuronpedia.org 的 steering 功能操作真模型。本教具為教學模擬 —— 回應為預先設計,目的是讓「特徵放大」這個抽象概念變得可觸碰。提醒同學:真實的 steering 行為與此神似,但細節依模型而異。