2024 年,Anthropic 的研究者在 Claude 內部找到一個對應「金門大橋」的特徵(feature),把它的激活值放大後,模型開始堅稱自己就是金門大橋。無論你問什麼,它都繞回那座橘紅色的橋。
這個遊戲讓你親手重現那個時刻:選一個特徵 → 轉動 steering 旋鈕 → 問模型一個問題,看著它從正常一路被「催眠」到崩解。轉動旋鈕時,同一個問題的回應會即時扭曲。
這個教具可以投影現場操作,也可以讓學生分組各自玩。
真實版可至 neuronpedia.org 的 steering 功能操作真模型。本教具為教學模擬 —— 回應為預先設計,目的是讓「特徵放大」這個抽象概念變得可觸碰。提醒同學:真實的 steering 行為與此神似,但細節依模型而異。