生成式 AI 的人文導論 · Spring 2026 · Week 12|正課教材
ElevenLabs 完整教學
From Sign-up to Voice Clone · 給「蒸餾人」加上聲音
🌐 elevenlabs.io
🎙 免費帳號可完成所有示範
⏱ 老師課堂示範 + 學生課後自學
📍 Week 12 多模態整合
01
為什麼數位分身需要聲音?
上週的「蒸餾人」作業中,我們把自己的人格寫進 SOUL.md,但 agent 仍然是文字的存在。我們可以補上聲音這一塊,讓你的數位分身具有可聽見的存在。
文字 → 影像 → 聲音。三種媒介中,聲音是最後一道指紋,它比文字更難偽造,比影像更個人。一個會打字的 AI 和一個用你的聲音說話的 AI,心理上是完全不同的存在。這也是為什麼語音 deepfake 比文字偽造更具倫理張力。
ElevenLabs 是什麼?
ElevenLabs(2022 年創立)是目前聲音逼真度最高的 AI 語音合成平台,三大核心功能:
Text to Speech
輸入文字、選擇音色,即時合成自然語音。支援 70+ 語言。
Voice Cloning
上傳 1 分鐘錄音,複製任意人聲的音色與語氣。
Speech to Speech
把你的聲音即時轉換成另一個音色,並保留情緒和韻律。
02
方案比較:先了解你能用什麼
本課程示範與作業免費方案完全足夠。下方表格僅供參考(規格與額度可能隨平台政策調整):
| 功能 | Free(推薦) | Starter $5/月 | Creator $22/月 |
| 每月字元額度 | 10,000 字元 | 30,000 字元 | 100,000 字元 |
| 對應語音長度 | 約 10–12 分鐘 | 約 30 分鐘 | 約 1–1.5 小時 |
| Instant Voice Cloning(即時複製) | ✓ 1 個 | ✓ 無限 | ✓ 無限 |
| Professional Voice Clone(高保真) | ✗ | ✗ | ✓ 需 30+ 分鐘音檔 |
| 商業使用權 | ✗ | ✓ | ✓ |
| API 存取 | ✓ 有限額 | ✓ | ✓ |
課程建議
免費方案的 1 個 instant voice clone 足以完成本週作業與期末專案的語音整合。不需要付費。用完額度的話,下個月會自動 reset。
DEMO A
Text to Speech:文字變聲音
第一個示範的是最基礎也最直觀的功能。建議用瀏覽器全螢幕讓大家看清楚介面佈局。
介面導覽
Text to Speech左側選單第一項,主要工作區。
Voice右上下拉選單,選擇音色(預設有幾個英文 voice 可用)。
Stability / Similarity兩個滑桿——控制聲音的穩定度與相似度。現場調看看差異。
Generate右下按鈕,按下產生語音,幾秒鐘內完成。
示範文本(繁體中文)
「歷史從不只是文字。它也是聲音——那些已消逝的聲音:說書人的嗓音、母親的呢喃、戰場上最後的呼喊。
今天,人工智慧讓我們能夠重新聽見那些聲音。這是奇蹟,也是責任。」
接著用一段帶臺語感的漢字文本
「逐家來聽,今仔日阮要講的代誌,是關於咱台灣人的故事。」
觀察重點:AI 能否正確處理漢字臺語?它會當成普通話讀嗎?這是引出「語料代表性」議題的好時機。
DEMO B
Voice Library:聲音也有圖書館
社群上傳的音色庫,任何人都可以把自己的聲音「發布」出來讓他人使用。
進入 Voices → Voice Library
左側選單第二層。注意每個音色的使用次數——有些已被數十萬次呼叫。
用 Language 篩選「Chinese」或「Japanese」
看看哪些音色適合課程目的。試聽幾個,注意品質差異。
點「Add to My Voices」
添加後就能在 Text to Speech 中使用。概念類比:下載字體。
課堂提問
「如果有人把你朋友的聲音上傳到這裡:這合法嗎?這道德嗎?聲音是一種個人資料嗎?」
(下週我們有機會可以討論 AI 聲音合成倫理的議題。)
DEMO C
Voice Cloning:複製一個人的聲音
本次示範的最具衝擊感的功能。
示範倫理
建議上傳自己的聲音作為示範素材(事先錄製約 60 秒的清晰音檔)。避免使用他人聲音引發倫理爭議,也避免讓同學對「可以隨意複製別人聲音」產生錯誤示範印象。
進入 Voices → Add a new voice → Instant Voice Cloning
選 Instant Voice Cloning(免費版支援)。Professional Voice Clone 是付費功能,本次不示範。
上傳事先準備的錄音檔
建議 60 秒以上的安靜環境錄音。要求:無背景音樂、無回音、單人說話、咬字清晰。
命名音色,勾選同意聲明,點「Save」
幾秒內完成。clone 後可在 Voice Library 個人區找到。
回到 Text to Speech,選剛建立的音色
輸入一段平常不會說的話,生成並播放。感受「我的聲音說了我沒說過的話」。
建議的複製示範文本(讓學生感受「陌生感」)
「大江東去,浪淘盡,千古風流人物。
故壘西邊,人道是,三國周郎赤壁。」
用自己的聲音說蘇軾的詞。這個落差本身就是討論起點:「誰的聲音?誰的文字?AI 扮演了什麼角色?」
學生自學
有興趣的同學自己 clone 一個 voice
看完課堂示範後,有興趣的同學可以在課後依照以下六個步驟,自己建立第一個 voice clone。整個過程約 15 分鐘。
六步驟:從註冊到第一個 voice clone
註冊 ElevenLabs 帳號
前往 elevenlabs.io → 右上 Sign Up → 用 Google 帳號註冊最快。免費方案不需信用卡。
準備音檔(1–3 分鐘)
用手機或錄音軟體錄製乾淨的音檔。內容可以是朗讀新聞、自我介紹、念一段你喜歡的文章。避免回音、背景噪音、咳嗽聲。
進入 Voices → My Voices → Add a New Voice
點 Instant Voice Cloning(IVC)。Professional Voice Cloning 是付費功能,本次不選。
上傳音檔,命名你的 voice
給 voice 取個名字(例如「我的聲音」),勾選同意聲明,點 Add Voice。幾秒內完成。
到 Text to Speech 測試
選剛建立的 voice,輸入文字,選 eleven_multilingual_v2 模型(中文必選),點 Generate。聽聽你的聲音說新的話。
滿意後可下載 MP3,或取得 API key
到 Profile → API Keys 取得 API key(用於程式整合)。API key 像密碼一樣要保護好。
自學提醒
免費帳號 10,000 字元/月足夠玩很久。一句中文約 6–10 字元。試錄個 50 次都還有額度。不用怕用光。
07
程式整合:把 ElevenLabs 接到你的數位分身
有了 API key 後,15 行 Python 就能把 ElevenLabs 接到你的 SOUL.md + Gemini。下面是完整管線示意:
數位分身的多模態管線
人格(你寫的) → 思考(LLM 生成)→ 聲音(你的 voice clone)
最小可行整合:15 行 Python
PYTHON minimal_twin.py
import google.generativeai as genai
from elevenlabs import generate, play, save
import os
# 1. 讀取你的 SOUL.md 作為人格
with open("SOUL.md") as f:
soul = f.read()
# 2. 呼叫 Gemini 生成回應(用 SOUL.md 當人格設定)
genai.configure(api_key=os.environ["GEMINI_API_KEY"])
model = genai.GenerativeModel("gemini-2.5-flash", system_instruction=soul)
response = model.generate_content("你怎麼看蒸餾人這個概念?")
# 3. 用你 clone 的 voice 念出 Gemini 的回應
audio = generate(
text=response.text,
voice="YOUR_VOICE_ID", # 你 clone 完的 voice id
model="eleven_multilingual_v2" # 支援中文
)
save(audio, "reply.mp3")
play(audio)
免費額度提醒
每呼叫一次大約用掉 100–500 字元。Free 帳號每月 10,000 字元 → 約 20–100 次呼叫。用於本週作業足夠,但避免在迴圈裡瘋狂呼叫。
批判視角
人文反思
ElevenLabs 的功能強大到讓人著迷,但作為人文研究者,我們必須同時看見技術的另一面。
問題一:聲音作為身份
聲紋如同指紋,是高度個人化的生物特徵。當任何人都能用 1 分鐘錄音複製你的聲音,「聲音」還算是你的嗎?現行法律(包括台灣)幾乎沒有針對 AI 聲音複製的保護。
問題二:Deepfake 與詐騙
2024 年香港案例:詐騙集團用 deepfake 語音和影像,冒充公司高管,騙走 2 億港幣。台灣的電話詐騙若整合 ElevenLabs 等工具,危害難以估量。技術民主化的反面,是風險的民主化。
問題三:文化代表性與語料政治
Voice Library 的中文音色大多是普通話,臺語、客語、原住民語幾乎缺席。當「好聽的 AI 聲音」等於「標準腔」,誰的聲音被消音了?
研究應用(正向)
- 口述歷史重現:把採集到的老一輩敘事,製作成高品質的有聲書或典藏素材。
- 無障礙服務:把學術論文或文學作品轉為有聲版,服務視障讀者。
- 瀕危語言保存:在語者健在時採集,複製音色以留存語音樣本(需倫理同意)。
- 多語言教材:為缺乏錄音師的小語種教材製作示範語音。
當聲音是「我」、邏輯是 SOUL.md 蒸餾出的「我」、內容是 LLM 即時生成 - 那麼這個「我」究竟是誰?
這不是技術問題,是哲學問題。
摘要
本週示範與自學路徑回顧
| 區段 | 內容 | 對象 |
| DEMO A | Text to Speech 文字變聲音 | 老師示範,同學觀察 |
| DEMO B | Voice Library 社群音色 | 老師示範,引出倫理討論 |
| DEMO C | Voice Cloning 複製自己聲音 | 老師示範(用自己的聲音) |
| 自學路徑 | 六步驟自建 voice clone | 有興趣的同學課後自學 |
| 程式整合 | SOUL.md + Gemini + ElevenLabs | 期末專案選做加分 |
| 批判視角 | 身份、詐騙、文化代表性 | 全班共同討論 |
期末專案中的角色
ElevenLabs 整合不是期末專案的必做項目,但是加分亮點。期末核心仍是 Stage 1(一頁式語言學習小卡 + Gemini API + 部署)。有餘力的同學可以把 ElevenLabs 接上,做出「用自己的聲音念例句」的效果。