生成式 AI 的人文導論 · Spring 2026 · Lab Session 6b|老師上課示範教材
ElevenLabs:AI 聲音合成平台
Text-to-Speech · Voice Cloning · Speech-to-Speech
🌐 elevenlabs.io
🎙 免費帳號即可示範
⏱ Demo 約 15 min
👁 教師示範用,學生觀看
01
ElevenLabs 是什麼?
ElevenLabs(2022 年創立)是目前聲音逼真度最高的 AI 語音合成平台,提供三大核心功能:
Text to Speech
輸入文字,選擇音色,即時合成自然語音。支援 70+ 語言。
Voice Cloning
上傳 1 分鐘錄音,複製任意人聲的音色與語氣。
Speech to Speech
把你的聲音即時轉換成另一個音色,並保留情緒和韻律。
活字印刷 → 鉛字排版 → AI 語音合成。活字印刷讓文字複製民主化;錄音讓聲音跨越時間;ElevenLabs 讓任何人都能「擁有」任何聲音。這是解放,也是危機。這是我們今天的人文倫理重點議題。
免費方案有什麼?(僅供參考,隨時可能調整功能或額度)
| 功能 | 免費(Free) | Starter 付費 |
| 每月字元額度 | 10,000 字元 / 月 | 30,000+ |
| Text to Speech | ✓ | ✓ |
| 聲音庫(Voice Library) | ✓ 有限 | ✓ 完整 |
| Voice Cloning(即時) | ✓ 1 個 | ✓ 多個 |
| 商業授權 | ✗ | ✓ |
課堂示範用免費帳號即可覆蓋所有功能。
02
介面快速導覽
登入後,左側側欄是功能入口。示範時建議依下列順序走:
左側側欄功能對應
Text to Speech輸入文字 → 選音色 → 合成 → 播放 / 下載。最直觀,作為開場。
Voice Library瀏覽社群上傳的音色。可以按語言篩選,找到中文、臺語、日語音色。
Voices → Add上傳錄音進行 Voice Cloning。這是最具衝擊感的功能,留作高潮。
Speech to Speech(選做)把你的聲音即時轉換為另一音色。課堂用麥克風即可。
示範建議
先把瀏覽器視窗放大到全螢幕,在 Text to Speech 頁面多停幾秒讓大家看清楚介面佈局,再依功能說明操作。
DEMO A
Text to Speech:文字變聲音
前往 Text to Speech
左側選單點「Text to Speech」。
選擇音色
點右側「Voice」下拉選單。建議先選一個英文音色(如 Rachel),聽聽品質;再換成中文音色(在 Voice Library 添加一個「Mandarin」標籤的音色)做對比。
輸入示範文本,並調整參數
把下方文字貼入輸入框,看到「穩定度」(Stability)與「相似度」(Similarity)兩個滑桿。可以現場調高調低,聽聽差異。
點「Generate」,播放
播放完可按「下載」鈕,存成 mp3 — 這就是我們若需要旁白或有聲書的工作流程。
示範文本(繁體中文)
「歷史從不只是文字。它也是聲音——那些已消逝的聲音:說書人的嗓音、母親的呢喃、戰場上最後的呼喊。
今天,人工智慧讓我們能夠重新聽見那些聲音。這是奇蹟,也是責任。」
接著換一段臺語感的漢字文本,觀察合成品質
「逐家來聽,今仔日阮要講的代誌,是關於咱台灣人的故事。」
(觀察重點:AI 能否正確處理漢字臺語?它會當成普通話讀嗎?這是一個很好的引出語料代表性問題的時機。)
DEMO B
Voice Library:聲音也有圖書館
進入 Voices → Voice Library
這裡是社群上傳的音色庫,任何人都可以把自己的聲音「發布」出來讓他人使用。
按 Language 篩選「Chinese」
讓大家看看有哪些中文音色。點進幾個試聽,注意每個音色的「使用次數」,有些已被數十萬次呼叫。
點「Add to My Voices」
就可以在自己的 Text to Speech 中使用。概念類比:下載字體。
課堂提問
「如果有人把你朋友的聲音上傳到這裡——這合法嗎?這道德嗎?
聲音是一種個人資料嗎?」
DEMO C
Voice Cloning:複製一個人的聲音
示範建議
建議上傳自己的聲音作為示範素材(事先錄製一段約 60 秒的清晰音檔),避免使用他人聲音引發倫理爭議,也避免讓大家對「可以複製別人聲音」產生錯誤示範印象。
進入 Voices → Add a new voice → Instant Voice Cloning
選「Instant Voice Cloning」(免費版支援)。
上傳事先準備的錄音檔
建議 60 秒以上的安靜環境錄音,效果最佳。ElevenLabs 建議:無背景音樂、無回音、單人說話。
回到 Text to Speech,選剛才輔助的音色輸入一段平常不會說的話(如一首詩、一段古文),生成並播放。
建議的複製示範文本(讓學生感受「陌生感」)
「大江東去,浪淘盡,千古風流人物。
故壘西邊,人道是,三國周郎赤壁。」
(用自己的聲音說蘇軾的詞。這個落差本身就是很好的討論起點:「誰的聲音?誰的文字?AI 扮演了什麼角色?」)
批判視角
用得到,想得透
ElevenLabs 的功能強大到讓人著迷,但作為人文研究者,我們需要同時看見技術的另一面。
三個核心問題
問題一:聲音作為身份(Identity)
聲紋如同指紋,是高度個人化的生物特徵。當任何人都能用 1 分鐘錄音複製你的聲音,「聲音」還算是你的嗎?現行法律(包括台灣)幾乎沒有針對 AI 聲音複製的保護。
問題二:Deepfake 與詐騙
2024 年香港一起案例:詐騙集團用 deepfake 語音和影像,冒充公司高管,騙走 2 億港幣。台灣的電話詐騙若整合 ElevenLabs 等工具,危害難以估量。技術民主化的反面,是風險的民主化。
問題三:文化代表性與語料政治
Voice Library 的中文音色大多是普通話,臺語、客語、原住民語幾乎缺席。當「好聽的 AI 聲音」等於「標準腔」,誰的聲音被消音了?
研究應用(正向)
- 口述歷史重現:把採集到的老一輩敘事,製作成高品質的有聲書或典藏素材。
- 無障礙服務:把學術論文或文學作品轉為有聲版,服務視障讀者。
- 瀕危語言保存:在語者健在時採集,複製音色以留存語音樣本(需倫理同意)。
- 多語言教材:為缺乏錄音師的小語種教材製作示範語音。
Whisper 把聲音變成文字,ElevenLabs 把文字變回聲音。
這個迴圈閉合的那一刻,語言的邊界悄悄移動了。
總結
今日示範重點一覽
| 功能 | 做了什麼 | 關鍵觀察 |
| Text to Speech | 文字 → 自然語音 | 穩定度、相似度滑桿 vs. 聲音品質 |
| Voice Library | 瀏覽 / 添加社群音色 | 中文音色稀缺、臺語幾乎不存在 |
| Voice Cloning | 60 秒錄音 → 複製音色 | 古文朗讀的陌生感 → 觸發身份討論 |
| 批判視角 | — | 身份、詐騙、文化代表性 |
課堂延伸
請大家課後可以用免費帳號自行把 Whisper 逐字稿文本,丟進 ElevenLabs 聽聽看,完成「語音 → 文字(Whisper)→ 語音(ElevenLabs)」的完整迴圈,具體體驗 cascade pipeline 的概念。