01

ElevenLabs 是什麼?

ElevenLabs(2022 年創立)是目前聲音逼真度最高的 AI 語音合成平台,提供三大核心功能:

Text to Speech

輸入文字,選擇音色,即時合成自然語音。支援 70+ 語言。

Voice Cloning

上傳 1 分鐘錄音,複製任意人聲的音色與語氣。

Speech to Speech

把你的聲音即時轉換成另一個音色,並保留情緒和韻律。

活字印刷 → 鉛字排版 → AI 語音合成。活字印刷讓文字複製民主化;錄音讓聲音跨越時間;ElevenLabs 讓任何人都能「擁有」任何聲音。這是解放,也是危機。這是我們今天的人文倫理重點議題。

免費方案有什麼?(僅供參考,隨時可能調整功能或額度)

功能免費(Free)Starter 付費
每月字元額度10,000 字元 / 月30,000+
Text to Speech✓✓
聲音庫(Voice Library)✓ 有限✓ 完整
Voice Cloning(即時)✓ 1 個✓ 多個
商業授權✓

課堂示範用免費帳號即可覆蓋所有功能。

02

介面快速導覽

登入後,左側側欄是功能入口。示範時建議依下列順序走:

左側側欄功能對應
Text to Speech輸入文字 → 選音色 → 合成 → 播放 / 下載。最直觀,作為開場。
Voice Library瀏覽社群上傳的音色。可以按語言篩選,找到中文、臺語、日語音色。
Voices → Add上傳錄音進行 Voice Cloning。這是最具衝擊感的功能,留作高潮。
Speech to Speech(選做)把你的聲音即時轉換為另一音色。課堂用麥克風即可。
示範建議 先把瀏覽器視窗放大到全螢幕,在 Text to Speech 頁面多停幾秒讓大家看清楚介面佈局,再依功能說明操作。
DEMO A

Text to Speech:文字變聲音

前往 Text to Speech

左側選單點「Text to Speech」。

選擇音色

點右側「Voice」下拉選單。建議先選一個英文音色(如 Rachel),聽聽品質;再換成中文音色(在 Voice Library 添加一個「Mandarin」標籤的音色)做對比。

輸入示範文本,並調整參數

把下方文字貼入輸入框,看到「穩定度」(Stability)與「相似度」(Similarity)兩個滑桿。可以現場調高調低,聽聽差異。

點「Generate」,播放

播放完可按「下載」鈕,存成 mp3 — 這就是我們若需要旁白或有聲書的工作流程。

示範文本(繁體中文)

「歷史從不只是文字。它也是聲音——那些已消逝的聲音:說書人的嗓音、母親的呢喃、戰場上最後的呼喊。
今天,人工智慧讓我們能夠重新聽見那些聲音。這是奇蹟,也是責任。」

接著換一段臺語感的漢字文本,觀察合成品質

「逐家來聽,今仔日阮要講的代誌,是關於咱台灣人的故事。」

(觀察重點:AI 能否正確處理漢字臺語?它會當成普通話讀嗎?這是一個很好的引出語料代表性問題的時機。)

DEMO B

Voice Library:聲音也有圖書館

進入 Voices → Voice Library

這裡是社群上傳的音色庫,任何人都可以把自己的聲音「發布」出來讓他人使用。

按 Language 篩選「Chinese」

讓大家看看有哪些中文音色。點進幾個試聽,注意每個音色的「使用次數」,有些已被數十萬次呼叫。

點「Add to My Voices」

就可以在自己的 Text to Speech 中使用。概念類比:下載字體。

課堂提問

「如果有人把你朋友的聲音上傳到這裡——這合法嗎?這道德嗎?
聲音是一種個人資料嗎?」

DEMO C

Voice Cloning:複製一個人的聲音

示範建議 建議上傳自己的聲音作為示範素材(事先錄製一段約 60 秒的清晰音檔),避免使用他人聲音引發倫理爭議,也避免讓大家對「可以複製別人聲音」產生錯誤示範印象。
進入 Voices → Add a new voice → Instant Voice Cloning

選「Instant Voice Cloning」(免費版支援)。

上傳事先準備的錄音檔

建議 60 秒以上的安靜環境錄音,效果最佳。ElevenLabs 建議:無背景音樂、無回音、單人說話。

命名音色,點「Save」

等待幾秒,複製完成。

回到 Text to Speech,選剛才輔助的音色

輸入一段平常不會說的話(如一首詩、一段古文),生成並播放。

建議的複製示範文本(讓學生感受「陌生感」)

「大江東去,浪淘盡,千古風流人物。
故壘西邊,人道是,三國周郎赤壁。」

(用自己的聲音說蘇軾的詞。這個落差本身就是很好的討論起點:「誰的聲音?誰的文字?AI 扮演了什麼角色?」)

批判視角

用得到,想得透

ElevenLabs 的功能強大到讓人著迷,但作為人文研究者,我們需要同時看見技術的另一面。

三個核心問題

問題一:聲音作為身份(Identity)

聲紋如同指紋,是高度個人化的生物特徵。當任何人都能用 1 分鐘錄音複製你的聲音,「聲音」還算是你的嗎?現行法律(包括台灣)幾乎沒有針對 AI 聲音複製的保護。

問題二:Deepfake 與詐騙

2024 年香港一起案例:詐騙集團用 deepfake 語音和影像,冒充公司高管,騙走 2 億港幣。台灣的電話詐騙若整合 ElevenLabs 等工具,危害難以估量。技術民主化的反面,是風險的民主化。

問題三:文化代表性與語料政治

Voice Library 的中文音色大多是普通話,臺語、客語、原住民語幾乎缺席。當「好聽的 AI 聲音」等於「標準腔」,誰的聲音被消音了?

研究應用(正向)

Whisper 把聲音變成文字,ElevenLabs 把文字變回聲音。
這個迴圈閉合的那一刻,語言的邊界悄悄移動了。
總結

今日示範重點一覽

功能做了什麼關鍵觀察
Text to Speech文字 → 自然語音穩定度、相似度滑桿 vs. 聲音品質
Voice Library瀏覽 / 添加社群音色中文音色稀缺、臺語幾乎不存在
Voice Cloning60 秒錄音 → 複製音色古文朗讀的陌生感 → 觸發身份討論
批判視角—身份、詐騙、文化代表性
課堂延伸 請大家課後可以用免費帳號自行把 Whisper 逐字稿文本,丟進 ElevenLabs 聽聽看,完成「語音 → 文字(Whisper)→ 語音(ElevenLabs)」的完整迴圈,具體體驗 cascade pipeline 的概念。