01

為什麼數位分身需要聲音?

上週的「蒸餾人」作業中,我們把自己的人格寫進 SOUL.md,但 agent 仍然是文字的存在。我們可以補上聲音這一塊,讓你的數位分身具有可聽見的存在。

文字 → 影像 → 聲音。三種媒介中,聲音是最後一道指紋,它比文字更難偽造,比影像更個人。一個會打字的 AI 和一個用你的聲音說話的 AI,心理上是完全不同的存在。這也是為什麼語音 deepfake 比文字偽造更具倫理張力。

ElevenLabs 是什麼?

ElevenLabs(2022 年創立)是目前聲音逼真度最高的 AI 語音合成平台,三大核心功能:

Text to Speech

輸入文字、選擇音色,即時合成自然語音。支援 70+ 語言。

Voice Cloning

上傳 1 分鐘錄音,複製任意人聲的音色與語氣。

Speech to Speech

把你的聲音即時轉換成另一個音色,並保留情緒和韻律。

02

方案比較:先了解你能用什麼

本課程示範與作業免費方案完全足夠。下方表格僅供參考(規格與額度可能隨平台政策調整):

功能Free(推薦)Starter $5/月Creator $22/月
每月字元額度10,000 字元30,000 字元100,000 字元
對應語音長度約 10–12 分鐘約 30 分鐘約 1–1.5 小時
Instant Voice Cloning(即時複製)✓ 1 個✓ 無限✓ 無限
Professional Voice Clone(高保真)✓ 需 30+ 分鐘音檔
商業使用權✓✓
API 存取✓ 有限額✓✓
課程建議 免費方案的 1 個 instant voice clone 足以完成本週作業與期末專案的語音整合。不需要付費。用完額度的話,下個月會自動 reset。
DEMO A

Text to Speech:文字變聲音

第一個示範的是最基礎也最直觀的功能。建議用瀏覽器全螢幕讓大家看清楚介面佈局。

介面導覽
Text to Speech左側選單第一項,主要工作區。
Voice右上下拉選單,選擇音色(預設有幾個英文 voice 可用)。
Stability / Similarity兩個滑桿——控制聲音的穩定度與相似度。現場調看看差異。
Generate右下按鈕,按下產生語音,幾秒鐘內完成。

示範文本(繁體中文)

「歷史從不只是文字。它也是聲音——那些已消逝的聲音:說書人的嗓音、母親的呢喃、戰場上最後的呼喊。
今天,人工智慧讓我們能夠重新聽見那些聲音。這是奇蹟,也是責任。」

接著用一段帶臺語感的漢字文本

「逐家來聽,今仔日阮要講的代誌,是關於咱台灣人的故事。」

觀察重點:AI 能否正確處理漢字臺語?它會當成普通話讀嗎?這是引出「語料代表性」議題的好時機。

DEMO B

Voice Library:聲音也有圖書館

社群上傳的音色庫,任何人都可以把自己的聲音「發布」出來讓他人使用。

進入 Voices → Voice Library

左側選單第二層。注意每個音色的使用次數——有些已被數十萬次呼叫。

用 Language 篩選「Chinese」或「Japanese」

看看哪些音色適合課程目的。試聽幾個,注意品質差異。

點「Add to My Voices」

添加後就能在 Text to Speech 中使用。概念類比:下載字體。

課堂提問

「如果有人把你朋友的聲音上傳到這裡:這合法嗎?這道德嗎?聲音是一種個人資料嗎?」
(下週我們有機會可以討論 AI 聲音合成倫理的議題。)

DEMO C

Voice Cloning:複製一個人的聲音

本次示範的最具衝擊感的功能。

示範倫理 建議上傳自己的聲音作為示範素材(事先錄製約 60 秒的清晰音檔)。避免使用他人聲音引發倫理爭議,也避免讓同學對「可以隨意複製別人聲音」產生錯誤示範印象。
進入 Voices → Add a new voice → Instant Voice Cloning

選 Instant Voice Cloning(免費版支援)。Professional Voice Clone 是付費功能,本次不示範。

上傳事先準備的錄音檔

建議 60 秒以上的安靜環境錄音。要求:無背景音樂、無回音、單人說話、咬字清晰。

命名音色,勾選同意聲明,點「Save」

幾秒內完成。clone 後可在 Voice Library 個人區找到。

回到 Text to Speech,選剛建立的音色

輸入一段平常不會說的話,生成並播放。感受「我的聲音說了我沒說過的話」。

建議的複製示範文本(讓學生感受「陌生感」)

「大江東去,浪淘盡,千古風流人物。
故壘西邊,人道是,三國周郎赤壁。」

用自己的聲音說蘇軾的詞。這個落差本身就是討論起點:「誰的聲音?誰的文字?AI 扮演了什麼角色?」

學生自學

有興趣的同學自己 clone 一個 voice

看完課堂示範後,有興趣的同學可以在課後依照以下六個步驟,自己建立第一個 voice clone。整個過程約 15 分鐘。

六步驟:從註冊到第一個 voice clone

註冊 ElevenLabs 帳號

前往 elevenlabs.io → 右上 Sign Up → 用 Google 帳號註冊最快。免費方案不需信用卡。

準備音檔(1–3 分鐘)

用手機或錄音軟體錄製乾淨的音檔。內容可以是朗讀新聞、自我介紹、念一段你喜歡的文章。避免回音、背景噪音、咳嗽聲。

進入 Voices → My Voices → Add a New Voice

點 Instant Voice Cloning(IVC)。Professional Voice Cloning 是付費功能,本次不選。

上傳音檔,命名你的 voice

給 voice 取個名字(例如「我的聲音」),勾選同意聲明,點 Add Voice。幾秒內完成。

到 Text to Speech 測試

選剛建立的 voice,輸入文字,選 eleven_multilingual_v2 模型(中文必選),點 Generate。聽聽你的聲音說新的話。

滿意後可下載 MP3,或取得 API key

到 Profile → API Keys 取得 API key(用於程式整合)。API key 像密碼一樣要保護好。

自學提醒 免費帳號 10,000 字元/月足夠玩很久。一句中文約 6–10 字元。試錄個 50 次都還有額度。不用怕用光。
07

程式整合:把 ElevenLabs 接到你的數位分身

有了 API key 後,15 行 Python 就能把 ElevenLabs 接到你的 SOUL.md + Gemini。下面是完整管線示意:

數位分身的多模態管線
Layer 1
SOUL.md
→
Layer 2
Gemini API
→
Layer 3
ElevenLabs

人格(你寫的) → 思考(LLM 生成)→ 聲音(你的 voice clone)

最小可行整合:15 行 Python

PYTHON minimal_twin.py
import google.generativeai as genai
from elevenlabs import generate, play, save
import os

# 1. 讀取你的 SOUL.md 作為人格
with open("SOUL.md") as f:
    soul = f.read()

# 2. 呼叫 Gemini 生成回應(用 SOUL.md 當人格設定)
genai.configure(api_key=os.environ["GEMINI_API_KEY"])
model = genai.GenerativeModel("gemini-2.5-flash", system_instruction=soul)
response = model.generate_content("你怎麼看蒸餾人這個概念?")

# 3. 用你 clone 的 voice 念出 Gemini 的回應
audio = generate(
    text=response.text,
    voice="YOUR_VOICE_ID",         # 你 clone 完的 voice id
    model="eleven_multilingual_v2"  # 支援中文
)
save(audio, "reply.mp3")
play(audio)
免費額度提醒 每呼叫一次大約用掉 100–500 字元。Free 帳號每月 10,000 字元 → 約 20–100 次呼叫。用於本週作業足夠,但避免在迴圈裡瘋狂呼叫。
批判視角

人文反思

ElevenLabs 的功能強大到讓人著迷,但作為人文研究者,我們必須同時看見技術的另一面。

問題一:聲音作為身份

聲紋如同指紋,是高度個人化的生物特徵。當任何人都能用 1 分鐘錄音複製你的聲音,「聲音」還算是你的嗎?現行法律(包括台灣)幾乎沒有針對 AI 聲音複製的保護。

問題二:Deepfake 與詐騙

2024 年香港案例:詐騙集團用 deepfake 語音和影像,冒充公司高管,騙走 2 億港幣。台灣的電話詐騙若整合 ElevenLabs 等工具,危害難以估量。技術民主化的反面,是風險的民主化。

問題三:文化代表性與語料政治

Voice Library 的中文音色大多是普通話,臺語、客語、原住民語幾乎缺席。當「好聽的 AI 聲音」等於「標準腔」,誰的聲音被消音了?

研究應用(正向)

當聲音是「我」、邏輯是 SOUL.md 蒸餾出的「我」、內容是 LLM 即時生成 - 那麼這個「我」究竟是誰?
這不是技術問題,是哲學問題。
摘要

本週示範與自學路徑回顧

區段內容對象
DEMO AText to Speech 文字變聲音老師示範,同學觀察
DEMO BVoice Library 社群音色老師示範,引出倫理討論
DEMO CVoice Cloning 複製自己聲音老師示範(用自己的聲音)
自學路徑六步驟自建 voice clone有興趣的同學課後自學
程式整合SOUL.md + Gemini + ElevenLabs期末專案選做加分
批判視角身份、詐騙、文化代表性全班共同討論
期末專案中的角色 ElevenLabs 整合不是期末專案的必做項目,但是加分亮點。期末核心仍是 Stage 1(一頁式語言學習小卡 + Gemini API + 部署)。有餘力的同學可以把 ElevenLabs 接上,做出「用自己的聲音念例句」的效果。