AI 聲音分身怎麼做?用 Claude Code 接 Fish Audio,10 秒錄音複製自己的聲音
AI TOOLS · 2026
QUICK ANSWER
AI 聲音分身的做法:打開 Claude Desktop 的 Code 分頁,貼一段 prompt 讓 Claude 生成一個接 Fish Audio API 的本機 Web App,再到 Fish Audio 建一組 API Key 放進 .env.local。App 跑起來後上傳 10 秒自己的錄音,就能建立聲音模型並輸入任何文字生成語音,中英文都能講。用的 s2.1-pro-free 模型目前免費。
CHAPTER 01 · WHAT YOU GET
一座跑在你電腦裡的聲音實驗室
配音這件事,過去兩年設計師大多交給現成平台:註冊、挑聲音、貼文字、按生成。方便,但你永遠是在別人的介面裡工作,額度按月算,聲音存在別人的帳號裡,想改一個按鈕的位置也沒得改。
這篇要做的事反過來。你貼一段 prompt 給 Claude,它幫你把整座聲音實驗室蓋好,跑在你自己電腦的 localhost 上。上傳 10 秒自己的錄音,Fish Audio 會回一組聲音模型 ID,那個 ID 是你的。接下來輸入任何文字,它就用你的聲音念出來,英文也行,情緒和語速還能調。從貼 prompt 到聽見第一句話,整個流程大概一杯咖啡的時間。
你不需要會寫程式。你需要的是知道每一步在幹嘛,這樣 Claude 卡住的時候你才接得上話。整篇文章就是照這個邏輯排的:先看流程全貌,再看那段 prompt 為什麼這樣寫,最後一步一步做。
WORKFLOW · 從 PROMPT 到聲音分身,六步
STEP 01
貼 prompt 給 Claude Code
描述產品概念、技術架構、API 整合方式
STEP 02
Claude 蓋好整個 App
裝套件、跑起來、自己修錯
STEP 03
Fish Audio 拿 API Key
貼進 .env.local,只放伺服器端
STEP 04
上傳 10 秒錄音
按「複製聲音」,拿到聲音模型 ID
STEP 05
輸入台詞生成
中文、英文,貼整篇文章也行
STEP 06
調整、下載
情緒、速度、音量,輸出 MP3 或 WAV
CHAPTER 02 · WHY FISH AUDIO
為什麼接 Fish Audio,而且是現在
Fish Audio 是一家做語音模型的公司,S2 這一代的權重是開源的,網站上的聲音庫也很大。真正讓這件事變得值得現在動手的,是它今年六月把最新的 S2.1 Pro 模型以 s2.1-pro-free 這個模型名稱開放免費 API:同一個端點、同一顆模型,定價表上寫的是每百萬 UTF-8 bytes 0 美元,付費版 s2.1-pro 是 15 美元。
這顆模型支援 83 種語言,同一個聲音模型可以直接念英文、日文、中文,不用另外訓練。聲音複製只要 10 秒樣本,這是官方的數字。它自己的盲聽測試裡,S2.1 Pro 對前一代 S2 Pro 的勝率是 61%,單一請求的首段音訊延遲大約 70 到 90 毫秒。對做配音的人來說,這些數字翻成白話就是:聲音夠像、等待夠短、換語言不用重來。
10 秒
聲音樣本就能複製
83 種
語言共用同一個聲音模型
$0
免費模型 s2.1-pro-free
免費有它的條件,第六章會講清楚。這裡先講一件事:官方部落格的公告把免費期寫到 2026 年 8 月 31 日,但開發者文件已經把 s2.1-pro-free 列成正式的「開發用免費模型」,適合測試、原型和小型專案。也就是說,這不是一個限時活動頁,而是文件裡有名字的東西。會不會延長要看官方公告,動手的時間點越早越好。
▲ Fish Audio 官方介紹 S2.1 Pro 的影片,聽一下它的表現力再決定要不要往下做
CHAPTER 03 · THE PROMPT
那段 prompt 怎麼寫,為什麼這樣寫
整個流程最值錢的就是這一段。它決定 Claude 是給你一堆程式碼片段,還是給你一個真的能跑的 App。下面是完整版,可以整段複製,只有「風格」那一句要換成你自己的視覺方向,這是設計師該動手的地方。
PROMPT · 貼進 CLAUDE CODE
建立一個完整的 Web App,名稱叫做「是誰搶走了我的麥克風」。它是一個帶有像素遊戲風格的個人聲音複製錄音室。
不要只提供程式碼片段。請直接建立一個可以實際執行的完整專案:安裝相依套件、執行 App、修正錯誤,並驗證主要工作流程可以正常運作。
產品概念
這個 App 要讓使用者可以:
1. 上傳或拖放自己的聲音錄音
2. 預聽上傳的音訊
3. 使用 Fish Audio API 建立聲音複製模型
4. 儲存並重複使用 Fish Audio 回傳的 voice/model ID
5. 輸入任何想讓複製聲音朗讀的文字
6. 使用複製後的聲音產生語音
7. 預聽產生的音訊
8. 微調生成設定後重新產生
9. 下載產生的音訊
整體體驗應該像是一個小型的「實驗性聲音錄製房」,有像素遊戲的質感。
技術架構
使用:
- Next.js
- TypeScript
- Tailwind CSS
- React
- Fish Audio API
- 使用 Server-side API Routes 處理 Fish Audio API 請求
使用乾淨的元件架構。
Fish Audio API Key 只能放在伺服器端。
建立 .env.local,內容:
FISH_API_KEY=
絕對不要把 API Key 暴露在瀏覽器端的程式碼中。
Fish Audio 整合
請參考目前最新版的 Fish Audio 官方 API 文件。
實作兩個主要功能:
1. 聲音複製
將使用者上傳的音訊樣本傳送到 Fish Audio,並建立一個可重複使用的聲音模型。
使用 Fish Audio 的 voice/model creation API。
成功建立聲音模型後:
- 儲存回傳的 voice/reference ID
- 顯示成功狀態
- 讓使用者可以立即使用剛建立的聲音進行 TTS
如果有幫助,也可以支援多個音訊樣本,但第一版保持簡單。
2. Text-to-Speech
使用 Fish Audio TTS,並搭配複製聲音的 reference_id。
至少支援:
- text
- reference_id
- speed
- volume
- temperature
- top_p
- output format
請設定合理的預設值。
不要自行虛構 Fish Audio 不支援的參數。
實作時請參考最新版 Fish Audio 官方 API 文件。
主要介面
使用單頁式 Layout。
介面主要分成三個階段:
01 載入聲音:上傳或拖放區、上傳後預聽、「複製聲音」按鈕、顯示回傳的聲音模型 ID
02 輸入台詞:文字框、字數統計、「生成語音」按鈕
03 調整:情緒、速度、音量、temperature、top_p、輸出格式(MP3/WAV),改完可以重新生成
最下方是語音輸出區:播放器、重新生成、下載。
每個階段都要有清楚的狀態提示(上傳中、複製中、生成中、完成、錯誤)。
看起來很長,其實只有四個區塊,每一塊都在堵一個 AI 寫程式時最常出的問題。
PROMPT ANATOMY · 四個區塊各堵一個坑
01 · 開場指令
「不要只提供程式碼片段」
逼 Claude 進入裝套件、執行、修錯、驗證的迴圈,堵掉丟一段 code 就收工的可能。這句話決定了它是助理還是工程師。
02 · 產品概念
九個動詞,一個氣質
用使用者能做的事定義範圍,比功能清單好用得多。最後一句的「聲音錄製房、像素遊戲」給了視覺方向,換成你的品牌語言就是你的東西。
03 · 技術架構
Key 只能在伺服器端
指定 Next.js 的 Server-side API Routes 幫你擋著,瀏覽器看不到 Key。這是之後想把 App 部署上線也不用重寫的關鍵。
04 · API 整合
「不要自行虛構參數」
兩次要求參考最新官方文件,加一句禁止捏造參數。AI 接第三方 API 最常壞在幻想出不存在的欄位,這兩句是保險。
「第一版保持簡單」這句也值得留著。Claude 很容易一興奮就幫你加上帳號系統、歷史紀錄、深色模式切換,然後卡在其中一個你根本不需要的功能上。先讓它跑起來,第二版再加。這跟做設計提案的道理一樣:先把核心流程走通,再談裝飾。如果你想把這種寫法變成自己的公式,Claude Code 怎麼做出沒有 AI 感的網站那篇拆過一套四段式的 prompt 結構,跟這裡是同一個思路。
CHAPTER 04 · GETTING STARTED
六步做完,聽見自己的分身
前提有兩個:Claude 的 Pro 或以上方案(Code 分頁只開給付費方案),以及一個 Fish Audio 帳號。其他的 Claude 會處理,包括你電腦上還沒裝的東西,它會告訴你怎麼裝。
打開 Claude Desktop,切到 Code 分頁
桌面版有 Chat、Cowork、Code 三個分頁,這次用 Code。選 Local,指定一個新資料夾當專案目錄。還沒裝桌面版的話,Claude Desktop 那篇有三個分頁差在哪的說明;對 Claude Code 本身還陌生的,先看完整教學。
貼上第三章的 prompt,送出
接下來幾分鐘 Claude 會建專案、裝套件、寫元件、啟動開發伺服器,中間遇到錯誤會自己修。它需要你按確認的時候會停下來問,看一眼是在裝套件還是在改檔案,再放行。
到 Fish Audio 建一組 API Key
登入後進 API Keys 頁面,Create API Key,取個名字,Expiration 選 Never 就好。建好後先把 Key 複製起來。註冊連結放在文末的延伸資源。
把 Key 貼進 .env.local
Claude 已經在專案根目錄建好這個檔,裡面只有一行 FISH_API_KEY=,等號後面貼上就存檔。這個檔不會進到瀏覽器,也不該進到 git。改完如果 App 沒反應,跟 Claude 說一聲「重啟開發伺服器」。
打開 localhost,上傳 10 秒錄音,按「複製聲音」
Claude 會告訴你網址,通常是 localhost 加一個 port。把一段乾淨的錄音丟進去(WAV、MP3、M4A 都行),預聽確認沒問題,按複製。幾秒後畫面會出現一組聲音模型 ID,那就是 Fish Audio 建好的你。
輸入台詞,生成,播放
先打一句「聽起來像我的話就成功了」,按生成。像的話,恭喜;不像的話,八成出在錄音,模型很少是問題,看下面那張卡。
錄音怎麼錄,決定像不像
10 到 15 秒、安靜的房間、離麥克風一個手掌的距離、用你平常講話的語速念一段完整的句子。不要配樂、不要迴音、不要清喉嚨。手機的語音備忘錄就夠了,重點在乾淨,設備其次。
卡住的時候
把錯誤訊息整段貼回給 Claude,不用自己看懂。最常見的兩種:port 被佔用(叫它換一個)、API 回 401(Key 貼錯或沒重啟)。Fish Audio 回 402 是餘額或方案問題,去帳號頁看一眼。
CHAPTER 05 · IN PRACTICE
設計師拿它做什麼
最直接的用法是口播。你寫好的腳本,貼進台詞框,一分鐘後就是一段用你聲音念的音檔,剪片的時候先墊進去對節奏,等確定版本再決定要不要自己重錄。做 prototype 展示影片、課程講義的朗讀版、產品 demo 的旁白,全部是同一個動作。
跨語言是第二個用法,而且是這顆模型真正拉開差距的地方。把一整篇英文文章貼進去,出來的是你的聲音講英文,腔調自然,不需要另外做一個英文版的聲音模型。給海外客戶的提案影片、英文版的作品集導覽,過去要嘛找人配、要嘛用一個不是你的聲音,現在是你自己。
第三個是調整面板。prompt 裡要求的 speed、volume、temperature、top_p 都對應到 Fish Audio TTS API 的真實參數,Claude 會把它們做成滑桿。S2.1 Pro 還支援在文字裡直接放方括號的自然語言指令,像 [whispers] 或 [laughing nervously],放在句子中間就能在那個位置改變語氣,不限固定選項。
TTS PARAMETERS · 調整面板背後的真實參數
不想用自己的聲音也行。Fish Audio 網站的 Discovery 頁有一整個社群訓練好的聲線,可以先試聽,選一個把它的模型 ID 填進 reference_id,你的實驗室就換了一個講者。做角色配音、多人對話的 podcast 原型,這條路比自己錄快得多。
CHAPTER 06 · LIMITS
免費的條件,和幾件動手前該知道的事
s2.1-pro-free 的「免費」是給開發者的免費,附帶條件。官方講得很白:沒有 SLA、沒有延遲保證,請求內容可能被拿去改善模型,年營收超過一百萬美元的產品要先聯絡他們。換句話說,它是給你建、給你測、給你決定要不要付費的地方。你上傳的錄音會經過他們的伺服器,錄客戶的聲音、錄任何你沒有授權的聲音,都不該做。
免費期的日期要自己盯。官方部落格最後一次更新寫的是延長到 2026 年 8 月 31 日,文件端則把它列為長期的開發用模型,兩邊說法有落差,以官方公告為準。真的要拿去做正式產品,換成 s2.1-pro,每百萬 UTF-8 bytes 15 美元,官方換算大約 18 萬個英文字或 12 小時的語音,對個人創作者來說是一個很難花完的數字。
還有兩件小事。API 的併發上限在還沒付費的階段是 5 個同時請求,個人用完全夠,做成給很多人用的服務就不夠。以及,這個 App 只跑在你電腦上,關掉就沒了;想給別人用要另外部署,prompt 裡把 Key 鎖在伺服器端的設計就是為了這一天,到時候不用重寫。
“
複製自己的聲音很容易,複製別人的聲音很容易出事。這條線技術不會幫你畫,得你自己畫。
CHAPTER 07 · COMPARED TO
直接用 ElevenLabs 不就好了?
很多時候是的。ElevenLabs 的介面完整、聲音庫成熟、英文品質到現在還是業界的標竿,如果你一個月只配三段旁白,開網頁做完就走,沒必要蓋一座實驗室。它的免費層是每月一萬點數,大約六到十分鐘,之後就是月費。
自己蓋的價值在三個地方。第一是量:免費模型沒有硬性的字數上限,整本講義、整季課程的朗讀版都不用看著額度。第二是語言:83 種語言共用一個聲音模型,中英混講的內容不用切平台。第三是控制:介面是你的,參數是你的,聲音模型 ID 是你的,之後要接進自己的工作流、要換成別家的 API,都是改幾行的事。順帶一提,MiniMax Audio 也做到了十秒克隆,同一段 prompt 把 Fish Audio 換掉,Claude 一樣接得起來。
直接用現成平台
適合偶爾配音的人
零設定、介面成熟、英文品質最穩。代價是月費與額度,聲音和資料都在對方的帳號裡。
用 Claude 蓋自己的實驗室
適合把配音當工作流的人
一杯咖啡的設定時間,換來沒有硬上限的免費模型、83 種語言、完全屬於你的介面與聲音 ID。
CHAPTER 08 · TAKEAWAYS
重點整理
TAKEAWAYS
✦ 一段 prompt 加一組 API Key,Claude Code 就能蓋出一個跑在本機的聲音複製實驗室,不用會寫程式。
✦ Fish Audio 的 s2.1-pro-free 是最新模型的免費版:10 秒樣本複製、83 種語言、每百萬 bytes 0 美元,條件是沒有 SLA、資料可能被用來訓練。
✦ prompt 裡最重要的四句:不要只給程式碼片段、Key 只能在伺服器端、不要虛構參數、第一版保持簡單。
✦ 像不像八成取決於錄音:10 到 15 秒、安靜、乾淨、平常的語速。
✦ 只複製自己的聲音或有授權的聲音。免費期日期以官方公告為準,正式產品換 s2.1-pro。
這件事真正有意思的地方在聲音之外:一個設計師現在可以用一段中文描述,換到一個以前要找工程師排兩週的工具,而且介面長什麼樣、按鈕放哪裡、狀態怎麼提示,全部是自己決定的。配音只是第一個藉口。你手上每一個「要是有個小工具就好了」的念頭,現在都值得拿同一套寫法再試一次。
RELATED READS · 延伸閱讀
EXTRA · LINKS · 延伸資源
✦ Fish Audio 註冊(我的推薦連結,用這個註冊對你價格一樣)
✦ API Keys 管理頁(登入後建立、查看用量)
✦ 模型總覽文件、定價與併發上限
✦ Create Model API 文件(聲音複製那一段的來源)
✦ S2.1 Pro 免費 API 官方公告(免費期最新日期看這篇)
✦ Discovery 聲音庫(不想用自己聲音時來這挑)
✦ Claude Code 官方頁
FAQ
常見問題
Q:不會寫程式也做得出來嗎?
A:可以。整個專案由 Claude Code 建立、安裝、執行、修錯,你負責貼 prompt、貼 API Key、上傳錄音。卡住時把錯誤訊息整段貼回給 Claude 就好。需要的是 Claude 的付費方案(Pro 以上才有 Code 分頁)跟一個 Fish Audio 帳號。
Q:Fish Audio 的聲音複製真的免費嗎?
A:用 s2.1-pro-free 這個模型名稱呼叫 API,定價表上是每百萬 UTF-8 bytes 0 美元,聲音複製也包含在內,條件是 Fair Use、沒有 SLA、請求可能被用來改善模型。官方部落格最後一次公告的免費期是到 2026 年 8 月 31 日,文件則把它列為長期的開發用免費模型,最新狀態以官方為準。
Q:要錄多長的聲音?用手機錄可以嗎?
A:官方說 10 秒就夠,實務上 10 到 15 秒最穩。手機語音備忘錄可以,重點是安靜的環境、沒有配樂與迴音、用平常講話的語速念完整的句子。錄音品質對相似度的影響遠大於設備。
Q:複製出來的聲音可以講英文或日文嗎?
A:可以。S2.1 Pro 支援 83 種語言,同一個聲音模型直接念不同語言,不用另外訓練,語言會自動偵測。把一整篇英文文章貼進台詞框,出來就是你的聲音講英文。
Q:可以複製別人的聲音嗎?商用可以嗎?
A:只複製自己的聲音,或拿到明確授權的聲音。免費模型在部分商業情境有限制,年營收超過一百萬美元的產品要先聯絡 Fish Audio;正式產品建議換付費的 s2.1-pro,每百萬 UTF-8 bytes 15 美元,並詳讀他們的服務條款。
Q:不想用自己的聲音,有現成的聲線可以用嗎?
A:有。Fish Audio 的 Discovery 頁有大量社群訓練好的公開聲線,試聽後把它的模型 ID 填進 reference_id 就能在你的實驗室裡使用,適合角色配音或多人對話的原型。
Q:這個 App 可以給別人用嗎?
A:預設只跑在你自己的電腦上。要分享得另外部署,因為 prompt 把 API Key 鎖在伺服器端的 API Routes,部署時不用重寫;但免費模型的併發上限只有 5 個同時請求,多人使用要評估換付費方案。




