AI 聲音分身怎麼做?用 Claude Code 接 Fish Audio,10 秒錄音複製自己的聲音

貼一段 prompt 讓 Claude 把整座聲音實驗室蓋好,接上目前免費開放的 S2.1 Pro 模型,情緒、語速、跨語言口播一次到位
設計師 Riven

設計師 Riven

2026年8月27日 下午 10:55

AI 設計

AI TOOLS · 2026

Fish Audio 官方公告圖:S2.1 Pro is now free to all developers,S2.1 Pro 語音模型開放免費 API

▲ Fish Audio 官方公告圖:S2.1 Pro 模型以 s2.1-pro-free 的名字開放免費 API,這篇的聲音分身就是接這顆模型

QUICK ANSWER

AI 聲音分身的做法:打開 Claude Desktop 的 Code 分頁,貼一段 prompt 讓 Claude 生成一個接 Fish Audio API 的本機 Web App,再到 Fish Audio 建一組 API Key 放進 .env.local。App 跑起來後上傳 10 秒自己的錄音,就能建立聲音模型並輸入任何文字生成語音,中英文都能講。用的 s2.1-pro-free 模型目前免費。

CHAPTER 01 · WHAT YOU GET

一座跑在你電腦裡的聲音實驗室

配音這件事,過去兩年設計師大多交給現成平台:註冊、挑聲音、貼文字、按生成。方便,但你永遠是在別人的介面裡工作,額度按月算,聲音存在別人的帳號裡,想改一個按鈕的位置也沒得改。

這篇要做的事反過來。你貼一段 prompt 給 Claude,它幫你把整座聲音實驗室蓋好,跑在你自己電腦的 localhost 上。上傳 10 秒自己的錄音,Fish Audio 會回一組聲音模型 ID,那個 ID 是你的。接下來輸入任何文字,它就用你的聲音念出來,英文也行,情緒和語速還能調。從貼 prompt 到聽見第一句話,整個流程大概一杯咖啡的時間。

你不需要會寫程式。你需要的是知道每一步在幹嘛,這樣 Claude 卡住的時候你才接得上話。整篇文章就是照這個邏輯排的:先看流程全貌,再看那段 prompt 為什麼這樣寫,最後一步一步做。

WORKFLOW · 從 PROMPT 到聲音分身,六步

STEP 01

貼 prompt 給 Claude Code

描述產品概念、技術架構、API 整合方式

STEP 02

Claude 蓋好整個 App

裝套件、跑起來、自己修錯

STEP 03

Fish Audio 拿 API Key

貼進 .env.local,只放伺服器端

STEP 04

上傳 10 秒錄音

按「複製聲音」,拿到聲音模型 ID

STEP 05

輸入台詞生成

中文、英文,貼整篇文章也行

STEP 06

調整、下載

情緒、速度、音量,輸出 MP3 或 WAV

CHAPTER 02 · WHY FISH AUDIO

為什麼接 Fish Audio,而且是現在

Fish Audio 是一家做語音模型的公司,S2 這一代的權重是開源的,網站上的聲音庫也很大。真正讓這件事變得值得現在動手的,是它今年六月把最新的 S2.1 Pro 模型以 s2.1-pro-free 這個模型名稱開放免費 API:同一個端點、同一顆模型,定價表上寫的是每百萬 UTF-8 bytes 0 美元,付費版 s2.1-pro 是 15 美元。

這顆模型支援 83 種語言,同一個聲音模型可以直接念英文、日文、中文,不用另外訓練。聲音複製只要 10 秒樣本,這是官方的數字。它自己的盲聽測試裡,S2.1 Pro 對前一代 S2 Pro 的勝率是 61%,單一請求的首段音訊延遲大約 70 到 90 毫秒。對做配音的人來說,這些數字翻成白話就是:聲音夠像、等待夠短、換語言不用重來。

10

聲音樣本就能複製

83

語言共用同一個聲音模型

$0

免費模型 s2.1-pro-free

免費有它的條件,第六章會講清楚。這裡先講一件事:官方部落格的公告把免費期寫到 2026 年 8 月 31 日,但開發者文件已經把 s2.1-pro-free 列成正式的「開發用免費模型」,適合測試、原型和小型專案。也就是說,這不是一個限時活動頁,而是文件裡有名字的東西。會不會延長要看官方公告,動手的時間點越早越好。

Fish Audio S2.1 Pro 官方效能圖表:不同併發數下的輸出吞吐量 tok/s 與首段音訊延遲 TTFB p50 毫秒

▲ Fish Audio 官方效能圖:單一請求首段音訊延遲 73.2 毫秒,64 併發時吞吐量 8,006 tok/s。免費之所以撐得住,來自他們重寫的推論架構

▲ Fish Audio 官方介紹 S2.1 Pro 的影片,聽一下它的表現力再決定要不要往下做

CHAPTER 03 · THE PROMPT

那段 prompt 怎麼寫,為什麼這樣寫

整個流程最值錢的就是這一段。它決定 Claude 是給你一堆程式碼片段,還是給你一個真的能跑的 App。下面是完整版,可以整段複製,只有「風格」那一句要換成你自己的視覺方向,這是設計師該動手的地方。

PROMPT · 貼進 CLAUDE CODE

建立一個完整的 Web App,名稱叫做「是誰搶走了我的麥克風」。它是一個帶有像素遊戲風格的個人聲音複製錄音室。
不要只提供程式碼片段。請直接建立一個可以實際執行的完整專案:安裝相依套件、執行 App、修正錯誤,並驗證主要工作流程可以正常運作。

產品概念
這個 App 要讓使用者可以:
1. 上傳或拖放自己的聲音錄音
2. 預聽上傳的音訊
3. 使用 Fish Audio API 建立聲音複製模型
4. 儲存並重複使用 Fish Audio 回傳的 voice/model ID
5. 輸入任何想讓複製聲音朗讀的文字
6. 使用複製後的聲音產生語音
7. 預聽產生的音訊
8. 微調生成設定後重新產生
9. 下載產生的音訊
整體體驗應該像是一個小型的「實驗性聲音錄製房」,有像素遊戲的質感。

技術架構
使用:
- Next.js
- TypeScript
- Tailwind CSS
- React
- Fish Audio API
- 使用 Server-side API Routes 處理 Fish Audio API 請求
使用乾淨的元件架構。
Fish Audio API Key 只能放在伺服器端。
建立 .env.local,內容:
FISH_API_KEY=
絕對不要把 API Key 暴露在瀏覽器端的程式碼中。

Fish Audio 整合
請參考目前最新版的 Fish Audio 官方 API 文件。
實作兩個主要功能:
1. 聲音複製
將使用者上傳的音訊樣本傳送到 Fish Audio,並建立一個可重複使用的聲音模型。
使用 Fish Audio 的 voice/model creation API。
成功建立聲音模型後:
- 儲存回傳的 voice/reference ID
- 顯示成功狀態
- 讓使用者可以立即使用剛建立的聲音進行 TTS
如果有幫助,也可以支援多個音訊樣本,但第一版保持簡單。
2. Text-to-Speech
使用 Fish Audio TTS,並搭配複製聲音的 reference_id。
至少支援:
- text
- reference_id
- speed
- volume
- temperature
- top_p
- output format
請設定合理的預設值。
不要自行虛構 Fish Audio 不支援的參數。
實作時請參考最新版 Fish Audio 官方 API 文件。

主要介面
使用單頁式 Layout。
介面主要分成三個階段:
01 載入聲音:上傳或拖放區、上傳後預聽、「複製聲音」按鈕、顯示回傳的聲音模型 ID
02 輸入台詞:文字框、字數統計、「生成語音」按鈕
03 調整:情緒、速度、音量、temperature、top_p、輸出格式(MP3/WAV),改完可以重新生成
最下方是語音輸出區:播放器、重新生成、下載。
每個階段都要有清楚的狀態提示(上傳中、複製中、生成中、完成、錯誤)。

看起來很長,其實只有四個區塊,每一塊都在堵一個 AI 寫程式時最常出的問題。

PROMPT ANATOMY · 四個區塊各堵一個坑

01 · 開場指令

「不要只提供程式碼片段」

逼 Claude 進入裝套件、執行、修錯、驗證的迴圈,堵掉丟一段 code 就收工的可能。這句話決定了它是助理還是工程師。

02 · 產品概念

九個動詞,一個氣質

用使用者能做的事定義範圍,比功能清單好用得多。最後一句的「聲音錄製房、像素遊戲」給了視覺方向,換成你的品牌語言就是你的東西。

03 · 技術架構

Key 只能在伺服器端

指定 Next.js 的 Server-side API Routes 幫你擋著,瀏覽器看不到 Key。這是之後想把 App 部署上線也不用重寫的關鍵。

04 · API 整合

「不要自行虛構參數」

兩次要求參考最新官方文件,加一句禁止捏造參數。AI 接第三方 API 最常壞在幻想出不存在的欄位,這兩句是保險。

「第一版保持簡單」這句也值得留著。Claude 很容易一興奮就幫你加上帳號系統、歷史紀錄、深色模式切換,然後卡在其中一個你根本不需要的功能上。先讓它跑起來,第二版再加。這跟做設計提案的道理一樣:先把核心流程走通,再談裝飾。如果你想把這種寫法變成自己的公式,Claude Code 怎麼做出沒有 AI 感的網站那篇拆過一套四段式的 prompt 結構,跟這裡是同一個思路。

CHAPTER 04 · GETTING STARTED

六步做完,聽見自己的分身

前提有兩個:Claude 的 Pro 或以上方案(Code 分頁只開給付費方案),以及一個 Fish Audio 帳號。其他的 Claude 會處理,包括你電腦上還沒裝的東西,它會告訴你怎麼裝。

1

打開 Claude Desktop,切到 Code 分頁

桌面版有 Chat、Cowork、Code 三個分頁,這次用 Code。選 Local,指定一個新資料夾當專案目錄。還沒裝桌面版的話,Claude Desktop 那篇有三個分頁差在哪的說明;對 Claude Code 本身還陌生的,先看完整教學

2

貼上第三章的 prompt,送出

接下來幾分鐘 Claude 會建專案、裝套件、寫元件、啟動開發伺服器,中間遇到錯誤會自己修。它需要你按確認的時候會停下來問,看一眼是在裝套件還是在改檔案,再放行。

3

到 Fish Audio 建一組 API Key

登入後進 API Keys 頁面,Create API Key,取個名字,Expiration 選 Never 就好。建好後先把 Key 複製起來。註冊連結放在文末的延伸資源。

4

把 Key 貼進 .env.local

Claude 已經在專案根目錄建好這個檔,裡面只有一行 FISH_API_KEY=,等號後面貼上就存檔。這個檔不會進到瀏覽器,也不該進到 git。改完如果 App 沒反應,跟 Claude 說一聲「重啟開發伺服器」。

5

打開 localhost,上傳 10 秒錄音,按「複製聲音」

Claude 會告訴你網址,通常是 localhost 加一個 port。把一段乾淨的錄音丟進去(WAV、MP3、M4A 都行),預聽確認沒問題,按複製。幾秒後畫面會出現一組聲音模型 ID,那就是 Fish Audio 建好的你。

6

輸入台詞,生成,播放

先打一句「聽起來像我的話就成功了」,按生成。像的話,恭喜;不像的話,八成出在錄音,模型很少是問題,看下面那張卡。

錄音怎麼錄,決定像不像

10 到 15 秒、安靜的房間、離麥克風一個手掌的距離、用你平常講話的語速念一段完整的句子。不要配樂、不要迴音、不要清喉嚨。手機的語音備忘錄就夠了,重點在乾淨,設備其次。

卡住的時候

把錯誤訊息整段貼回給 Claude,不用自己看懂。最常見的兩種:port 被佔用(叫它換一個)、API 回 401(Key 貼錯或沒重啟)。Fish Audio 回 402 是餘額或方案問題,去帳號頁看一眼。

CHAPTER 05 · IN PRACTICE

設計師拿它做什麼

最直接的用法是口播。你寫好的腳本,貼進台詞框,一分鐘後就是一段用你聲音念的音檔,剪片的時候先墊進去對節奏,等確定版本再決定要不要自己重錄。做 prototype 展示影片、課程講義的朗讀版、產品 demo 的旁白,全部是同一個動作。

跨語言是第二個用法,而且是這顆模型真正拉開差距的地方。把一整篇英文文章貼進去,出來的是你的聲音講英文,腔調自然,不需要另外做一個英文版的聲音模型。給海外客戶的提案影片、英文版的作品集導覽,過去要嘛找人配、要嘛用一個不是你的聲音,現在是你自己。

第三個是調整面板。prompt 裡要求的 speed、volume、temperature、top_p 都對應到 Fish Audio TTS API 的真實參數,Claude 會把它們做成滑桿。S2.1 Pro 還支援在文字裡直接放方括號的自然語言指令,像 [whispers][laughing nervously],放在句子中間就能在那個位置改變語氣,不限固定選項。

TTS PARAMETERS · 調整面板背後的真實參數

參數

預設

調它會發生什麼事

reference_id

你的模型 ID

決定用誰的聲音。換成 Discovery 裡任何一個公開聲線的 ID,就換人講

prosody.speed

1.0

語速倍率。口播 0.9 到 1.1 之間最自然,短影片可以推到 1.2

prosody.volume

0 dB

音量增減。剪輯軟體裡也能調,這裡留 0 就好

temperature

0.7

表現的隨機程度。往下更穩更平,往上更有起伏也更容易走音

top_p

0.7

取樣範圍。跟 temperature 一起動,一次只動一個比較好判斷

format

mp3

要進剪輯軟體選 wav,分享用 mp3;API 另外支援 pcm 與 opus

不想用自己的聲音也行。Fish Audio 網站的 Discovery 頁有一整個社群訓練好的聲線,可以先試聽,選一個把它的模型 ID 填進 reference_id,你的實驗室就換了一個講者。做角色配音、多人對話的 podcast 原型,這條路比自己錄快得多。

Fish Audio 官方比較圖:S2.1 Pro Free 與 ElevenLabs、OpenAI TTS、Google Cloud TTS 免費方案的額度、最新模型、語言數與聲音複製對照

▲ Fish Audio 官方整理的免費方案對照(2026 年 6 月資料):它是唯一免費層跑最新模型且含聲音複製的。這是廠商自己做的表,看方向就好,第七章有我的看法

CHAPTER 06 · LIMITS

免費的條件,和幾件動手前該知道的事

s2.1-pro-free 的「免費」是給開發者的免費,附帶條件。官方講得很白:沒有 SLA、沒有延遲保證,請求內容可能被拿去改善模型,年營收超過一百萬美元的產品要先聯絡他們。換句話說,它是給你建、給你測、給你決定要不要付費的地方。你上傳的錄音會經過他們的伺服器,錄客戶的聲音、錄任何你沒有授權的聲音,都不該做。

免費期的日期要自己盯。官方部落格最後一次更新寫的是延長到 2026 年 8 月 31 日,文件端則把它列為長期的開發用模型,兩邊說法有落差,以官方公告為準。真的要拿去做正式產品,換成 s2.1-pro,每百萬 UTF-8 bytes 15 美元,官方換算大約 18 萬個英文字或 12 小時的語音,對個人創作者來說是一個很難花完的數字。

還有兩件小事。API 的併發上限在還沒付費的階段是 5 個同時請求,個人用完全夠,做成給很多人用的服務就不夠。以及,這個 App 只跑在你電腦上,關掉就沒了;想給別人用要另外部署,prompt 裡把 Key 鎖在伺服器端的設計就是為了這一天,到時候不用重寫。

複製自己的聲音很容易,複製別人的聲音很容易出事。這條線技術不會幫你畫,得你自己畫。

CHAPTER 07 · COMPARED TO

直接用 ElevenLabs 不就好了?

很多時候是的。ElevenLabs 的介面完整、聲音庫成熟、英文品質到現在還是業界的標竿,如果你一個月只配三段旁白,開網頁做完就走,沒必要蓋一座實驗室。它的免費層是每月一萬點數,大約六到十分鐘,之後就是月費。

自己蓋的價值在三個地方。第一是量:免費模型沒有硬性的字數上限,整本講義、整季課程的朗讀版都不用看著額度。第二是語言:83 種語言共用一個聲音模型,中英混講的內容不用切平台。第三是控制:介面是你的,參數是你的,聲音模型 ID 是你的,之後要接進自己的工作流、要換成別家的 API,都是改幾行的事。順帶一提,MiniMax Audio 也做到了十秒克隆,同一段 prompt 把 Fish Audio 換掉,Claude 一樣接得起來。

直接用現成平台

適合偶爾配音的人

零設定、介面成熟、英文品質最穩。代價是月費與額度,聲音和資料都在對方的帳號裡。

用 Claude 蓋自己的實驗室

適合把配音當工作流的人

一杯咖啡的設定時間,換來沒有硬上限的免費模型、83 種語言、完全屬於你的介面與聲音 ID。

CHAPTER 08 · TAKEAWAYS

重點整理

TAKEAWAYS

✦ 一段 prompt 加一組 API Key,Claude Code 就能蓋出一個跑在本機的聲音複製實驗室,不用會寫程式。

✦ Fish Audio 的 s2.1-pro-free 是最新模型的免費版:10 秒樣本複製、83 種語言、每百萬 bytes 0 美元,條件是沒有 SLA、資料可能被用來訓練。

✦ prompt 裡最重要的四句:不要只給程式碼片段、Key 只能在伺服器端、不要虛構參數、第一版保持簡單。

✦ 像不像八成取決於錄音:10 到 15 秒、安靜、乾淨、平常的語速。

✦ 只複製自己的聲音或有授權的聲音。免費期日期以官方公告為準,正式產品換 s2.1-pro。

這件事真正有意思的地方在聲音之外:一個設計師現在可以用一段中文描述,換到一個以前要找工程師排兩週的工具,而且介面長什麼樣、按鈕放哪裡、狀態怎麼提示,全部是自己決定的。配音只是第一個藉口。你手上每一個「要是有個小工具就好了」的念頭,現在都值得拿同一套寫法再試一次。

RELATED READS · 延伸閱讀

Claude Code 怎麼做出沒有 AI 感的網站?三步驟把 AI 調教成懂品味的設計師品味庫、skill 與 MCP、永不 one-shot,四段式 prompt 公式跟這篇是同一個思路ElevenLabs 怎麼用?10 分鐘做出第一段 AI 配音的完整教學不想自己蓋實驗室的話,現成平台的五步驟與常見錯誤在這MiniMax Audio 是什麼?Speech 2.8 語音模型完整介紹與設計師實戰另一顆十秒克隆、中日雙語的語音模型,同一段 prompt 換掉 API 就能接Claude Code 設計師完整指南:Agentic Loop、CLAUDE.md、五大功能與實戰場景想懂 Claude 為什麼會自己裝套件、跑測試、修錯,從 Agentic Loop 開始看繁中影片自動上字幕用什麼?What'Sub 的斷句、FCPXML 與定價完整解析口播做好了,下一步是字幕,這篇接著看ChatGPT Live 是什麼?GPT-Live 全雙工語音、跟 Advanced 差在哪、設計師怎麼用語音 AI 的另一條線:即時對話而不是配音,設計語音介面前先看這篇Claude Academy 是什麼?Anthropic 官方免費學習平台的課程地圖與設計師攻略Claude Code 的官方課程全部免費,想把這套寫法練熟從這裡開始

EXTRA · LINKS · 延伸資源

Fish Audio 註冊(我的推薦連結,用這個註冊對你價格一樣)
API Keys 管理頁(登入後建立、查看用量)
模型總覽文件定價與併發上限
Create Model API 文件(聲音複製那一段的來源)
S2.1 Pro 免費 API 官方公告(免費期最新日期看這篇)
Discovery 聲音庫(不想用自己聲音時來這挑)
Claude Code 官方頁

FAQ

常見問題

Q:不會寫程式也做得出來嗎?

A:可以。整個專案由 Claude Code 建立、安裝、執行、修錯,你負責貼 prompt、貼 API Key、上傳錄音。卡住時把錯誤訊息整段貼回給 Claude 就好。需要的是 Claude 的付費方案(Pro 以上才有 Code 分頁)跟一個 Fish Audio 帳號。

Q:Fish Audio 的聲音複製真的免費嗎?

A:用 s2.1-pro-free 這個模型名稱呼叫 API,定價表上是每百萬 UTF-8 bytes 0 美元,聲音複製也包含在內,條件是 Fair Use、沒有 SLA、請求可能被用來改善模型。官方部落格最後一次公告的免費期是到 2026 年 8 月 31 日,文件則把它列為長期的開發用免費模型,最新狀態以官方為準。

Q:要錄多長的聲音?用手機錄可以嗎?

A:官方說 10 秒就夠,實務上 10 到 15 秒最穩。手機語音備忘錄可以,重點是安靜的環境、沒有配樂與迴音、用平常講話的語速念完整的句子。錄音品質對相似度的影響遠大於設備。

Q:複製出來的聲音可以講英文或日文嗎?

A:可以。S2.1 Pro 支援 83 種語言,同一個聲音模型直接念不同語言,不用另外訓練,語言會自動偵測。把一整篇英文文章貼進台詞框,出來就是你的聲音講英文。

Q:可以複製別人的聲音嗎?商用可以嗎?

A:只複製自己的聲音,或拿到明確授權的聲音。免費模型在部分商業情境有限制,年營收超過一百萬美元的產品要先聯絡 Fish Audio;正式產品建議換付費的 s2.1-pro,每百萬 UTF-8 bytes 15 美元,並詳讀他們的服務條款。

Q:不想用自己的聲音,有現成的聲線可以用嗎?

A:有。Fish Audio 的 Discovery 頁有大量社群訓練好的公開聲線,試聽後把它的模型 ID 填進 reference_id 就能在你的實驗室裡使用,適合角色配音或多人對話的原型。

Q:這個 App 可以給別人用嗎?

A:預設只跑在你自己的電腦上。要分享得另外部署,因為 prompt 把 API Key 鎖在伺服器端的 API Routes,部署時不用重寫;但免費模型的併發上限只有 5 個同時請求,多人使用要評估換付費方案。