---
title: "AI 聲音分身怎麼做？用 Claude Code 接 Fish Audio，10 秒錄音複製自己的聲音"
slug: ai-voice-clone-claude-code-fish-audio
url: https://rar.design/posts/ai-voice-clone-claude-code-fish-audio
published_at: 2026-08-27
modified_at: 2026-08-28
author: "設計師 Riven"
category: "AI 設計"
tags: ["TTS", "Fish Audio", "Claude", "Claude Code", "語音克隆", "AI 配音", "AI 語音", "AI 工具"]
access: public_access
---

# AI 聲音分身怎麼做？用 Claude Code 接 Fish Audio，10 秒錄音複製自己的聲音

> 貼一段 prompt 讓 Claude 把整座聲音實驗室蓋好，接上目前免費開放的 S2.1 Pro 模型，情緒、語速、跨語言口播一次到位

By **設計師 Riven** - 資深數位產品設計師｜知名線上課程講師 | 2026-08-27

AI TOOLS · 2026▲ Fish Audio 官方公告圖：S2.1 Pro 模型以 s2.1-pro-free 的名字開放免費 API，這篇的聲音分身就是接這顆模型QUICK ANSWER AI 聲音分身的做法：打開 Claude Desktop 的 Code 分頁，貼一段 prompt 讓 Claude 生成一個接 Fish Audio API 的本機 Web App，再到 Fish Audio 建一組 API Key 放進 .env.local。App 跑起來後上傳 10 秒自己的錄音，就能建立聲音模型並輸入任何文字生成語音，中英文都能講。用的 s2.1-pro-free 模型目前免費。 CHAPTER 01 · WHAT YOU GET一座跑在你電腦裡的聲音實驗室配音這件事，過去兩年設計師大多交給現成平台：註冊、挑聲音、貼文字、按生成。方便，但你永遠是在別人的介面裡工作，額度按月算，聲音存在別人的帳號裡，想改一個按鈕的位置也沒得改。這篇要做的事反過來。你貼一段 prompt 給 Claude，它幫你把整座聲音實驗室蓋好，跑在你自己電腦的 localhost 上。上傳 10 秒自己的錄音，Fish Audio 會回一組聲音模型 ID，那個 ID 是你的。接下來輸入任何文字，它就用你的聲音念出來，英文也行，情緒和語速還能調。從貼 prompt 到聽見第一句話，整個流程大概一杯咖啡的時間。你不需要會寫程式。你需要的是知道每一步在幹嘛，這樣 Claude 卡住的時候你才接得上話。整篇文章就是照這個邏輯排的：先看流程全貌，再看那段 prompt 為什麼這樣寫，最後一步一步做。WORKFLOW · 從 PROMPT 到聲音分身，六步STEP 01貼 prompt 給 Claude Code描述產品概念、技術架構、API 整合方式STEP 02Claude 蓋好整個 App裝套件、跑起來、自己修錯STEP 03Fish Audio 拿 API Key貼進 .env.local，只放伺服器端STEP 04上傳 10 秒錄音按「複製聲音」，拿到聲音模型 IDSTEP 05輸入台詞生成中文、英文，貼整篇文章也行STEP 06調整、下載情緒、速度、音量，輸出 MP3 或 WAVCHAPTER 02 · WHY FISH AUDIO為什麼接 Fish Audio，而且是現在Fish Audio 是一家做語音模型的公司，S2 這一代的權重是開源的，網站上的聲音庫也很大。真正讓這件事變得值得現在動手的，是它今年六月把最新的 S2.1 Pro 模型以 s2.1-pro-free 這個模型名稱開放免費 API：同一個端點、同一顆模型，定價表上寫的是每百萬 UTF-8 bytes 0 美元，付費版 s2.1-pro 是 15 美元。這顆模型支援 83 種語言，同一個聲音模型可以直接念英文、日文、中文，不用另外訓練。聲音複製只要 10 秒樣本，這是官方的數字。它自己的盲聽測試裡，S2.1 Pro 對前一代 S2 Pro 的勝率是 61%，單一請求的首段音訊延遲大約 70 到 90 毫秒。對做配音的人來說，這些數字翻成白話就是：聲音夠像、等待夠短、換語言不用重來。10 秒聲音樣本就能複製83 種語言共用同一個聲音模型$0免費模型 s2.1-pro-free免費有它的條件，第六章會講清楚。這裡先講一件事：官方部落格的公告把免費期寫到 2026 年 8 月 31 日，但開發者文件已經把 s2.1-pro-free 列成正式的「開發用免費模型」，適合測試、原型和小型專案。也就是說，這不是一個限時活動頁，而是文件裡有名字的東西。會不會延長要看官方公告，動手的時間點越早越好。▲ Fish Audio 官方效能圖：單一請求首段音訊延遲 73.2 毫秒，64 併發時吞吐量 8,006 tok/s。免費之所以撐得住，來自他們重寫的推論架構▲ Fish Audio 官方介紹 S2.1 Pro 的影片，聽一下它的表現力再決定要不要往下做CHAPTER 03 · THE PROMPT那段 prompt 怎麼寫，為什麼這樣寫整個流程最值錢的就是這一段。它決定 Claude 是給你一堆程式碼片段，還是給你一個真的能跑的 App。下面是完整版，可以整段複製，只有「風格」那一句要換成你自己的視覺方向，這是設計師該動手的地方。PROMPT · 貼進 CLAUDE CODE建立一個完整的 Web App，名稱叫做「是誰搶走了我的麥克風」。它是一個帶有像素遊戲風格的個人聲音複製錄音室。不要只提供程式碼片段。請直接建立一個可以實際執行的完整專案：安裝相依套件、執行 App、修正錯誤，並驗證主要工作流程可以正常運作。產品概念這個 App 要讓使用者可以：1. 上傳或拖放自己的聲音錄音2. 預聽上傳的音訊3. 使用 Fish Audio API 建立聲音複製模型4. 儲存並重複使用 Fish Audio 回傳的 voice/model ID5. 輸入任何想讓複製聲音朗讀的文字6. 使用複製後的聲音產生語音7. 預聽產生的音訊8. 微調生成設定後重新產生9. 下載產生的音訊整體體驗應該像是一個小型的「實驗性聲音錄製房」，有像素遊戲的質感。技術架構使用：- Next.js- TypeScript- Tailwind CSS- React- Fish Audio API- 使用 Server-side API Routes 處理 Fish Audio API 請求使用乾淨的元件架構。Fish Audio API Key 只能放在伺服器端。建立 .env.local，內容：FISH_API_KEY=絕對不要把 API Key 暴露在瀏覽器端的程式碼中。Fish Audio 整合請參考目前最新版的 Fish Audio 官方 API 文件。實作兩個主要功能：1. 聲音複製將使用者上傳的音訊樣本傳送到 Fish Audio，並建立一個可重複使用的聲音模型。使用 Fish Audio 的 voice/model creation API。成功建立聲音模型後：- 儲存回傳的 voice/reference ID- 顯示成功狀態- 讓使用者可以立即使用剛建立的聲音進行 TTS如果有幫助，也可以支援多個音訊樣本，但第一版保持簡單。2. Text-to-Speech使用 Fish Audio TTS，並搭配複製聲音的 reference_id。至少支援：- text- reference_id- speed- volume- temperature- top_p- output format請設定合理的預設值。不要自行虛構 Fish Audio 不支援的參數。實作時請參考最新版 Fish Audio 官方 API 文件。主要介面使用單頁式 Layout。介面主要分成三個階段：01 載入聲音：上傳或拖放區、上傳後預聽、「複製聲音」按鈕、顯示回傳的聲音模型 ID02 輸入台詞：文字框、字數統計、「生成語音」按鈕03 調整：情緒、速度、音量、temperature、top_p、輸出格式（MP3／WAV），改完可以重新生成最下方是語音輸出區：播放器、重新生成、下載。每個階段都要有清楚的狀態提示（上傳中、複製中、生成中、完成、錯誤）。看起來很長，其實只有四個區塊，每一塊都在堵一個 AI 寫程式時最常出的問題。PROMPT ANATOMY · 四個區塊各堵一個坑01 · 開場指令「不要只提供程式碼片段」逼 Claude 進入裝套件、執行、修錯、驗證的迴圈，堵掉丟一段 code 就收工的可能。這句話決定了它是助理還是工程師。02 · 產品概念九個動詞，一個氣質用使用者能做的事定義範圍，比功能清單好用得多。最後一句的「聲音錄製房、像素遊戲」給了視覺方向，換成你的品牌語言就是你的東西。03 · 技術架構Key 只能在伺服器端指定 Next.js 的 Server-side API Routes 幫你擋著，瀏覽器看不到 Key。這是之後想把 App 部署上線也不用重寫的關鍵。04 · API 整合「不要自行虛構參數」兩次要求參考最新官方文件，加一句禁止捏造參數。AI 接第三方 API 最常壞在幻想出不存在的欄位，這兩句是保險。「第一版保持簡單」這句也值得留著。Claude 很容易一興奮就幫你加上帳號系統、歷史紀錄、深色模式切換，然後卡在其中一個你根本不需要的功能上。先讓它跑起來，第二版再加。這跟做設計提案的道理一樣：先把核心流程走通，再談裝飾。如果你想把這種寫法變成自己的公式，Claude Code 怎麼做出沒有 AI 感的網站那篇拆過一套四段式的 prompt 結構，跟這裡是同一個思路。CHAPTER 04 · GETTING STARTED六步做完，聽見自己的分身前提有兩個：Claude 的 Pro 或以上方案（Code 分頁只開給付費方案），以及一個 Fish Audio 帳號。其他的 Claude 會處理，包括你電腦上還沒裝的東西，它會告訴你怎麼裝。1打開 Claude Desktop，切到 Code 分頁桌面版有 Chat、Cowork、Code 三個分頁，這次用 Code。選 Local，指定一個新資料夾當專案目錄。還沒裝桌面版的話，Claude Desktop 那篇有三個分頁差在哪的說明；對 Claude Code 本身還陌生的，先看完整教學。2貼上第三章的 prompt，送出接下來幾分鐘 Claude 會建專案、裝套件、寫元件、啟動開發伺服器，中間遇到錯誤會自己修。它需要你按確認的時候會停下來問，看一眼是在裝套件還是在改檔案，再放行。3到 Fish Audio 建一組 API Key登入後進 API Keys 頁面，Create API Key，取個名字，Expiration 選 Never 就好。建好後先把 Key 複製起來。註冊連結放在文末的延伸資源。4把 Key 貼進 .env.localClaude 已經在專案根目錄建好這個檔，裡面只有一行 FISH_API_KEY=，等號後面貼上就存檔。這個檔不會進到瀏覽器，也不該進到 git。改完如果 App 沒反應，跟 Claude 說一聲「重啟開發伺服器」。5打開 localhost，上傳 10 秒錄音，按「複製聲音」Claude 會告訴你網址，通常是 localhost 加一個 port。把一段乾淨的錄音丟進去（WAV、MP3、M4A 都行），預聽確認沒問題，按複製。幾秒後畫面會出現一組聲音模型 ID，那就是 Fish Audio 建好的你。6輸入台詞，生成，播放先打一句「聽起來像我的話就成功了」，按生成。像的話，恭喜；不像的話，八成出在錄音，模型很少是問題，看下面那張卡。錄音怎麼錄，決定像不像10 到 15 秒、安靜的房間、離麥克風一個手掌的距離、用你平常講話的語速念一段完整的句子。不要配樂、不要迴音、不要清喉嚨。手機的語音備忘錄就夠了，重點在乾淨，設備其次。卡住的時候把錯誤訊息整段貼回給 Claude，不用自己看懂。最常見的兩種：port 被佔用（叫它換一個）、API 回 401（Key 貼錯或沒重啟）。Fish Audio 回 402 是餘額或方案問題，去帳號頁看一眼。CHAPTER 05 · IN PRACTICE設計師拿它做什麼最直接的用法是口播。你寫好的腳本，貼進台詞框，一分鐘後就是一段用你聲音念的音檔，剪片的時候先墊進去對節奏，等確定版本再決定要不要自己重錄。做 prototype 展示影片、課程講義的朗讀版、產品 demo 的旁白，全部是同一個動作。跨語言是第二個用法，而且是這顆模型真正拉開差距的地方。把一整篇英文文章貼進去，出來的是你的聲音講英文，腔調自然，不需要另外做一個英文版的聲音模型。給海外客戶的提案影片、英文版的作品集導覽，過去要嘛找人配、要嘛用一個不是你的聲音，現在是你自己。第三個是調整面板。prompt 裡要求的 speed、volume、temperature、top_p 都對應到 Fish Audio TTS API 的真實參數，Claude 會把它們做成滑桿。S2.1 Pro 還支援在文字裡直接放方括號的自然語言指令，像 [whispers] 或 [laughing nervously]，放在句子中間就能在那個位置改變語氣，不限固定選項。TTS PARAMETERS · 調整面板背後的真實參數參數預設調它會發生什麼事reference_id你的模型 ID決定用誰的聲音。換成 Discovery 裡任何一個公開聲線的 ID，就換人講prosody.speed1.0語速倍率。口播 0.9 到 1.1 之間最自然，短影片可以推到 1.2prosody.volume0 dB音量增減。剪輯軟體裡也能調，這裡留 0 就好temperature0.7表現的隨機程度。往下更穩更平，往上更有起伏也更容易走音top_p0.7取樣範圍。跟 temperature 一起動，一次只動一個比較好判斷formatmp3要進剪輯軟體選 wav，分享用 mp3；API 另外支援 pcm 與 opus不想用自己的聲音也行。Fish Audio 網站的 Discovery 頁有一整個社群訓練好的聲線，可以先試聽，選一個把它的模型 ID 填進 reference_id，你的實驗室就換了一個講者。做角色配音、多人對話的 podcast 原型，這條路比自己錄快得多。▲ Fish Audio 官方整理的免費方案對照（2026 年 6 月資料）：它是唯一免費層跑最新模型且含聲音複製的。這是廠商自己做的表，看方向就好，第七章有我的看法CHAPTER 06 · LIMITS免費的條件，和幾件動手前該知道的事s2.1-pro-free 的「免費」是給開發者的免費，附帶條件。官方講得很白：沒有 SLA、沒有延遲保證，請求內容可能被拿去改善模型，年營收超過一百萬美元的產品要先聯絡他們。換句話說，它是給你建、給你測、給你決定要不要付費的地方。你上傳的錄音會經過他們的伺服器，錄客戶的聲音、錄任何你沒有授權的聲音，都不該做。免費期的日期要自己盯。官方部落格最後一次更新寫的是延長到 2026 年 8 月 31 日，文件端則把它列為長期的開發用模型，兩邊說法有落差，以官方公告為準。真的要拿去做正式產品，換成 s2.1-pro，每百萬 UTF-8 bytes 15 美元，官方換算大約 18 萬個英文字或 12 小時的語音，對個人創作者來說是一個很難花完的數字。還有兩件小事。API 的併發上限在還沒付費的階段是 5 個同時請求，個人用完全夠，做成給很多人用的服務就不夠。以及，這個 App 只跑在你電腦上，關掉就沒了；想給別人用要另外部署，prompt 裡把 Key 鎖在伺服器端的設計就是為了這一天，到時候不用重寫。“複製自己的聲音很容易，複製別人的聲音很容易出事。這條線技術不會幫你畫，得你自己畫。CHAPTER 07 · COMPARED TO直接用 ElevenLabs 不就好了？很多時候是的。ElevenLabs 的介面完整、聲音庫成熟、英文品質到現在還是業界的標竿，如果你一個月只配三段旁白，開網頁做完就走，沒必要蓋一座實驗室。它的免費層是每月一萬點數，大約六到十分鐘，之後就是月費。自己蓋的價值在三個地方。第一是量：免費模型沒有硬性的字數上限，整本講義、整季課程的朗讀版都不用看著額度。第二是語言：83 種語言共用一個聲音模型，中英混講的內容不用切平台。第三是控制：介面是你的，參數是你的，聲音模型 ID 是你的，之後要接進自己的工作流、要換成別家的 API，都是改幾行的事。順帶一提，MiniMax Audio 也做到了十秒克隆，同一段 prompt 把 Fish Audio 換掉，Claude 一樣接得起來。直接用現成平台適合偶爾配音的人零設定、介面成熟、英文品質最穩。代價是月費與額度，聲音和資料都在對方的帳號裡。用 Claude 蓋自己的實驗室適合把配音當工作流的人一杯咖啡的設定時間，換來沒有硬上限的免費模型、83 種語言、完全屬於你的介面與聲音 ID。CHAPTER 08 · TAKEAWAYS重點整理TAKEAWAYS✦ 一段 prompt 加一組 API Key，Claude Code 就能蓋出一個跑在本機的聲音複製實驗室，不用會寫程式。✦ Fish Audio 的 s2.1-pro-free 是最新模型的免費版：10 秒樣本複製、83 種語言、每百萬 bytes 0 美元，條件是沒有 SLA、資料可能被用來訓練。✦ prompt 裡最重要的四句：不要只給程式碼片段、Key 只能在伺服器端、不要虛構參數、第一版保持簡單。✦ 像不像八成取決於錄音：10 到 15 秒、安靜、乾淨、平常的語速。✦ 只複製自己的聲音或有授權的聲音。免費期日期以官方公告為準，正式產品換 s2.1-pro。這件事真正有意思的地方在聲音之外：一個設計師現在可以用一段中文描述，換到一個以前要找工程師排兩週的工具，而且介面長什麼樣、按鈕放哪裡、狀態怎麼提示，全部是自己決定的。配音只是第一個藉口。你手上每一個「要是有個小工具就好了」的念頭，現在都值得拿同一套寫法再試一次。RELATED READS · 延伸閱讀Claude Code 怎麼做出沒有 AI 感的網站？三步驟把 AI 調教成懂品味的設計師品味庫、skill 與 MCP、永不 one-shot，四段式 prompt 公式跟這篇是同一個思路→ElevenLabs 怎麼用？10 分鐘做出第一段 AI 配音的完整教學不想自己蓋實驗室的話，現成平台的五步驟與常見錯誤在這→MiniMax Audio 是什麼？Speech 2.8 語音模型完整介紹與設計師實戰另一顆十秒克隆、中日雙語的語音模型，同一段 prompt 換掉 API 就能接→Claude Code 設計師完整指南：Agentic Loop、CLAUDE.md、五大功能與實戰場景想懂 Claude 為什麼會自己裝套件、跑測試、修錯，從 Agentic Loop 開始看→繁中影片自動上字幕用什麼？What'Sub 的斷句、FCPXML 與定價完整解析口播做好了，下一步是字幕，這篇接著看→ChatGPT Live 是什麼？GPT-Live 全雙工語音、跟 Advanced 差在哪、設計師怎麼用語音 AI 的另一條線：即時對話而不是配音，設計語音介面前先看這篇→Claude Academy 是什麼？Anthropic 官方免費學習平台的課程地圖與設計師攻略Claude Code 的官方課程全部免費，想把這套寫法練熟從這裡開始→EXTRA · LINKS · 延伸資源 ✦ Fish Audio 註冊（我的推薦連結，用這個註冊對你價格一樣） ✦ API Keys 管理頁（登入後建立、查看用量） ✦ 模型總覽文件、定價與併發上限 ✦ Create Model API 文件（聲音複製那一段的來源） ✦ S2.1 Pro 免費 API 官方公告（免費期最新日期看這篇） ✦ Discovery 聲音庫（不想用自己聲音時來這挑） ✦ Claude Code 官方頁SUBSCRIPTIONAI 覺醒設計應用攻略AI 工具每週都在更新，我幫你過濾雜訊，只留對設計師真正有用的應用。了解訂閱 →FAQ常見問題Q：不會寫程式也做得出來嗎？A：可以。整個專案由 Claude Code 建立、安裝、執行、修錯，你負責貼 prompt、貼 API Key、上傳錄音。卡住時把錯誤訊息整段貼回給 Claude 就好。需要的是 Claude 的付費方案（Pro 以上才有 Code 分頁）跟一個 Fish Audio 帳號。Q：Fish Audio 的聲音複製真的免費嗎？A：用 s2.1-pro-free 這個模型名稱呼叫 API，定價表上是每百萬 UTF-8 bytes 0 美元，聲音複製也包含在內，條件是 Fair Use、沒有 SLA、請求可能被用來改善模型。官方部落格最後一次公告的免費期是到 2026 年 8 月 31 日，文件則把它列為長期的開發用免費模型，最新狀態以官方為準。Q：要錄多長的聲音？用手機錄可以嗎？A：官方說 10 秒就夠，實務上 10 到 15 秒最穩。手機語音備忘錄可以，重點是安靜的環境、沒有配樂與迴音、用平常講話的語速念完整的句子。錄音品質對相似度的影響遠大於設備。Q：複製出來的聲音可以講英文或日文嗎？A：可以。S2.1 Pro 支援 83 種語言，同一個聲音模型直接念不同語言，不用另外訓練，語言會自動偵測。把一整篇英文文章貼進台詞框，出來就是你的聲音講英文。Q：可以複製別人的聲音嗎？商用可以嗎？A：只複製自己的聲音，或拿到明確授權的聲音。免費模型在部分商業情境有限制，年營收超過一百萬美元的產品要先聯絡 Fish Audio；正式產品建議換付費的 s2.1-pro，每百萬 UTF-8 bytes 15 美元，並詳讀他們的服務條款。Q：不想用自己的聲音，有現成的聲線可以用嗎？A：有。Fish Audio 的 Discovery 頁有大量社群訓練好的公開聲線，試聽後把它的模型 ID 填進 reference_id 就能在你的實驗室裡使用，適合角色配音或多人對話的原型。Q：這個 App 可以給別人用嗎？A：預設只跑在你自己的電腦上。要分享得另外部署，因為 prompt 把 API Key 鎖在伺服器端的 API Routes，部署時不用重寫；但免費模型的併發上限只有 5 個同時請求，多人使用要評估換付費方案。
