---
title: "ChatGPT Live 是什麼？GPT-Live 全雙工語音、跟 Advanced 差在哪、設計師怎麼用"
slug: chatgpt-live-gpt-live-guide
url: https://rar.design/posts/chatgpt-live-gpt-live-guide
published_at: 2026-07-11
modified_at: 2026-07-12
author: "設計師 Riven"
category: "AI 設計"
access: public_access
---

# ChatGPT Live 是什麼？GPT-Live 全雙工語音、跟 Advanced 差在哪、設計師怎麼用

> AI 第一次學會邊聽邊講——全雙工架構、後台委派，與設計師該從中偷走的東西

By **設計師 Riven** - 資深數位產品設計師｜知名線上課程講師 | 2026-07-11

AI TOOLS · VOICE · 2026▲ OpenAI 於 2026 年 7 月 8 日發表 GPT-Live，這是 ChatGPT Voice 背後的新一代語音模型。圖片來源：OpenAIQUICK ANSWERChatGPT Live 是 OpenAI 在 2026 年 7 月 8 日推出的全新語音體驗，由 GPT-Live-1 與 GPT-Live-1 mini 兩個全雙工語音模型驅動。它能一邊聽一邊講、被你打斷、在你思考時安靜等待；遇到需要查資料或推理的問題，會把工作交給背景的 GPT-5.5，一邊跟你聊天一邊把答案帶回來。它已全球上線 iOS、Android 與網頁版，在 ChatGPT 的「設定 → Voice」裡叫做 Live。CONTENTS01Live 是一個選項，不是一個新 App02被拆掉的那個東西，叫回合制03兩個架構改動，其中一個設計師該偷04三個 Voice 選項怎麼選05設計師的三個實際用法06它現在還做不到什麼07跑分之外，那個沒人提的產品債CHAPTER 01 · WHAT IS ITLive 是一個選項，不是一個新 App很多人這幾天在找「ChatGPT Live 在哪下載」。答案是：哪裡都不用下載。把 App 更新到最新版，進設定翻到 Voice，你會看到三個並排的選項——Live、Advanced、Standard。Live 就是新來的那個。它背後是 OpenAI 7 月 8 日發表的新一代語音模型 GPT-Live，分成兩個版本：付費方案（Go、Plus、Pro）預設吃 GPT-Live-1，免費用戶吃 GPT-Live-1 mini。iOS、Android、ChatGPT.com 網頁版全球同步推送，免費仔也有份。官方在發表文裡丟了一個數字：每週有超過一億五千萬人在用 ChatGPT 的語音與聽寫功能。這個數字比多數人想的大很多，也解釋了為什麼 OpenAI 願意把一整條研究線押在「講話」這件事上。語音不是實驗場，它已經是 ChatGPT 的第二個主介面。150M+WEEKLY VOICE USERS9REMASTERED VOICES3INTELLIGENCE LEVELS▲ Live 的三個核心：一邊聽一邊回應、理解停頓與插話、需要搜尋時在背景完成再把結果帶回對話。RAR 製圖CHAPTER 02 · WHY IT MATTERS被拆掉的那個東西，叫回合制從 1966 年的 ELIZA 到上週的 ChatGPT，所有對話介面都建立在同一條規則上：你講完，我才開始想。這條規則太理所當然，以至於六十年來沒人把它當成一個設計決策。它看起來像物理定律。它不是定律，它是一個約束。而 OpenAI 這次很誠實地把這個約束的代價寫出來了：舊的 Advanced Voice Mode 判斷「你講完了沒」，靠的是偵測靜音。所以你只要停頓一下組織句子，或者旁邊有人講話、有車經過，模型就以為輪到它了，然後插嘴在最莫名其妙的地方。用過的人都知道那種感覺：你必須用一種平常不會用的方式講話。句子要完整、語速要穩、不能猶豫。你在配合機器的節奏，而不是它配合你。全雙工架構把這件事翻過來。GPT-Live 一邊處理輸入一邊產生輸出，一秒鐘之內可以做很多次決策：現在該講話、該繼續聽、該停下、該插話、還是該去呼叫工具。它不再等你講完，它在「聽的同時」就一直在判斷。▲ 一句話講完這次的改動：從「回合式問答」變成「連續式互動」。RAR 製圖"語音只是它的載體。真正被動到的，是對話介面的底層文法。這就是為什麼我覺得設計師不該把這則消息歸類成「語音升級」。回合制不只存在於語音裡。你打字問 AI、按下 Enter、看著游標閃、等它吐字——那也是回合制。當回合制在語音端先被拆掉，文字端的那個等待迴圈也就開始鬆動了。我們花了十年設計「等待」：spinner、skeleton screen、進度條、樂觀更新。那整套感知效能的手法，前提都是「使用者在等」。如果對面根本不會讓你進入等待狀態呢？CHAPTER 03 · HOW IT WORKS兩個架構改動，其中一個設計師該偷OpenAI 說 GPT-Live 只做了兩件事。第一件是上面講的連續互動。第二件比較低調，但我認為它才是這次真正有遷移價值的東西。VOICE ARCHITECTURE · 三代演進GEN 01 · 串接式三個模型接力語音轉文字 → 大語言模型 → 文字轉語音。慢、頓、資訊在轉手間流失→GEN 02 · 回合制單一模型，仍分回合延遲降低，但要靠靜音判斷「你講完了沒」，容易誤判插嘴→GEN 03 · 全雙工邊聽邊講，連續決策一秒內多次判斷：講、聽、停、插話、叫工具委派：前台負責在場，後台負責思考第二個改動是，OpenAI 把「跟你互動」跟「幫你思考」拆成兩個模型。GPT-Live 負責前台，它反應快、聲音自然、擅長維持對話流。當你問的問題需要搜尋、需要推理、需要動用代理能力，它會把任務丟給後台的 GPT-5.5，然後——關鍵在這裡——它不會沉默。它繼續跟你講話，直到後台把答案送回來，再自然地接回對話裡。這個模式對設計師來說應該很眼熟。你按下愛心，數字立刻 +1，伺服器其實還沒回應。你點開列表，骨架先鋪好，資料慢慢填。這叫樂觀更新、叫骨架畫面、叫感知效能。我們在前端做了十年。KEY INSIGHT感知效能從此不只是前端的事。GPT-Live 把「先給回應、後補內容」這個十年前的介面手法，寫進了模型架構本身。PRODUCT ANATOMY · CHATGPT LIVEFRONT · 前台互動GPT-Live-1 / mini全雙工，負責聽、講、判斷節奏、維持在場感BACK · 後台委派GPT-5.5接手搜尋、推理、代理任務。前台不必停下等它VOICES · 九種聲線全部重新混音Arbor、Breeze、Cove、Ember、Juniper、Maple、Sol、Spruce、ValeDEPTH · 思考檔位Instant / Medium / High自己決定它要想多久。想越久，回得越慢那句「嗯嗯」是設計，不是彩蛋官方特別強調 GPT-Live 會在你講話時發出「mhmm」「got it」這種附和音。技術上這叫 backchannel，語言學家研究了幾十年。它本身不傳遞任何資訊——你把那句「嗯嗯」刪掉，句意一個字都沒少。它的功能是證明對面還在。這件事跟 loading spinner 在做的是同一件事，但方向相反：spinner 說的是「系統正在忙」，附和音說的是「我正在聽你講」。前者的主詞是機器，後者的主詞是你。這個差別，正是「工具感」跟「在場感」的分界線。哪一個更難做，看過去二十年的介面史就知道了。CHAPTER 04 · GETTING STARTED三個 Voice 選項怎麼選設定 → Voice 底下現在有三個選項，各自有存在的理由。Live 是新的預設，但它不是全能的，該退回 Advanced 的時候要退。▲ 切到 Live 的路徑就這四步。要視訊或螢幕分享，記得切回 Advanced。RAR 製圖CAPABILITYLiveAdvancedStandard邊聽邊講（全雙工）✦——視訊 / 畫面共享—✦—畫面卡片回應✦——思考檔位可調✦——什麼時候用日常對話、出聲思考要給它看畫面時要一份逐字稿時▲ 切過去之後的實際對話流程。安靜環境下辨識最穩，講話清楚它接得越準。RAR 製圖幾個容易被漏掉的設定。第一，Intelligence 有三檔：Instant 求快，Medium 跟 High 讓它多想一下。想越久回越慢，尤其在需要上網搜尋的時候，這個代價是實打實的。第二，九個聲音全部重新混過音，官方連個性都標好了——Cove 沉穩直接、Vale 明亮好奇、Sol 老練放鬆。挑聲音這件事比多數人以為的重要，因為你要跟它講很久的話。第三，也是我覺得最被低估的一個：你可以在對話一開始就對它說「等我叫你再回答」。它會真的閉嘴聽你講。這個指令幾乎是專門為「出聲思考」設計的，下一章會講怎麼用。CHAPTER 05 · IN PRACTICE設計師的三個實際用法語音工具最常見的失敗，是被拿去做本來打字就能做的事。真正值得換到語音的，是那些「打字會殺掉思考節奏」的場景。▲ 最吃全雙工紅利的三種情境。共同點都是「打字會殺掉思考節奏」的那類事。RAR 製圖1對著自己的稿講話開會前先自己講一遍設計決策。講到哪裡開始結巴、哪裡需要補三句話才講得通，那就是你的稿還沒站穩的地方。以前用小黃鴨，現在小黃鴨會回話——而且不會在你停頓組織句子時搶著接。2預演那場會被打斷的會議真實的需求討論不是輪流發言，是互相插話。全雙工第一次讓你可以練這件事：讓它扮演會插你話的 PM，你在被打斷的時候還能不能把重點講完。這是回合制模型做不到的訓練。3通勤時把腦袋清空背景對話模式可以讓它在你鎖屏、切到別的 App 時繼續聽。走路、開車、洗碗的時候把腦中那團還沒成形的東西講出來，它會一邊聽一邊幫你查、幫你整理。CarPlay 也支援。另外一個變化，是語音介面第一次長出了畫面。你在講話的同時，ChatGPT 會推出天氣、股價、賽事、地圖這類視覺卡片。純聽覺介面有個老問題：有些資訊用聽的效率低到荒謬——「附近有七間酒吧，第一間在往北三百公尺⋯⋯」沒有人想聽完。▲ Live 能做的四件事。最後那項「混合文字與圖片」，就是下面兩張視覺卡片的來源。RAR 製圖▲ 講話的同時，天氣資訊以視覺卡片呈現。語音跟畫面不再是二選一。圖片來源：OpenAI▲ 地圖類的資訊用聽的效率極差，這種時候畫面卡片才是對的答案。圖片來源：OpenAI這是一個很值得記下來的設計判斷：不是所有東西都該說出來。真正成熟的多模態介面，會知道哪些內容該用講的、哪些該用看的。這個取捨在設計師的 AI 判斷地圖裡是同一種能力：知道什麼該交出去，什麼該留著。▲ OpenAI 官方示範影片：新版 ChatGPT Voice 的實際對話節奏CHAPTER 06 · LIMITS它現在還做不到什麼Live 上線第一天的限制清單，比多數報導寫的長。最直接的一條：它不支援視訊跟畫面共享。想把設計稿舉到鏡頭前問它意見，你得手動切回 Advanced。對設計師來說這相當諷刺——最自然的語音模式，剛好缺了最視覺的那個能力。再來是它現在不在哪些地方：桌面 App 沒有、臨時對話沒有、Codex 沒有、自訂 GPTs 沒有，連 ChatGPT Work 都沒有。企業版、商業版、教育版的工作空間也全部排除在外。如果你的公司是用企業帳號，你現在完全碰不到 Live。它也不是會議工具。官方明講它是為一對一設計的，多人同時講話還沒優化——它甚至可能在你跟同事講話時插嘴。想拿它當會議記錄員的，先冷靜。語言這條要特別提。OpenAI 說他們針對 ChatGPT 上最熱門的幾種語言做了優化，其他語言「可能會有非母語腔調或流暢度落差」。中文使用者要有心理準備。如果你要的是穩定可控的中文語音輸出，ElevenLabs 跟 MiniMax Audio 那條路目前還是更可靠——那是配音，這是對話，兩件事。最後兩個細節：對話結束後留在聊天記錄裡的逐字稿不是真正的逐字稿，講話重疊或有背景噪音時它會失真；語音檔會跟著對話記錄保存 30 天，除非你主動開啟分享，否則不會拿去訓練模型。CHAPTER 07 · COMPARED TO跑分之外，那個沒人提的產品債官方的人類評測結果很漂亮：在五到十分鐘的對話裡，GPT-Live-1 跟 mini 版都被受試者大幅偏好，勝過 Advanced Voice Mode——不管是整體喜好、輪流節奏、插話處理還是對話流暢度。但另外三個跑分要小心讀。GPQA（專家級科學推理）、BrowseComp（找難查的資料）、τ³-Voice Telecom（多輪客服任務）——GPT-Live-1 全部大勝 Advanced。問題是，這三個分數量的是「後台變聰明了」，不是「講話變自然了」。真正做事的是背景那顆 GPT-5.5 / 5.6 世代模型。兩件事被打包在同一場發表裡，看的時候要拆開。BEFORE · ADVANCED等你講完靠靜音判斷回合，停頓＝被插嘴→AFTER · LIVE邊聽邊想一秒多次決策，停頓＝它等你真正有意思的，是這次發表裡一個沒人拿出來講的事實：OpenAI 一次端出三個 Voice 模式，而且它們同時活著。Live 是新旗艦，但它不能視訊、不能共享畫面，所以 Advanced 得留著。Standard 又因為有些人要那份先轉文字再回應的可預測性，也得留著。一家把「簡潔」寫進 DNA 的公司，最後在設定裡放了一個三選一的下拉選單。任何做過產品的人看到這裡都會會心一笑：功能對等債（feature parity debt）是真的。你沒辦法把舊流程收掉，因為舊流程還有它獨有的三件事沒被新流程接住。Apple 今年在 Siri 上的處境其實一模一樣。連 OpenAI 都收不掉舊模式的時候，你大概也可以放過自己那個「還沒 sunset 的舊版設定頁」。CHAPTER 08 · TAKEAWAYS該記住的四件事TAKEAWAYS→全雙工拆掉的是「回合制」，而回合制不只活在語音裡。文字介面那個「送出 → 等待 → 收到」的迴圈，是下一個要被動的東西。→委派架構把感知效能寫進了模型層。前台先在場、後台慢慢想——這是設計師做了十年的樂觀更新，現在成了模型的內建行為。→語音介面開始長出畫面。「哪些資訊該用聽的、哪些該用看的」會是接下來幾年很值錢的一個設計判斷。→先去把「等我叫你再回答」這個指令試一遍。它比任何跑分都更能讓你感覺到，這一代跟上一代到底差在哪。我對這次發表最大的感想，其實跟語音沒什麼關係。過去三年，AI 進步的敘事幾乎都是「它變聰明了」——分數更高、上下文更長、幻覺更少。這次 OpenAI 花了大力氣做的，是讓一個本來就夠聰明的模型，學會怎麼「在場」。學會什麼時候該閉嘴，學會在對方停頓的時候不要急著填滿空白，學會用一聲沒有內容的「嗯」告訴你它還在。這些能力在人類世界裡有個名字，叫做教養。它跟智商是兩回事，而且通常更難教。當整個產業還在比誰的分數高的時候，有人開始比誰比較會聽人講話——這個轉向，對做介面的人來說值得多想幾天。RELATED READS · 延伸閱讀ChatGPT Work 是什麼？GPT-5.6 上線、能做什麼、跟 Claude Cowork 差在哪同一週發表的另一顆重磅，OpenAI 把代理能力直接推進工作場景。閱讀文章 →Claude Cowork 怎麼用？新手入門完整教學與設計師實戰另一條路線的代理工具，跟 ChatGPT 這邊放在一起看差異最清楚。閱讀文章 →ElevenLabs 怎麼用？10 分鐘做出第一段 AI 配音的完整教學要做的是配音而不是對話時，這條路目前還是最穩的。閱讀文章 →設計師可以用 Codex 做什麼？Codex × Figma 雙向工作流完整解析OpenAI 生態裡設計師最該搞懂的另一個工具。閱讀文章 →Claude Opus 4.8 是什麼？跑分、誠實升級與設計師的實際用法另一家的旗艦怎麼看跑分這件事，對照著讀很有意思。閱讀文章 →AI 會取代 UI/UX 設計師嗎？2026 想轉職的人，問題從來不在這每次有這種發表就會被問一次，這篇是我的完整回答。閱讀文章 →EXTRA · OFFICIAL LINKS· OpenAI 官方發表文：Introducing GPT-Live· 官方說明中心（含九個聲音、設定路徑、資料保留）：ChatGPT Voice· 安全系統卡：GPT-Live System Card· 開發者：GPT-Live API 尚未開放，OpenAI 提供了通知登記表單。現階段要做語音代理，仍是走 Realtime API。SUBSCRIPTIONAI 覺醒設計應用攻略AI 工具每週都在更新，我幫你過濾雜訊，只留對設計師真正有用的應用。了解訂閱 →常見問題Q：ChatGPT Live 要另外下載嗎？A：不用。把 ChatGPT App 更新到最新版，進「設定 → Voice」就會看到 Live 選項。網頁版 ChatGPT.com 也支援。它是既有 App 裡的一個語音模式，不是獨立產品。Q：免費用戶可以用 ChatGPT Live 嗎？A：可以。免費方案預設使用 GPT-Live-1 mini，Go、Plus、Pro 等付費方案使用完整版 GPT-Live-1。免費版的推送較慢，實際可用時間依地區與 App 版本而定。Q：ChatGPT Live 跟 Advanced Voice Mode 差在哪？A：核心差別是全雙工。Advanced 必須等你講完才開始回應，靠偵測靜音判斷回合，所以停頓或背景噪音容易讓它誤判插嘴。Live 可以一邊聽一邊講，也能在你思考時安靜等待。但 Live 目前不支援視訊與畫面共享，這兩個功能只有 Advanced 有。Q：ChatGPT Live 的中文表現如何？A：OpenAI 表示只針對 ChatGPT 上最熱門的幾種語言做過優化，其他語言可能出現非母語腔調或流暢度落差，中文使用者要有心理準備。如果需求是穩定的中文語音輸出，專門的語音合成工具目前仍然更可靠。Q：可以叫 ChatGPT Live 先聽我講完再回答嗎？A：可以。在對話一開始就告訴它「等我叫你再回答」，它會保持安靜聽你講。這是出聲思考時最實用的指令。不過長時間停頓、背景人聲或其他聲音仍有可能觸發它回應。Q：ChatGPT Live 能用在企業版帳號嗎？A：上線初期不行。Business、Enterprise、Edu 工作空間都不在支援範圍內，桌面 App、臨時對話、Codex、自訂 GPTs 與 ChatGPT Work 也都尚未支援。企業帳號使用者只能繼續使用 Advanced 或 Standard。Q：語音對話的錄音會被拿去訓練模型嗎？A：預設不會。語音檔會跟著對話記錄保存 30 天，除非你在資料控制設定裡主動開啟「分享錄音」選項，否則不會用於模型訓練。刪除對話時，關聯的語音檔也會在 30 天內一併刪除。
