AI 影片模型現在誰最強?MiniMax H3 開源權重、原生音軌與 2K 的真實成本

海螺三代把架構整套重寫,畫面與立體聲一次生成,五個評測項目全是開源第一
設計師 Riven

設計師 Riven

2026年8月24日 上午 10:30

AI 設計

AI VIDEO MODELS · 2026

MiniMax H3 官方主視覺,紫色水母背景搭配 MiniMax H3 字標與副標 Next-Generation Open-Weights General-Purpose Multimodal Video Model

▲ MiniMax 為 H3 發布所用的官方主視覺,副標直接把定位寫死:開源權重、通用型、多模態影片模型。

QUICK ANSWER

MiniMax H3 是海螺團隊 2026 年 7 月 31 日發布的全模態影片生成模型,能一次生出 5 到 15 秒、最高 2K、帶原生立體聲的影片,一次可餵 12 個參考素材。它是目前開源權重陣營的第一名,但真正的 2K 必須走雲端 API,本地跑只到 768p。

CHAPTER 01 · WHAT IS IT

海螺換了名字,也換了骨架

這一個月台灣創作者圈最常被丟進群組的影片連結,幾乎都掛著同一個模型名字。MiniMax H3 在七月底上線,八月初把權重丟上 Hugging Face,然後在獨立評測榜上把影片編輯這個項目的第一名拿走了——而且是開源模型第一次做到這件事。

先把名字理清楚,因為市面上四種叫法在混用。官方名是 MiniMax H3,API 的 model 字串寫作 MiniMax-H3;社群叫它海螺 3.0 或 Hailuo 03;至於 MiniMax M3,那是同一家公司的文字與 agent 模型,跟影片完全無關。MiniMax 這個名字對台灣設計圈其實不陌生——我自己做課程配音就長期在用他們的 Speech 2.8 語音模型,只是這次他們把手伸進了影片。

LINEAGE · HAILUO 01 → H3

Hailuo 01

從零把系統搭起來

第一代,先證明整條生成鏈路走得通。

Hailuo 02

效率與資料品質

補架構效率、資料品質與規模,畫質站穩。

H3 · 2026/07

任務邊界被拆掉

生成、編輯、聲音收進同一顆模型,架構整套重寫。

官方講得很白:H3 的第一原則是把任務統一掉。過去影片生成被切成文生影、圖生影、首尾幀、主體參考、動作參考、聲音參考、影片編輯一堆分開的專家模型,聲音那邊又切成人聲、音效、音樂三攤。H3 把這些邊界全部拿掉,改用自然語言去描述「參考素材跟目標畫面的關係」,模型自己去理解。他們甚至放棄了 Hailuo 02 那套曾經帶來優勢的架構,理由是它對「任務泛化」這個目標來說太複雜。

▲ 官方在權重上架當天釋出的公開發布影片。

CHAPTER 02 · WHY IT MATTERS

聲音不是後製,是跟畫面一起長出來的

這是 H3 最該被理解的一件事,也是最容易被規格表淹掉的一件事。過去所有「有聲音」的 AI 影片,本質上都是先生一段沒聲音的畫面,再疊一層配音或音效上去。H3 不是這樣:人聲、音效、音樂跟畫面在同一次前向運算裡一起被生出來,輸出就是一支帶立體聲的 MP4。

差別在哪?在對嘴、在腳步聲落地的那一幀、在門關上跟砰一聲之間那零點幾秒。後疊音軌的做法永遠要跟時間軸打架,一次生成則從根本上不存在這個問題。做過任何一支需要對聲畫的影片的人,會立刻知道這省掉的是哪一種痛苦。

海螺 AI 官方 MiniMax H3 產品頁截圖,標題寫著 Native Multimodal Video Generation and Editing,下方三張功能卡分別是原生多模態理解、彈性多素材參考、角色動作鏡頭與聲音參考

▲ 官方產品頁把能力切成三塊:把文字、圖、影片、聲音收進同一個創作脈絡;一次最多 12 個參考檔;角色、動作、鏡頭、聲音都能從素材裡抽出來沿用。

第二件對設計師更直接的事,是文字渲染。官方把「精準的文字與品牌元素渲染」寫進主打能力,ComfyUI 的說明文件也單獨列了這一條。這代表片頭字卡、產品標語、介面上的按鈕文字、動態海報上的標題字,有機會直接由模型生出來而不是糊成一團偽字母——過去兩年這件事幾乎是所有影片模型的共同弱點。

影片模型從「生一段素材」,走到「參與整條內容產製」,中間卡住的一直不是畫質,是它聽不懂你在講哪一段素材跟哪一段的關係。

CHAPTER 03 · HOW IT WORKS

三段式架構,開源的只有中間那段

這是整篇最需要看清楚的一張圖。很多報導把 H3 講成「開源的 2K 影片模型」,實際上 H3 是三個模組串起來的系統,MiniMax 只放了中間那顆。

STAGE 01 · 雲端

H3-Context-IR

把你丟進去的自由格式素材——文字、圖、影片片段、音檔——解析成模型讀得懂的結構化中介表示。官方說這一段的源素材推理量大約 10 萬 token,最後濃縮成平均 4 千 token。未開源。

STAGE 02 · 可本地部署

H3-Base(33B)

真正的生成引擎。三顆編碼器分別處理語意、視覺、聲音,四路 token 打包進同一條序列,由 50 層單流骨幹一起去噪,再由對應的解碼器還原成畫素與波形——聲畫同步就是這樣天生成立的。這一段開源。

STAGE 03 · 雲端

H3-Regenerate-2K

不是傳統超解析度,而是讓 H3 自己把低解析輸出重新生成一次,過程中再看一次原始素材脈絡。差別在小字與細節:一般放大只能猜,重新生成是真的還原。未開源。

所以本地跑 H3 的真實情況是:在 ComfyUI 裡,原生畫布是短邊 768、16:9 換算 1344×768。要拿到官方主打的 2K,還是得回頭呼叫兩次雲端 API。這不是缺陷,是他們把最貴的兩段留在手上——但你在規劃工作流之前必須知道。

CHAPTER 04 · THE LEADERBOARD

開源第一名,總榜第二名

33B

PARAMS

2K

24 FPS

12

REFERENCES

4.4M

DOWNLOADS / MO

Artificial Analysis 用盲測投票跑 Elo,把影片模型拆成六個榜——文生影、圖生影、影片編輯,每一類再分有聲音跟沒聲音。這個切法很囉唆,但它防止了「贏了一個窄項目就宣稱世界第一」這種話術。H3 現在的位置是這樣:

ARENA
總榜名次
開源權重
影片編輯
第 1
✦ 第 1
文生影(無聲)
第 2
✦ 第 1
文生影(有聲)
第 3
✦ 第 1
圖生影(無聲)
第 2
✦ 第 1
圖生影(有聲)
第 2
✦ 第 1

結論很清楚:五個項目 H3 全部是開源陣營第一,而且不是險勝,跟第二名的差距普遍在一到兩百 Elo。總榜上壓在它頭上的主要是 Google 的 Gemini Omni Flash,另外圖生影有聲那一項被 字節的 Seedance 系列 擋在前面。一個能下載回自己機器的模型跟這兩家貼身肉搏,這件事本身就夠稀奇了。

Hugging Face 上 MiniMaxAI slash MiniMax-H3 模型頁截圖,顯示 33B params、上月下載 4,465,161 次、授權為 minimax-h3-community-license-agreement,以及多個影片生成任務標籤

▲ Hugging Face 模型頁上的三個關鍵數字:33B 參數、上個月 446 萬次下載、授權掛的是 MiniMax 自訂的社群授權而不是 MIT 或 Apache。最後那一項是本篇後面要展開的地雷。

CHAPTER 05 · THE REAL COST

2K 一秒兩塊台幣,但別只看這個數字

官方的隨用隨付牌價是 2K 每秒約 0.13 美元,768p 更便宜。換算成台幣大約是一秒四塊、一支十五秒的完整片段兩塊多美金。MiniMax 自己的說法是這個價位在 2K 上不到主流模型的三分之一。

片長
USD
約合 NTD
5 秒(社群短片)
$0.65
約 20 元
10 秒(產品鏡頭)
$1.30
約 40 元
15 秒(滿版)
$1.95
約 60 元

三個會讓帳單失控的變數,牌價表不會告訴你。第一,參考影片是按它自己的長度另外計費的——你丟一段三秒的動作參考去生五秒成品,帳單算八秒。參考圖跟參考音檔不另外收,這點還算佛。第二,重試不會退錢,而影片生成的重試率天生比文字高。第三,各家轉售平台的加價幅度差很大,同一顆模型從每秒 0.13 到 0.26 美元都有人開,下單前務必看當天那一頁的 rate card,不要憑記憶。

CHAPTER 06 · IN PRACTICE

設計師會真的用到的四個場景

1

動態海報與字體動畫

文字渲染準是這個場景成立的前提。過去要做一張會動的主視覺,字得自己在 After Effects 排;現在可以先讓模型生一版氛圍,再決定字要不要自己補。它適合探索方向,不適合直接交件。

2

產品網站的 hero 影片

十五秒、2K、帶環境音,正好是一段 landing page 頂部循環影片的規格。以前這種素材要嘛買圖庫、要嘛真的去拍,現在多了第三條路——而且六十塊台幣就能試錯一次。

3

介面動效的概念稿

拿來跟 PM 溝通「我想要的感覺大概長這樣」很有效,比口頭描述快十倍。但要落到能交付的實作,還是回 Rive 或 Figma Motion 那條線——生成影片給不了狀態機跟互動觸發。

4

既有素材的局部改寫

換掉畫面裡的產品、改一句招牌上的字、把白天打成夜晚、加一個原本沒有的物件——改動落在你指定的地方,其餘畫面維持不動。這是 H3 拿下影片編輯第一名的那項能力,也是它跟其他 AI 影片平台 分野最大的地方。

提示詞的寫法跟圖像模型很不一樣。官方的建議是先講整場戲——場景、角色、發生什麼事,再拆成有時間順序的分鏡,並且把鏡頭運動跟聲音(對白、音效、配樂)寫在同一段裡。提示詞上限七千字元,一整份分鏡表塞得進去。這比較像在寫拍攝腳本,不像在下關鍵字。

CHAPTER 07 · LIMITS

授權寫明了排除四個地區,台灣不在名單裡

這是整件事最需要講清楚的一段,也是英文圈吵最兇的一段。MiniMax H3 掛的社群授權在條款裡定義了「適用地區」,並且明確把美國、歐盟、英國、南韓排除在外——這四個地方的使用者沒有被授權在自己的機器上跑這份權重,連輸出的產物也一併受限。雲端 API 不受影響,各地都連得到。

對台灣讀者的意思

台灣不在排除清單上。也就是說在台灣,雲端 API 跟本地部署兩條路都是開的——這在這一波開源影片模型裡是相對舒服的位置。歐美同行現在只能羨慕地看著 ComfyUI 的教學文。

為什麼要這樣切?MiniMax 官方在模型頁的問答區給的理由是影片生成面對的監管環境比文字或程式模型複雜得多,歐盟 AI 法案已經開始執行,英國跟南韓的規範也還在動,涉及肖像生成、著作權、內容安全的部分尤其不確定。至於美國,他們的開發者關係負責人公開講過,那是因為迪士尼、環球、華納三家片廠對海螺平台提起的著作權訴訟——法院在五月駁回了 MiniMax 的撤案動議,案子還在進行。四個地區的團隊仍然可以走正式授權程序個別申請。

另外三件實務上的限制。本地部署要 ComfyUI 0.30.0 以上,模板庫裡有文生影、圖生影、參考生影三套現成工作流,但完整的 Hugging Face 倉庫接近 500GB,官方參考配置用四張 GPU;ComfyUI 提供了剪枝量化過的版本讓小機器跑得動,代價是品質與速度都會打折。片長硬上限十五秒,時長還會對齊模型的 17 幀區塊,所以你要的秒數不一定拿得到剛好的數字。最後,2K 這條路目前繞不開雲端——想完全離線又想要 2K,現在做不到。

CHAPTER 08 · TAKEAWAYS

那到底誰最強

如果問的是純畫質天花板,Gemini Omni Flash 還在前面。如果問的是「我能拿回家、能改、能接進自己流程的最強一顆」,現在沒有第二個答案。而如果你要的是改一支已經拍好的片子——換產品、改字、換光線——H3 是唯一一顆在這個項目上贏過所有閉源模型的模型,包括那些你以為遙不可及的名字。

更值得注意的是節奏。海螺 01 到 02 花了整整一代在追畫質,02 到 H3 卻是把架構整套推翻重寫,換來的是任務邊界消失。這個方向如果走得通,下一代影片模型的競爭點就不會是「誰的畫面比較漂亮」,而是「誰比較聽得懂你在說什麼」——那對設計師來說是好消息,因為講清楚自己要什麼,本來就是我們的專業。

TAKEAWAYS

聲畫一次生成,不是後疊音軌。對嘴、腳步聲、環境音天生同步,這是 H3 最實際的價值。

開源的只有中間那顆 33B 生成引擎。本地跑得到 768p,2K 一定要回頭呼叫雲端。

五個評測項目全是開源第一,總榜第二到第三。它是唯一在影片編輯上贏過所有閉源模型的開源模型。

2K 每秒約 0.13 美元,十五秒滿版約六十元台幣。參考影片另外計費、重試不退費,這兩條會咬預算。

授權排除美國、歐盟、英國、南韓的本地部署,台灣不在名單內,兩條路都能走。

RELATED READS

延伸閱讀

EXTRA · LINKS

官方資源

MiniMax 官方發布文:設計哲學與核心技術的第一手說明。

海螺 AI 線上試用:不想碰程式的話從這裡開始,新帳號有免費點數。

Hugging Face 模型頁:權重下載與完整授權條款,跑本地之前先讀。

ComfyUI 官方教學:三套原生工作流與提示詞寫法。

Artificial Analysis 影片榜:排名每天在動,看最新的請直接去現場。

FAQ

常見問題

Q:MiniMax H3 跟海螺 3.0、Hailuo 03 是同一個東西嗎?

是。官方名稱是 MiniMax H3,API 的 model 字串寫 MiniMax-H3;海螺 3.0 與 Hailuo 03 是社群與部分轉售平台在用的別名。要小心的是 MiniMax M3——那是同一家公司的文字與 agent 模型,跟影片無關。

Q:台灣可以合法下載並在自己電腦上跑 H3 嗎?

可以。社群授權排除的是美國、歐盟、英國、南韓四個地區的本地部署,台灣不在排除名單內。雲端 API 則是全球都能呼叫,包含那四個地區。

Q:本地跑 H3 能生出 2K 嗎?

不能。開源的只有中間那顆 33B 生成引擎,前面的素材解析模組與後面的 2K 重生成模組都留在雲端。ComfyUI 的原生畫布是短邊 768,16:9 換算 1344×768。想要 2K 就得回頭呼叫官方 API。

Q:H3 的聲音需要另外生成或另外付費嗎?

都不用。對白、音效、環境音跟畫面在同一次運算裡一起產生,輸出直接是帶立體聲的 MP4,沒有獨立的音訊呼叫,也沒有關閉的開關。

Q:一次可以餵多少參考素材?

最多 9 張圖、3 段影片、3 段音檔,總計 12 個檔案。影片與音檔各自單檔 2 到 15 秒。提示詞上限 7000 字元,一整份分鏡表塞得下。

Q:拿它做商業案子,成本大概怎麼抓?

官方牌價 2K 每秒約 0.13 美元,十五秒滿版約 1.95 美元。要記得參考影片會按自己的長度另外計入秒數,重試也不退費,所以實際預算抓牌價的一點五到兩倍比較安全。各家轉售平台加價幅度差很大,下單前看當天的價目表。

Q:H3 適合直接做成交付給客戶的成品嗎?

看用途。產品網站的 hero 循環影片、社群短片、動態海報這類十五秒內、不需要精確控制每一幀的素材,已經可以直接用。需要精準對齊品牌規範、需要互動狀態、或需要超過十五秒連貫敘事的,還是回傳統流程比較快。