Kimi K3 是什麼?前端設計評測拿下第一的開源模型,設計師實用指南

2.8 兆參數、100 萬 Token、權重全開——但它真正改變的不是你的電腦,是你的帳單
設計師 Riven

設計師 Riven

2026年7月26日 下午 7:14

AI 設計

AI TOOLS · 2026

Kimi K3 官方主視覺,Moonshot AI 於 2026 年 7 月推出的 2.8 兆參數開放權重模型

▲ Kimi K3 官方主視覺。圖片來源:Moonshot AI

QUICK ANSWER

Kimi K3 是 Moonshot AI 在 2026 年 7 月 16 日推出的旗艦模型,2.8 兆參數、100 萬 token 上下文、原生看得懂圖與影片。它發表當天就在 Frontend Code Arena 盲測從第 18 名跳到第 1,並在七個設計相關子項裡贏下六項。設計師該關心的不是它的參數量,是它把「風格還原」這件事變成了一次 API 呼叫。

我寫這段的時候,瀏覽器開著 Moonshot 在 Hugging Face 的頁面,最上面那筆還是六月那版 Kimi K2.7 Code。K3 的權重照官方公告會在台灣時間 7 月 27 日早上八點前落地——也就是這篇文章上線前後的幾個小時。

一個 2.8 兆參數的模型,要把權重公開放出來給任何人下載。這件事在半年前還不存在於任何人的行事曆上。

而設計圈這幾天在傳的,其實不是那個數字。是一張盲測排行榜。

它到底是什麼

CHAPTER 01 · WHAT IS IT

Kimi K3 是北京團隊 Moonshot AI 的第三代旗艦模型,7 月 16 日在上海世界人工智慧大會亮相,同一天就上線 kimi.com、Kimi Work 桌面版、Kimi Code 終端機工具與 API。

規格上有三個數字值得記:2.8 兆總參數,讓它成為目前公開發布過最大的開放權重模型;100 萬 token 的上下文,大約能一次吞下一個中型專案的完整程式碼;原生多模態,文字、圖片、影片走的是同一顆模型,不是外掛一個視覺模組。

2.8T

總參數

1M

上下文 TOKEN

16/896

啟動專家數

1679

前端盲測 ELO

要先把一個詞講清楚:開放權重不等於開源。Moonshot 會放出訓練好的參數檔,你可以下載、微調、自己架服務;但訓練資料與完整訓練流程不會公開。這在合規上是兩件事,實務上則是——你拿到的是成品,不是配方。

設計師該關心的那張榜

CHAPTER 02 · WHY IT MATTERS

Arena 的 Frontend Code Arena 是這樣運作的:同一道題丟給兩個匿名模型,使用者看完兩邊的成品投票,投完才揭曉是誰做的。品牌濾鏡在這裡是失效的。

K3 上榜當天拿到 1679 分,直接第一,把 Claude Fable 5 的 1631 與 GPT-5.6 Sol 的 1618 都壓下去。相較前一代 Kimi K2.6 的第 18 名,這是一次十七個名次的跳躍。

但真正該看的是子項拆分。前端組共七個領域,K3 拿下六個第一:品牌與行銷、參照設計還原、資料與分析、消費性產品、模擬互動、內容創作工具。唯一輸掉的是遊戲,第二名,輸給 Fable 5。

Kimi K3 官方公布的跨模型評測對照圖,比較 K3 與 Claude Fable 5、GPT-5.6 Sol 等模型在編碼與代理任務上的表現

▲ 官方公布的跨模型評測對照。這是廠商自評,Arena 與 Artificial Analysis 的第三方數據才是交叉驗證用的。圖片來源:Moonshot AI

「品牌與行銷」「參照設計還原」這兩項,恰好是設計師最常丟給 AI 的活。參照設計還原白話講就是:給它一張你喜歡的參考圖,要它做出那個調性的東西。

另一個獨立評測 Design Arena 的前端網頁應用組,K3 同樣第一,Elo 1326,領先 Fable 5 與 Claude Sonnet 5。簡報生成組它排第三,落後 Fable 5 但贏過 Sonnet 5 與 Opus 4.8。

審美判斷這件事,第一次在盲測裡被一個開放模型贏走了。

它是怎麼做到的

CHAPTER 03 · HOW IT WORKS

Moonshot 的說法是三個結構性改動,合起來讓 K3 的規模效率比 K2 好上約 2.5 倍。意思是同樣的算力,換到更多的能力。

01 / KDA

Kimi Delta Attention

用線性注意力取代部分傳統的二次方注意力。官方數字是百萬 token 長上下文下,解碼最快提升到 6.3 倍。

02 / AttnRes

Attention Residuals

讓深層網路挑著取用前面各層的表徵,而不是一律累加。訓練效率約提升 25%,額外成本低於 2%。

03 / LatentMoE

Stable LatentMoE

896 個專家裡每次只啟動 16 個,啟動率約 1.8%。稀疏到這個程度,路由本身就變成一個研究題目。

用設計的話講:他們沒有把引擎做大,是把油路重排。K3 的總參數是 2.8 兆,但每個 token 實際跑過的運算量遠遠小於那個數字——這也是為什麼它能在這個尺寸下還維持一個能看的價格。

怎麼開始用

CHAPTER 04 · GETTING STARTED

四個入口,難度由低到高。

網頁與手機 App

kimi.com 有免費層,每天給你一定額度。iOS、Android、鴻蒙都有 App。想先摸摸手感,從這裡開始就好。

Kimi Work 桌面版

要 3.1.0 以上版本,Windows 與 Apple silicon Mac 都支援。這一版新增了 Widgets 與 Dashboard,可以把常用的互動元件釘在同一個面板上持續更新。

Kimi Code 終端機

在終端機裡跑,用 /model 指令切到 K3。官方特別提醒:K3 對思考歷程的完整性很敏感,別在一個對話進行到一半的時候切模型過來,品質會很不穩。

API

platform.kimi.ai,模型代號 kimi-k3,OpenAI 相容端點,換個 base URL 就能接。價格是每百萬 token:快取命中 0.3 美元、未命中 3 美元、輸出 15 美元。

目前狀態提醒

7 月 19 日 Moonshot 宣布暫停新的消費者訂閱——上線 48 小時內,需求就把 GPU 用到接近容量上限。官方說法是優先保障既有訂閱者的體驗,之後分批開放名額。所以你現在可能買不到方案,這不是網站壞了。

設計師實際能拿它做什麼

CHAPTER 05 · IN PRACTICE

四個我認為最值得先試的場景。

一次成型的落地頁

100 萬 token 的上下文改變了餵資料的方式。以前你得精挑細選塞進去,現在可以把整套元件庫、設計 token、樣式規範一起丟,加一張參考圖,直接要它出完整的站。這跟 Claude Design 那類「一句話做互動網頁」的工具是同一個賽道,差別在 K3 能吃下的脈絡更大。

視覺在迴圈裡

官方叫它 vision in the loop:它會截自己產出的畫面,看完再改。前端調版最煩的就是「文字描述說不清楚哪裡歪了」,模型自己看得到之後,這個來回會短很多。

Kimi K3 官方展示案例,示範模型從概念與參考素材生成互動內容與視覺成品的能力

▲ 官方展示的 K3 生成案例。圖片來源:Moonshot AI

簡報與資訊圖表

Kimi 的 Slides 功能可以上傳視覺參考,讓它照那個風格排版。官方展示裡有可編輯的熱力圖與年報版型。在 Design Arena 的簡報生成組它拿第三,這個名次代表堪用但不是最強——當初稿工具剛好。

長流程的自動化

K3 的訓練重心放在「跑很久的任務」。官方案例裡它自己剪了自己的宣傳片,從 56 段素材裡選片、對拍點、處理音軌、改了好幾輪。這個思路跟 Loop Engineering 講的是同一件事:與其一句一句下指令,不如把整個任務跟驗收標準交出去。

設計師的 K3 上手順序

1

丟一張參考圖,要它還原成可運作的頁面

2

把整套元件庫餵進去,看它認不認得你的規範

3

同一份 brief 也丟給你原本的模型,比成品

4

算清楚每個成品的實際 token 花費再決定

先講清楚它的問題

CHAPTER 06 · LIMITS

榜單好看不代表沒有代價。有四件事必須先知道。

幻覺率偏高。Artificial Analysis 的獨立測量把 K3 的幻覺率標在約 51%,前一代 K2.6 是 39%。它答對的題目比上一代多,同時編造的答案也更多、而且講得更有自信。這個數字沒有出現在官方的評測圖表裡。

它會自作主張。官方在限制章節自己寫了 excessive proactiveness——訓練重心放在長流程任務的副作用是,遇到指令模糊或小問題時,它會替你做決定。想讓它守規矩,得在系統提示或設定檔裡把邊界寫死。這件事跟 Harness Engineering 的思路直接相關。

慢,而且話多。輸出速度約每秒 32 個 token,在同價位模型裡偏慢;首字延遲也高。加上它預設用最高強度的思考模式,完成同一件事消耗的輸出 token 大約是 GPT-5.6 Sol 的 1.9 倍。一句「你好」都可能燒掉一疊推理 token。

官方自己承認體感落後。Moonshot 在發表文的最後一段寫得很白:整體來說 K3 很有競爭力,但在使用體驗上跟 Claude Fable 5 與 GPT-5.6 Sol 相比仍有明顯落差。這句話出現在自家發表文裡,值得記住。

實務結論

自作主張這件事,做視覺原型時是優點,做交付規格時是災難。前者你要它幫你補完想像,後者你要它閉嘴照做。這兩種任務不該用同一組設定。而任何牽涉到事實、數據、法規的內容,51% 這個數字就是你的紅線。

跟現有的模型怎麼分工

CHAPTER 07 · COMPARED TO

不用選邊站。三個模型各有各明顯的甜蜜點。

KIMI K3

參照風格還原、一次成型的前端視覺、需要一次吞下大量脈絡的長任務。實測每個任務成本約 0.94 美元,在前沿級模型裡最便宜。

CLAUDE FABLE 5

長文件、品牌語氣一致性、需要準確度的內容,以及遊戲類互動。體感與指令服從度目前仍是最穩的一檔。

GPT-5.6 SOL

已經住在 ChatGPT 與 Codex 生態裡的人,切換成本大於效能差距。軟體工程類基準上它與 Fable 5 互有勝負。

價格上的參考點:同樣一批真實工作負載,K3 每任務約 0.94 美元,GPT-5.6 Sol 約 1.04 美元,Claude Opus 4.8 約 1.80 美元。但別忘了 K3 的輸出 token 用量大,短任務的帳單可能沒有這個比例好看。

開放權重真正改變的是什麼

CHAPTER 08 · TAKEAWAYS

社群這幾天最大的誤會,是把「開放權重」讀成「我可以自己跑一個」。

跑不動。這個模型的權重檔約 1.4 TB,官方建議的部署規格是 64 顆以上的加速器組成的超級節點。你的 MacBook、你的 4090、你的 Mac Studio,全部不在討論範圍內。

對絕大多數設計師來說,開放權重不是「你可以自己跑」,是「別人會幫你跑得更便宜」。

當一個前沿等級的模型變成任何雲端商都能架起來的商品,價格就會被重新定價。這才是 7 月 27 日這個日期的重量——它不是給你一份能下載的檔案,它是在對每一家還在收月費的公司施壓。Moonshot 自己 48 小時就把 GPU 燒到暫停賣訂閱,開放權重對他們同時也是解方,不是慈善。

但我覺得更值得放在心上的,是 Frontend Arena 那六個第一裡的兩個名字:品牌與行銷、參照設計還原。

在設計圈待了快十年,我看過幾次「這個工具會取代設計師」的循環。這次不太一樣的地方在於,被贏走的不是執行速度,是那個我們一直以為很難外包的東西——風格判斷。一張參考圖進去,一個像樣的東西出來,中間那段以前叫做品味的距離,被壓縮成一次 API 呼叫。

所以該問的不是「AI 會不會做設計」。該問的是:當風格還原變成商品,我手上還剩什麼是別人買不到的。答案通常不在軟體技巧裡,在你怎麼定義問題、怎麼跟人吵出對的方向、怎麼判斷哪個版本才是對的那個。

工具排行榜三個月換一輪。這個問題不會。

延伸閱讀

RELATED READS

Claude Fable 5 怎麼用?設計師的四個實戰工作流與 Brief 模板

拿來跟 K3 做同一份 brief 的對照組,最直接。

閱讀 →

Claude Opus 5 是什麼?跑分、Effort 旋鈕與設計師的實際用法

想理解「思考強度」怎麼影響帳單,看這篇。

閱讀 →

設計師可以用 Codex 做什麼?Codex × Figma 雙向工作流完整解析

設計檔與程式碼互轉的另一條路線。

閱讀 →

Harness Engineering 實戰:怎麼幫 AI 蓋一個不會重複犯錯的工作環境

治 K3 那個「自作主張」毛病的方法論。

閱讀 →

Claude 能拿來做什麼?官方 90 個 Use Cases 一次看懂

先確認你的任務屬於哪一類,再決定丟給誰。

閱讀 →

Spline Omma 是什麼?一句話生成 3D 網站與互動體驗的 AI canvas

另一個把「描述」直接變成互動成品的工具。

閱讀 →

官方資源

EXTRA · LINKS

官方技術部落格:kimi.com/blog/kimi-k3
API 平台與定價:platform.kimi.ai
權重釋出位置:huggingface.co/moonshotai
官方發表影片:Meet Kimi K3

▲ Moonshot AI 官方發表影片〈Meet Kimi K3〉

常見問題

Q:Kimi K3 免費嗎?

A:kimi.com 與手機 App 有免費層,附每日使用額度,足夠評估手感。付費方案在 7 月 19 日因為 GPU 容量吃緊暫停開放新訂閱,之後分批釋出名額。API 則是照用量計費,不受訂閱暫停影響。

Q:可以下載到自己電腦跑嗎?

A:實務上不行。權重檔約 1.4 TB,官方建議部署在 64 顆以上加速器的超級節點上。消費級顯示卡與 Mac Studio 都載不動,即使量化過也一樣。等社群做出量化版本再看,但那會是另一個東西了。

Q:權重什麼時候釋出?授權條款是什麼?

A:官方公告是 2026 年 7 月 27 日前釋出,位置在 Moonshot 的 Hugging Face 組織頁。授權普遍預期會延續前幾代的 Modified MIT 系列,但正式條款要等檔案落地才算數。要拿來做商業產品,請直接讀那個 repo 裡的授權檔,不要引用任何轉述。

Q:Kimi K3 跟 Claude Fable 5 哪個好?

A:看任務。前端一次成型的視覺與參照風格還原,K3 在盲測裡目前領先;長文件、品牌語氣一致性、指令服從度與整體使用體驗,Fable 5 仍然比較穩,這點連 Moonshot 自己都在發表文裡寫明。最實際的做法是同一份 brief 兩邊都跑一次,比成品也比帳單。

Q:51% 的幻覺率是什麼意思?

A:這是 Artificial Analysis 在事實型問答基準上獨立測到的數字,代表它在不確定的時候傾向硬給答案而不是說不知道,比例高於前一代的 39%。用在視覺生成、程式碼、原型製作上影響不大,因為成品會自己證明對錯;用在需要引用數據、法規、歷史事實的內容上,每一句都要查證。

Q:設計師該先試哪個功能?

A:從參照設計還原開始。丟一張你欣賞的頁面截圖,要它做出同樣調性但內容換成你的專案。這是它在盲測裡拿第一的項目,也最快看得出跟你現有工具的差距。

Q:為什麼說它「話很多」?

A:K3 上線時預設用最高強度的思考模式,低強度與高強度選項要之後版本才開放。完成同樣任務它消耗的輸出 token 大約是 GPT-5.6 Sol 的 1.9 倍。輸出每百萬 token 收 15 美元,長任務跑起來要留意帳單。