Claude Opus 5 是什麼?跑分、Effort 旋鈕與設計師的實際用法
AI TOOLS · 2026
QUICK ANSWER
Claude Opus 5 是 Anthropic 在 7 月 24 日推出的新一代旗艦模型,官方定位是「接近 Fable 5 的前沿智慧,一半的價格」。每百萬 token 輸入 5 美元、輸出 25 美元,與前一代 Opus 4.8 同價。它現在是 Claude Max 的預設模型、Pro 方案裡最強的選項,最大的變化是會主動驗證自己的產出,並且能調整 effort 檔位在品質與 token 消耗之間換算。
昨天深夜,Anthropic 官方帳號丟出一則貼文,只有一句話:Introducing Claude Opus 5。半個科技圈還在消化上個月 Fable 5 那場出口管制風波,新的旗艦就已經上線了。
這次的敘事跟前幾代不太一樣。過去 Anthropic 發模型,比較的對象是別家實驗室;這一次,它拿來對照的是自己最貴的那顆。官方原話是「接近 Fable 5 的前沿智慧,一半的價格」——把自家頂規當成標竿,說服你不需要買那麼貴的。
我花了一個早上把官方公告、系統卡摘要與早期合作夥伴的實測講法讀完。以下是我認為對設計師、對每天要跟模型工作的人真正有意義的部分。
CHAPTER 01 · WHAT IS IT
它在整個家族裡站哪個位置
先把整條產品線攤開。Anthropic 目前的模型分成四個等級:最上面是 Mythos,只開放給少數受信任的組織;接著是 Fable,最強的公開模型;再來是 Opus,日常主力;然後是 Sonnet 與 Haiku。Opus 5 就是 Opus 這一階的第五代,接替今年五月底上線的 Opus 4.8。
官方給它的定位很直白:designed to be used every day。這句話的重量在後半段——不是拿來炫技的旗艦,是拿來每天開工的那顆。它現在是 Claude Max 的預設模型,也是 Pro 方案裡能選到的最強選項。如果你之前看過我寫的 Opus 4.8 那篇拆解,會發現這次的敘事線是連著的:4.8 學會說「我不確定」,5 則學會了「我再檢查一次」。
43.3%
FRONTIER-BENCH
$5 / $25
PER MTOK
2.30
MISALIGNMENT
2.5×
FAST MODE
CHAPTER 02 · THE PRICE MOVE
價格沒動,能力跳了一階
這代最值得記住的一組數字,是 Frontier-Bench v0.1 上的三個分數。Opus 4.8 拿 18.7%,Fable 5 拿 33.7%,Opus 5 拿 43.3%。同一條線上,新的日常模型不只翻倍超越自己的前代,還越過了那顆貴一倍的頂規。
FRONTIER-BENCH v0.1 · 軟體工程任務
Opus 4.8 18.7%
Fable 5 33.7%
Opus 5 43.3%
資料來源:Anthropic 官方公告。Fable 5 定價為每百萬 token 輸入 10 美元、輸出 50 美元,Opus 5 為 5 美元與 25 美元。
除了程式任務之外,官方也點了幾個知識工作的評測。ARC-AGI 3 這種要解沒看過的新問題的測試,Opus 5 的分數是次高模型的三倍;Zapier AutomationBench 這類「從頭到尾把一件商業任務做完」的評測,它的通過率大約是同成本次高模型的 1.5 倍,而且就算把 effort 調到最低檔,通過的題數還是比任何其他模型多。電腦操作的 OSWorld 2.0 上,它用大約三分之一的成本超過了 Fable 5 的最佳成績。
數字很漂亮,但真正該注意的是它們共同的形狀:所有的比較都被折算成「每一塊錢買到多少」。這是一次刻意的敘事轉向。過去兩年模型發表會比的是天花板,今年開始比的是單位成本。
當一家公司開始拿自己最貴的產品當對照組,代表市場的問題已經從「做得到嗎」變成「划得來嗎」。
CHAPTER 03 · IT CHECKS ITS OWN WORK
它開始自己驗貨
跑分只是入場券。這代讓我覺得工作方式會被改變的,是官方講的另一件事:Opus 5 明顯更會驗證自己的成果,並且會反覆修到成功為止。
官方舉了一個相當極端的例子。Frontier-Bench 裡有一道題,給模型一張機械零件的工程圖,要它寫程式把零件重建成 3D 模型;但這道題刻意設計成模型沒有任何方法可以直接「看見」那張圖。Opus 5 的解法是自己寫了一套電腦視覺流程,從原始像素裡把幾何資訊撈出來,然後重建出完整的零件。同樣的設定下,其他模型試五次都沒解出來。
另一個離設計師更近的說法來自早期測試的前端團隊:他們的評測裡,Opus 5 做完頁面之後會自己在瀏覽器裡用桌機和手機兩種寬度打開來看,抓到一個在手機上被摺線壓掉的商品、以及一顆跑到畫面外的結帳按鈕,兩個都修好才把工作交回來。
這件事的份量,做過設計交付的人都懂。以前用模型產前端,你拿到的是一份「看起來對」的程式碼,實際渲染出來破不破版要自己開瀏覽器抓。現在這一段被收進模型自己的迴圈裡了。Artifacts 這類即時預覽的功能之所以好用,靠的正是這種「產出到驗證」的距離縮短。
還有一則早期回饋我特別喜歡:某位工程師說,在一次重構討論裡,Opus 5 對他提出的設計提出反對,而且在他堅持之後沒有立刻讓步。它先講清楚原本提案裡有價值的部分,把反對意見收斂到單一一個設計問題上,然後提出一個折衷方案。會頂嘴的模型才值得信任——一個永遠說好的協作者,你不敢把判斷交給它。
CHAPTER 04 · THE EFFORT DIAL
Effort 旋鈕:這代最被低估的設計
Opus 5 內建一個可以調的 effort 檔位。你可以讓它想久一點、想深一點,也可以叫它別想太多、快點給答案。官方的圖表全部都以這個檔位為橫軸,等於是明說:這不是隱藏設定,是你該學會用的旋鈕。
最有說服力的數據來自一家法律 AI 公司的實測。他們發現 Opus 5 在較低的推理檔位就能維持跟 Opus 4.8 開到最高推理時相同的產出品質,而平均少燒 26% 的 token。另一家做金融模型的團隊給的數字更誇張:跨各檔位平均準確率高了 9 個百分點,同時少了三分之一的來回與工具呼叫、整體時間少了六成。
另外還有一個 Fast 模式,速度約為預設的 2.5 倍,代價是兩倍的基礎價格。急件用得上。
對訂閱制使用者來說,這個旋鈕的意義是額度管理。同樣一份額度,你可以把它花在十次高檔位的深度任務,也可以花在五十次低檔位的雜事。我之前整理過 額度該怎麼分配才划算,那套邏輯在 Opus 5 上會更明顯:真正的成本控制點不在你問幾次,而在你讓它想多深。
CHAPTER 05 · FOR DESIGNERS
設計師這週可以拿它做什麼
我不想給你一份罐頭清單。以下三件事,是我看完官方說法之後判斷「這代真的變好、值得馬上換過去做」的。
一、把切版交出去,連檢查一起交
以前你交出一份設計稿讓模型寫成頁面,回來要自己開三種寬度檢查。現在可以在 brief 裡直接把驗收標準寫進去:桌機 1440、平板 768、手機 390 三種寬度都要檢查,摺線以上必須看得到主要商品與行動按鈕。它會自己跑一遍再交件。驗收標準寫得越具體,這代的提升越有感。
二、簡報與長文件的第二輪修改
早期測試裡有個團隊專門提到,Opus 5 最大的進步出現在「長週期」的工作上——做完一整份簡報之後再回頭改。視覺理解更好、格式更乾淨、投影片出錯的次數變少。這正好是多數人用 AI 做簡報最痛的環節:第一版都還行,改到第三版就開始崩版。
三、把 effort 當成專案排程工具
重新命名圖層、整理素材、寫 alt text 這種雜事,開低檔位就好。要它從一份粗略的 brief 推導出資訊架構、或是在一堆使用者回饋裡找出真正的問題,才把檔位拉高。以前這種取捨要靠換模型,現在同一顆模型內部就能調。
CHAPTER 06 · LIMITS
它不擅長什麼,以及那條安全線
第一件事:Opus 5 不是為了最長的自主任務設計的。官方自己說,如果你要跑好幾天的長時程專案,Fable 5 仍然是比較強的選擇。日常工作用 Opus 5,重砲留給 Fable。想理解 Fable 那一階的能力邊界,可以看 Fable 5 的完整解析。
第二件事是安全設計,這部分官方講得比往常仔細。Anthropic 說他們刻意沒有拿資安任務訓練 Opus 5,但模型因為整體能力提升,在「找出軟體漏洞」這件事上已經逼近 Mythos 5;不過在「把漏洞變成可用的攻擊」上,它仍然遠遠落後。這個落差是刻意留的。
實際使用上會遇到的表現是:Opus 5 的資安分類器允許它讀原始碼找漏洞,但擋掉二進位掃描、滲透測試與漏洞利用程式的產生。官方預期這套分類器觸發的頻率會比 Fable 5 少約 85%。在 Claude 網頁版、Claude Code 與 Cowork 裡,被標記的請求預設會退回 Opus 4.8 處理。
對齊的部分,官方的自動化行為稽核給 Opus 5 的整體偏差行為分數是 2.3,是近期模型裡最低的一顆,低於 Opus 4.8、Sonnet 5 與 Fable 5。欺瞞行為的比率最低,也最不容易被誘導去做壞事。對每天把工作丟給模型的人來說,這個數字比跑分更值得看——你要的是一個不會為了交差而虛構結果的協作者。
CHAPTER 07 · COMPARED TO
四顆模型,你到底該用哪一顆
OPUS 5
每天開工的那一顆
程式、知識工作、代理任務。Max 的預設、Pro 的最強選項。會自己驗貨、能調 effort。
FABLE 5
跑好幾天的長專案
價格是 Opus 5 的兩倍。要交給它的是那種你會離開電腦前的任務。
SONNET 5
量大、要快、成本敏感
高頻率的代理工作、批次處理、日常對話。夠聰明而且便宜很多。
MYTHOS 5
你大概碰不到
最前沿的那一階,只開放給少數受信任的組織,資安與生物研究能力仍是最強。
一個實用的判斷法:如果你會在任務跑的時候離開電腦超過一小時,考慮 Fable 5;如果你會坐在旁邊看它做、隨時回話,Opus 5 就是現在最划算的選擇。想看模型實際跑起來的樣子,Anthropic 上個月為 Fable 5 拍的介紹影片仍然是理解這一代能力邊界最快的方式:
▲ Anthropic 官方 Fable 5 介紹影片。Opus 5 的定位正是以這一階為對照組
CHAPTER 08 · TAKEAWAYS
這一代真正的訊號
把所有數字放下之後,Opus 5 留給我的印象只有一句話:模型開始學會替自己收尾。
過去兩年,我們用 AI 的流程長這樣——給指令、拿產出、自己檢查、抓錯、再給指令。真正吃掉時間的從來不是第一步,是中間那三步。Opus 5 把「自己檢查、抓錯、再修一次」收進了模型內部。這代表你的角色會再往上移一格:從審稿的人,變成定義驗收標準的人。
所以這週開始,我建議你改的不是模型選單,是 brief 的寫法。把你原本會在心裡默默檢查的那幾條標準,明明白白寫進去。這代模型會真的去跑。
RELATED READS · 延伸閱讀
Claude Opus 4.8 是什麼?跑分、誠實升級與設計師的實際用法
上一代的完整拆解,對照著看能看出這條產品線的思路。
閱讀 →Claude Fable 5 是什麼?最強公開模型完整解析與設計師應用指南
Opus 5 這次的對照組,能力邊界在哪裡一次看懂。
閱讀 →Claude Fable 5 怎麼用?設計師的四個實戰工作流與 Brief 模板
Brief 模板可以直接搬到 Opus 5 上用,把驗收標準寫進去效果更好。
閱讀 →Claude Code Artifacts 開放 Pro/Max 了嗎?設計師該怎麼用
一段對話變成一頁 live 網頁,配上會自己驗貨的模型更有威力。
閱讀 →Claude Desktop 是什麼?三個分頁、跟網頁版差在哪
要讓模型碰到本機檔案,桌面版是門檻最低的入口。
閱讀 →Claude 能拿來做什麼?官方 90 個 Use Cases,設計師先看這 5 個
真正該抄的是這些案例共用的那份 brief 結構。
閱讀 →EXTRA · LINKS
常見問題
Q:Claude Opus 5 什麼時候發布的?
A:2026 年 7 月 24 日,在所有平台同步上線,包含 Claude 網頁版、API、Claude Code 與 Cowork。
Q:Opus 5 的價格是多少?比 Opus 4.8 貴嗎?
A:每百萬 token 輸入 5 美元、輸出 25 美元,跟 Opus 4.8 完全一樣。Fast 模式速度約 2.5 倍,價格為基礎價的兩倍。
Q:Opus 5 比 Fable 5 強嗎?
A:在程式與知識工作的評測上,Opus 5 的表現超過 Fable 5,而且只要一半的價格。但如果任務是跑好幾天的長時程自主專案,官方仍然建議用 Fable 5;資安任務上 Mythos 5 也仍然領先。
Q:訂閱 Pro 方案可以用到 Opus 5 嗎?
A:可以。Opus 5 是 Pro 方案裡能選到的最強模型,在 Max 方案則是預設模型。
Q:effort 檔位要怎麼用才划算?
A:雜務型任務開低檔、需要判斷與推理的任務開高檔。早期測試顯示,Opus 5 在較低檔位就能達到前一代開到最高推理的品質,平均少用約 26% 的 token。
Q:為什麼有時候我的請求會被轉給其他模型?
A:Opus 5 的安全分類器在偵測到特定的資安類請求時,會把該次請求退回給 Opus 4.8 處理,介面上會有訊息提示。官方預期這類觸發的頻率比 Fable 5 少約 85%。
Q:設計師換到 Opus 5 之後,工作方式該怎麼調整?
A:把驗收標準寫進 brief。這代模型會自己檢查產出、抓錯再修,你的工作重心從審稿移到定義標準——標準寫得越具體,拿回來的東西越完整。








