RAR 設計攻略
  • 線上課程
  • 專欄文章
  • AI 覺醒
  • 關於講師
客服信箱:riven@rar.design

© 2026 RAR 設計攻略 All Rights Reserved.欸嗚欸嗚欸欸嗚嗚嗚喔喔有限公司.統一編號: 90841757
使用者條款.隱私權政策
Made with ♥ by 無為教育科技股份有限公司.Teachify
Developer and agent API documentationSite content index for AI agents (llms.txt)API documentation (OpenAPI)API authentication guide
  1. 首頁
  2. 文章列表
  3. GPT‑6 Astra 強在哪?三個 benchmark 打滿,OpenAI 最想講的卻是那個 0%

GPT‑6 Astra 強在哪?三個 benchmark 打滿,OpenAI 最想講的卻是那個 0%

從七月那場模型越獄事件,到電腦操作快兩倍的新旗艦——設計師視角的完整解析
設計師 Riven

設計師 Riven

2026年9月5日 下午 4:31

AI 設計

AI MODEL · 2026

OpenAI GPT-6 Astra 發布影片片場:一張 Eames 椅面對一整面牆的投影畫面

▲ GPT‑6 Astra 發布影片的片場——一個人、一張椅子、一面牆大的畫面。這個構圖本身就是一顆彩蛋,第四章會講。

QUICK ANSWER

GPT‑6 Astra 是 OpenAI 於 2026 年 9 月 3 日(美國時間)發布的旗艦模型:FrontierMath Tier 4 拿下 98%、ARC‑AGI‑3 拿下 99.9%、ExploitBench 滿分,電腦操作速度比上一代快近兩倍;在越權行為測試中,從上一代的 48% 降到 0%。目前已陸續開放給 ChatGPT 付費用戶與 API。

CONTENTS

01

這週發生了什麼

02

把考卷寫完,是什麼概念

03

那個 0%,是用一場事故換來的

04

發布影片裡那段 1980 年的老片

05

設計師拿它做什麼

06

怎麼用、多少錢

07

重點整理與觀點

CHAPTER 01 · THE ANNOUNCEMENT

這週發生了什麼

這週半個科技圈都在傳同一支影片。畫面裡沒有跑分圖表、沒有主題演講,只有一個人,坐在一張 Eames 椅上,面對一面牆那麼大的畫面,開口說話。

影片的主角是 GPT‑6 Astra——OpenAI 的新旗艦,官方給它的定位是「世界上最聰明、也最對齊的模型」。9 月 3 日先向少數合作組織開放預覽,這幾天陸續推送給 ChatGPT Plus、Pro、Business 與 Enterprise 用戶,API、Azure 跟 AWS Bedrock 也同步上架。

▲ OpenAI 官方 Instagram 的發布影片,這篇文章就是從它開始的。

整份發布文拆開來,其實就三件事:考卷寫完了、電腦操作快了近一倍、然後——這是最不尋常的一件——「對齊」被放到了標題的位置。以往那是排在 demo 後面的一頁投影片,這次它跟「最聰明」並列,變成產品名字的一部分。

為什麼一家以跑分聞名的公司,突然把「聽話」當成賣點?答案藏在今年七月的一場事故裡。我們一章一章看。

CHAPTER 02 · THE NUMBERS

把考卷寫完,是什麼概念

先看數字。這次的關鍵字是「飽和」(saturate)——考卷被寫到接近滿分,題目不夠用了。

98%

FRONTIERMATH T4

99.9%

ARC-AGI-3

100%

EXPLOITBENCH

FrontierMath Tier 4 是數學家出給 AI 的最難題組,Astra 拿 98%,過程中甚至協助解開了幾個懸置多年的數學開放問題。ARC‑AGI‑3 測的是在陌生環境裡摸索規則的能力,Astra 拿 99.9%,主辦方自己出來說,它在 96% 的關卡達到人類等級的行動效率——白話講,它不只解得出來,而且解得跟人一樣省步驟。ExploitBench 則是資安攻防題組,直接滿分。

另外兩個對日常更有感的數字:官方說 Astra 是至今最強的軟體工程模型,而 ChatGPT 的電腦操作速度比上一代快了近兩倍。OpenAI 總裁 Greg Brockman 甚至放話,回頭看,這一代可能會被視為 AGI 到來的那個節點。

跑分新聞看多了會麻痺,我懂。但「飽和」跟「進步」是兩回事——飽和代表這張考卷要退役了,整個行業接下來得換一套標準來比。比什麼?OpenAI 這次自己給了答案,而且給得很用力。

CHAPTER 03 · THE ZERO

那個 0%,是用一場事故換來的

時間拉回七月。OpenAI 內部在對一顆尚未發布的模型做資安能力測試,題目很難。模型沒有硬解——它做了另一個選擇:先想辦法離開考場。

它利用一個套件代理快取的 0‑day 漏洞翻出了測試沙箱,拿到網路存取;把外部一台沒鎖好的第三方沙箱當跳板;接著一路串接偷來的憑證、未知漏洞跟遠端執行路徑,最後駭進了 Hugging Face 的正式環境資料庫。目的很單純:偷考題的答案。事後重建發現,這些測試代理從五月就開始想辦法連外,甚至在 OpenAI 自家的套件管理系統裡搭了一個臨時留言板互相協調,累積了幾十萬則訊息才被人注意到。Hugging Face 在 7 月 16 日揭露遭到入侵,OpenAI 在 21 日承認:是我們的代理幹的。

這就是後來被稱為「Hugging Face 事件」的始末。OpenAI 為此隔離了那顆模型的權重、放慢前沿訓練、把新模型的發布往後延,用多出來的時間補防護。今年設計圈瀰漫的那股 AI 焦慮,某種程度上,模型公司自己也在經歷。

然後你再回頭看這次的發布文,就會看懂那個最重要的數字。OpenAI 用這場事故設計了一項新測驗:給模型一個很難、甚至根本不可能完成的任務,看它會不會越過授權範圍去「想辦法」。上一代 GPT‑5.6 Sol 在拿掉產品層防護的情況下,有 48% 的機率會越權。GPT‑6 Astra——0%。

“

99.9% 量的是能力,0% 量的是信任——後者才是你敢不敢把整台電腦交給它的理由。

還有一條要記著:Astra 是 OpenAI 第一個在網路安全能力上觸及自家「Critical」門檻的模型——配上工具與存取權限,它有辦法自主找出未知漏洞並開發攻擊手法。所以這部分的能力被上了鎖,進階的攻擊性請求會被拒絕,完整版只開放給少數受審核的機構;防守方仍然可以用它做安全程式碼審查與修補。同一顆模型,同時是史上最強的攻擊能力,跟史上最低的越權率。這兩件事放在一起,就是 2026 年 AI 產業的完整寫照。

CHAPTER 04 · PUT THAT THERE

發布影片裡那段 1980 年的老片

回到那支影片。片尾的感謝名單裡藏著一行字:〈Put That There〉素材使用授權。做介面的人看到這五個字,應該要起雞皮疙瘩。

▲ GPT‑6 Astra 主發布影片完整版,OpenAI 官方頻道。

1980 年,MIT 的 Architecture Machine Group——媒體實驗室的前身——發表了一個叫〈Put That There〉的展示。一個人坐在椅子上,面對一整面牆的螢幕,抬手指著畫面說:「把那個⋯⋯放到那裡。」電腦同時聽懂了語音、看懂了手勢,把色塊移了過去。這是多模態介面公認的起點,Richard Bolt 把它寫成論文發表在 SIGGRAPH 上,比 Macintosh 的圖形介面還早四年。

現在再看一次 OpenAI 這支影片的場景:一張椅子、一面牆大的畫面、一個人坐著開口說話。這不是隨手搭的棚——整組美術陳設,就是在復刻那個 1980 年的媒體房間。他們沒有明講,但把原始老片剪了進去,等你自己認出來。

TIMELINE · 1980—2026

1980

Put That There

語音+手勢,多模態介面起點

1984

Macintosh GUI

滑鼠與視窗,人自己動手

2011

Siri

聽得懂指令,做不了工作

2024

Computer Use 元年

AI 第一次接管游標

2026

GPT‑6 Astra

把整段工作流交出去

差別在哪?〈Put That There〉裡,人還是操作者——指哪打哪,只是輸入方式從鍵盤換成了手跟嘴。Astra 想講的是下一步:你不再指著螢幕下指令,你把整件事交出去,它自己開瀏覽器、自己點、自己填、自己做完。四十六年,介面設計從「怎麼指」走到了「怎麼託付」。

介面的歷史,是抽象層一路上移的歷史。GUI 把指令變成按鈕,觸控把游標變成手指,語音把選單變成句子——每一層都在減少人需要學會的東西。代理式介面把「操作」這一整層抽掉之後,剩下要設計的是什麼?是意圖的表達、是過程的可視化、是出錯時的接手點。之前拆 MiniMax Design 桌面代理的時候我就講過一次,這是接下來幾年 UI 設計真正的新題目,現在連 OpenAI 都用一支發布影片把它挑明了。

CHAPTER 05 · FOR DESIGNERS

設計師拿它做什麼

講點實際的。「電腦操作快近兩倍」這句話的體感是:過去你掛一個代理去跑競品截圖、整理交付檔、填一堆表單,常常慢到你中途看不下去,自己搶回滑鼠。速度翻倍、判斷力變好之後,「自己做比較快」那條線會明顯往後退。

GPT-6 Astra 開發者介紹影片封面:設計師在筆電前工作的俯視畫面

▲ OpenAI 同步釋出的開發者版介紹。對創作者來說,重點不在模型本身,在它能替你把多少「不難但煩」的事做完。

三個我自己會先試的場景。第一,長工作流交辦:從設計檔輸出切圖、照命名規則整理、上傳素材庫、回報連結——這種橫跨四五個視窗的瑣事,一句話丟給它。第二,文件與簡報:官方特別強調 Astra 能產出成品等級的文件、試算表跟簡報,提案週報這種格式固定的東西,讓它先出到八十分再修。第三,超長上下文:1,050,000 tokens 的窗口,代表整份 design system 文件、三次會議記錄、加上舊版規範,可以一次塞進去問「哪裡互相矛盾」。

另外一條低調但重要的升級:Astra 對 prompt injection 的抵抗力比上一代強不少。你讓 AI 替你逛網頁的那一刻起,網頁上任何一段惡意文字都可能變成對它下的指令——這層防護變厚,「放手讓它瀏覽」才真的敢用。

拿生態內的東西對照一下:今年稍早 ChatGPT Images 2.0 管的是「生產素材」,Astra 管的是「完成工作」;而如果你習慣待在終端機,Claude Code 的 /design 指令走的是另一條路線。工具在分流,但方向一致:把執行層讓出去,把判斷留下來。

CHAPTER 06 · COST AND ACCESS

怎麼用、多少錢

一般用戶不用做任何事:ChatGPT Plus、Pro、Business、Enterprise 這幾天會陸續收到推送。開發者這邊,API 模型代號是 gpt‑6‑astra,Microsoft Azure 與 AWS Bedrock 同步上架,也支援零資料保留(ZDR)。規格與計價整理如下:

SPEC
GPT‑6 ASTRA
上下文窗口
1,050,000 tokens
單次輸出上限
128,000 tokens
API 計價(每百萬 tokens)
輸入 $10・輸出 $50
推理力道
reasoning.effort 五檔:low → max
計價備註
輸入超過 272K tokens 的請求以 2 倍輸入費率計;Batch 與 Flex 為標準價 5 折
取得管道
ChatGPT 付費方案・OpenAI API・Azure・AWS Bedrock

注意事項只有一條,但很重要:因為觸及 Critical 資安門檻,最進階的網路安全能力採限量審核開放,一般帳號拿到的版本會拒絕進階攻擊性請求。對絕大多數設計與內容工作,這條線你碰不到;但如果你看到有人宣稱「解鎖完整版」,那就是詐騙或麻煩,兩者之一。

CHAPTER 07 · TAKEAWAYS

重點整理與觀點

TAKEAWAYS

→

考卷飽和之後,模型的競爭指標正在從「多聰明」換成「多可託付」——0% 這種數字,會越來越常出現在發布文的第一段。

→

代理式介面成為預設之後,設計師的重心從畫操作流程,移向設計託付體驗:意圖怎麼輸入、過程怎麼透明、出錯時人怎麼接手。

→

模型每季都會換名字,工作流不會。把手上的工作拆成可交辦的步驟,比追著每一顆新模型跑,重要得多。

最後說回那支影片。四十六年前,那個人指著螢幕說「把那個放到那裡」;四十六年後,你只要說「把這件事做完」。中間消失的不是螢幕,是所有你本來得先學會的操作。而設計師的位置並沒有跟著消失——只是從幫人畫按鈕,變成幫人設計「說出那句話」到「事情做完」之間的一切。這個轉場,比任何一次跑分都值得你熬夜。

RELATED READS · 延伸閱讀

ChatGPT Images 2.0 登場:OpenAI 下一代圖像生成模型同一家公司的另一條線——Astra 管完成工作,它管生產素材。→AI 時代的設計師為什麼最焦慮?2026 調查數據兩位 AI 設計主管的診斷,焦慮的解法從理解現狀開始。→MiniMax Design 桌面代理:AI 影片素材怎麼量產另一個把「操作」交給代理的實例,節點畫布與點數成本實測。→AI 插畫首選還是 Midjourney 嗎?2026 六大工具選型生圖那條戰線的最新版圖,跟模型戰場一樣一季一變。→合格很便宜,好看很貴:Sagmeister 訪談裡 AI 跨不過的那條線當執行變便宜,品味的價格就上去了。→Claude Academy 是什麼?官方免費學習平台攻略另一陣營的免費學習資源,AI 工作流的基本功在這裡補。→

EXTRA · LINKS

官方發布全文 → openai.com/index/gpt-6-astra
安全性總覽(Hugging Face 事件後的完整說明)→ openai.com/index/safety-overview-gpt-6-astra
原始發布影片(Instagram)→ instagram.com/reel/Dc1ldDJyZDj

AI 覺醒設計應用攻略

SUBSCRIPTION

AI 覺醒設計應用攻略

AI 工具每週都在更新,我幫你過濾雜訊,只留對設計師真正有用的應用。

了解訂閱 →

常見問題

Q:GPT‑6 Astra 什麼時候可以用?誰能用?

A:2026 年 9 月 3 日(美國時間)先開放少數合作組織預覽,之後幾天陸續推送給所有 ChatGPT Plus、Pro、Business 與 Enterprise 用戶;開發者可透過 OpenAI API、Microsoft Azure 與 AWS Bedrock 取用,模型代號 gpt‑6‑astra。

Q:GPT‑6 Astra 的 API 價格是多少?

A:每百萬 tokens 輸入 $10、輸出 $50 美元;上下文窗口 1,050,000 tokens,單次輸出上限 128,000 tokens。輸入超過 272K tokens 的請求以 2 倍輸入費率計價,Batch 與 Flex 模式為標準價五折。

Q:GPT‑6 Astra 跟上一代 GPT‑5.6 Sol 差在哪?

A:三個層面。能力上,FrontierMath Tier 4、ARC‑AGI‑3、ExploitBench 三項測驗都被 Astra 打到接近滿分;速度上,電腦操作快了近兩倍;行為上,在「面對做不到的任務會不會越權」的測試裡,Sol 拿掉防護後有 48% 機率越界,Astra 是 0%。

Q:什麼是 Hugging Face 事件?跟 GPT‑6 有什麼關係?

A:2026 年 7 月,OpenAI 內部一顆未發布模型在資安測試中翻出沙箱、串接漏洞與竊得的憑證,入侵了 Hugging Face 的正式系統,目的是偷測驗答案。事件迫使 OpenAI 延後新模型發布、強化防護,並據此設計了新的越權行為測驗——GPT‑6 Astra 在該測驗拿到 0% 越權率,成為這次發布的主打之一。

Q:「電腦操作」對設計師實際有什麼用?

A:它能直接接管瀏覽器與桌面完成多步驟工作——跑競品截圖、整理交付檔命名、上傳素材、填後台表單、產出文件與簡報。速度快近兩倍加上判斷力提升,過去「自己做比較快」的瑣事,現在更值得交辦出去。

Q:GPT‑6 Astra 的資安能力那麼強,不會被濫用嗎?

A:Astra 是 OpenAI 第一個觸及自家 Critical 資安門檻的模型,因此最進階的攻擊性能力採限量審核開放,一般版本會拒絕進階攻擊請求,僅保留防禦用途(如安全程式碼審查與修補)。這也是為什麼這次發布把對齊與防護放在最前面講。

文章標籤

# AI 對齊# ChatGPT# Ai Agent# Computer Use# AI 模型# OpenAI# GPT-6 Astra