一句話結論
OpenAI 在 9 月 3 日發布 GPT-6 Astra。最大的改變不是「更聰明」,是它可以自己操作電腦——填表單、更新 CRM、做投影片、跑網站測試。同樣的任務比 GPT-5.6 少花約 47% 的時間。但同一份官方文件也寫了一件你該知道的事:它的資安能力已經達到 OpenAI 自己定義的「Critical」門檻。
先講最實際的:什麼時候輪到你用。
OpenAI 的 GPT-6 Astra 發布影片,2 分 43 秒(影片來源:OpenAI 官方發布頁)
官方說法是 9 月 3 日先開放給少數組織,接下來幾天陸續開放給所有 ChatGPT Plus、Pro、Business、Enterprise 使用者,API 和 AWS 也會上。
所以如果你是付費用戶,這幾天打開就會看到。不用做什麼。
三個你會有感的改變
① 它會自己動手,不只是給你建議
官方舉的例子很具體:填線上表單、更新 CRM 裡的客戶紀錄、整理行事曆、上網查資料後直接把摘要寫進你的 email 或文件、分析資料畫圖、做出一個網站再自己跑一遍測試看功能有沒有壞。
這是 OpenAI 這次講最多的一塊。他們的說法是「世界最好的電腦操作模型」。
對照數字:在一個叫 OSWorld 2.0 的測試裡,Astra 拿 72.6 分、平均一個任務約 40 分鐘;GPT-5.6 Sol 是 65.7 分、約 75 分鐘。分數更高,時間少了約 47%。
配合 Codex 工具的更新,官方說在另一個測試上任務完成速度快 1.9 倍。
② 做出來的文件,會照你的格式
官方特別強調:它會跟著你既有的模板做投影片、文件、試算表,而且「只抓需要的內容,不重複講跟這件事無關的資訊」。
這一點我覺得對上班族最有感。以前叫 AI 做簡報,出來的東西格式永遠要重排,內容永遠多兩頁廢話。官方的示範是:只給它幾張自家模板的投影片,它做出來的整份簡報語氣和版型都對得上。
官方示範:Astra 自己操作 Excel 完成試算表任務(49 秒,4 倍速)(影片來源:OpenAI 官方發布頁)
另外 ChatGPT 裡的 Sites 功能,可以直接從一句話產生網站、網頁應用和遊戲,而且直接幫你放上去。
③ 你講不清楚的時候,它會問對問題
指令有模糊空間時,Astra 會自己補掉例行的空白,但在「答案可能因此不同」的地方停下來問你。
還有一個小改變我很喜歡:以前你中途補一句「等等,改成這樣」,模型常常把它當成新任務,忘記原本要什麼。Astra 會把新要求加進去,而不是取代掉原本的。
成績單(官方數字)
| 測試項目 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| 專業軟體實作任務 | 59.3% | 53.6% |
| 終端機任務 | 57.9% | 37.3% |
| 研究所等級科學推理 | 96.0% | 94.6% |
| 從多視角圖重建 3D 模型 | 95.9% | 83.3% |
| 高階數學(FrontierMath Tier 4) | 98%——官方用的字是「飽和」,意思是這個測驗已經考不倒它了 | |
還有一個對企業有意義的數字:在多數比較裡,Astra 拿到更高分的同時,用掉的 token 反而更少——官方舉的例子是比 Claude Opus 5 少用約 65% 的輸出 token。更聰明而且更便宜,這在過去幾代很少同時發生。
但有兩件事要講清楚
🔴 它的資安能力達到「Critical」門檻
這是 OpenAI 自己的分級裡最高的那一級。官方寫得很直白:在沒有生產防護的測試環境下,Astra 在一個漏洞利用測試拿到 100% 滿分(GPT-5.6 Sol 是 78.5%),而且在評測過程中自己發現並用掉了兩個先前沒人知道的零時差漏洞——這兩個已經通報給維護者了。
要講平衡:正式上線的版本會拒絕比較進階的攻擊性任務(例如產出概念驗證的攻擊程式)。官方的立場是這個能力對防守方也有用——可以更快找出自家系統的弱點。
但對企業的意義很實際:你的對手手上,也會有同一個工具。這件事我會另外寫,這裡先讓你知道。
⚠️ 上面所有數字都是 OpenAI 自己公布的
是官方在自家選定的測驗上跑出來的結果,不是第三方獨立驗證。方向我相信,但「它在你的工作上會不會也快一倍」,要你自己試過才算數。
那可以期待什麼?
我的看法是三件事,由近到遠:
① 這幾天先去試「叫它做完整件事」,不要只問問題。過去你問「這份報告怎麼寫比較好」,現在可以直接說「照這份模板,把這三個檔案整理成一份簡報」。差別就在這裡。
② 幾個月內,「AI 幫你把事做完」會變成常態期待。當一個任務從 75 分鐘變成 40 分鐘,你的同業也一樣。省下來的時間會很快被視為理所當然——真正拉開差距的會是「你交辦了幾件事」,不是「你問了幾個問題」。
③ 但公司的規則會來不及跟上。模型可以自己開瀏覽器、自己填表單、自己更新 CRM 的時候,「誰授權它做這件事」「按下送出誰負責」就變成真問題。多數公司現在還沒有答案。
回到機長那句話
我常說:你是機長,AI 是機組人員。
GPT-6 Astra 的意思是——機組人員從「會回答問題」變成「會自己動手」。
這是好事,而且是往前一大步。但機組人員能動手之後,機長要多做一件以前不用做的事:決定哪些事可以交出去、哪些必須自己按。
模型會愈來愈強,這條線只有你自己畫得出來。
查證說明
①本文所有內容出自 OpenAI 官方公告〈GPT-6 Astra: A new generation of intelligence〉(2026 年 9 月 3 日),以瀏覽器直接開啟官方頁面核對(openai.com 擋抓取工具),未採用媒體轉述。②所有 benchmark 數字皆為 OpenAI 自行公布,在其選定的評測上執行,非第三方獨立驗證;OpenAI 為利益相關方。③「Critical 門檻」是 OpenAI 自家 Preparedness Framework 的分級,不是外部標準。④漏洞利用測試的滿分結果是在「沒有生產防護」的條件下測得,正式上線版本會拒絕較進階的攻擊性任務。⑤開放時程為官方說法(9/3 起先給少數組織、隨後開放付費方案),實際何時輪到你的帳號以官方為準。⑥文末「可以期待什麼」三點是我的判斷,不是 OpenAI 的說法。
「AI 可以自己按送出了,那誰負責?」——這題你們公司答得出來嗎
想跟上這類消息:我的電子報每週把新發布翻成能用的判斷 → startupforyou.substack.com
如果你是主管:模型能自己動手之後,真正缺的不是工具而是規則。我的企業內訓有一個模組專門帶團隊畫這條線——哪些事可以交給 AI、哪些必須留人審,課堂上就產出貴公司自己的版本。想聊聊寫信到 ai@autolab.cloud,或看看 AI 顧問教練團。
關於作者
黃敬峰(AI峰哥/阿峰老師),企業 AI 實戰培訓專家,服務客戶包含國泰人壽、工研院、士林電機、中嘉寬頻、電通、城邦媒體等。聯絡方式:ai@autolab.cloud