一句話結論
OpenAI 昨天(9/8)發布 ChatGPT Images 2.5。我把 8 月 2 日讓 Nano Banana Pro 栽在第四題的同一套考點再考一次(四題裡只有最難的第四題是逐字同題,後面會說明),四題全過——包含 8 月那次把字畫壞的那一題。但這篇真正想讓你記住的,是測試過程中發現的另一件事:它畫完的時候,畫面可能跟你說「發生錯誤」。
先講它是什麼
ChatGPT 端叫 ChatGPT Images 2.5,發布當天開始推給 ChatGPT、ChatGPT Work、Codex 的所有層級(官方原文 all tiers),桌機、手機、網頁都有。
API 端比較特別:它不是一個模型,是兩個。
| 模型 | 官方定位 | 官方宣稱的特性(我未驗證) |
|---|---|---|
| GPT-Image-2.5 Flare | 「大多數應用的預設選擇」 | 品質提升,延遲比上一代最多低 50% |
| GPT-Image-2.5 Sunburst | 「premium 視覺工作流」 | 更精確,但生成時間較長 |
官方列的改進裡,跟這次測試最相關的有四項:延遲降低最多 50%、只改你要改的地方(精準編輯)、多輪編輯不會愈改愈糊,以及資訊圖表的版面與準確度有改善(最後這項出自 System Card,不在發布文裡)。官方列的還不只這些,另外還有光影材質、參考照片的主體保留、透明背景。
最後那一項,正好是我上次測 Nano Banana Pro 時翻車的地方。所以我把舊題目拿出來。
我拿 8 月那套考點再考一次
8 月 2 日我測 Nano Banana Pro 時定了一套規則,這次原封不動沿用:
- 每題只生一次,不重抽
- 不挑圖——生出來什麼就是什麼
- 不修圖、不疊字——文字必須是模型自己畫的
- 每題開新對話,避免前一題的脈絡影響
先講三個我控制不了的變數,讀的時候要打折
一、我沒辦法百分之百確認我測的就是 2.5。ChatGPT 網頁版不顯示模型名稱,我測的時間是發布隔天早上。本文的前提是官方說的「發布當天推送所有層級」為真,但這件事我沒有介面上的證據。
二、兩次測試的產線不一樣。8 月那次是走 Gemini API 打 Nano Banana Pro,這次是 ChatGPT 網頁版。網頁端可能有我看不到的提示詞處理或後製,兩邊不完全可比。
三、我沒有重測 Nano Banana Pro。中間隔了 38 天,它有沒有改善我不知道。所以這是「9 月的 A」對上「8 月的 B」。
前三題分別考:短主標、中英數混排、繁簡最容易混的字。結果如下(圖為模型原始輸出,未經任何後製):

第二題的副標我故意塞了「Anthropic 砍掉 80% 系統提示詞」——中文、英文、數字三種字元混在同一行,是生圖模型的傳統地雷區。這題也過了。(那句副標只是拿來考混排的測試素材,不是本文的事實主張,圖被單獨轉走的話請留意。)
第四題:8 月那次就是崩在這裡
第四題模擬的是實務上最常見、也最容易翻車的需求:做一張圖解。左右兩欄對照,每欄一個大標、一行小字。文字區塊變多、字級變小。
8 月 2 日 Nano Banana Pro 就是在這題出問題的——「你交辦它自己做」的「辦」字被畫壞了。
先幫它講句公道話:它那次是四題過三題,只崩在第四題,而且第三題考的字比我這次還多九個。它不是整份考卷都爛。

老實說,我第一眼看小圖的時候覺得「辦」字怪怪的——字很小、筆畫擠在一起。但「看起來怪」不能當結論。所以我做了三格對照——①原圖裁切放大、②把一個一定正確的標準字形走一遍同樣的縮放與壓縮、③標準字形的原始解析度。如果①的糊是筆畫錯,它會跟②長得不一樣:

十六個字逐字放大看過,全對。這是四題裡唯一一題,兩邊真的拉開差距。(要說清楚:Nano Banana Pro 是 Google 的產品,不是 ChatGPT Images 的上一代,這是跨廠商比較,不是版本升級。)
但這個對照,我要先幫你打個折
我回頭翻了 8 月 2 日的原始紀錄,發現一件事必須講清楚:四題裡有兩題的圖面文字跟 8 月完全相同——第一題(「不是越貴越聰明」)和第四題(助理/代理雙欄那組)。第二、三題是同一個考點、不同題目,其中第三題 Nano Banana Pro 那次考的還是二十一個字,比我這次的十二個字更難。
所以能講的只有一句:8 月讓 Nano Banana Pro 崩掉的那一題,原封不動再考一次,Images 2.5 過了。第二、三題只能說「兩邊在同難度都沒出錯」,不能拿來宣稱誰比較強。
畫面說「發生錯誤」,但圖其實已經生出來了
這是我這次最想告訴你的一件事,而且它跟模型能力無關。
第一題送出去之後,ChatGPT 的畫面跳出「發生錯誤。請再試一次。」並附上重試按鈕。看起來就是失敗了。
但我去看網頁的實際狀態,圖片元素已經存在,而且標記著「已產生圖像」。重新整理頁面之後,錯誤訊息消失,圖好端端地在那裡——1672×941、786KB、完整可下載。
四題都出現同一個現象:圖片元素超過兩分鐘才載入完成,第三題甚至超過五分鐘。期間畫面一片空白,看起來也像失敗了。(同一台機器、同一條網路、同一天,我沒有跨環境驗證,可能有我這端的因素。)
這兩件事合起來的實務建議只有一句:
看到錯誤訊息,先重新整理,不要先按重試。
按重試等於再生一次,很可能被扣兩次額度——這點我沒有實際比對額度計數,是推論不是量測。但你本來就已經有那張圖了,重試怎麼算都不划算。
官方叫它 premium,但它沒有比較貴
我把 API 定價頁整張表拉出來對,發現一個官方沒有明講的事:Flare 和 Sunburst 每一欄的價格完全一樣。
| 模型 | 圖片輸入 | 文字輸入 | 輸出 |
|---|---|---|---|
| gpt-image-2.5-sunburst | $8.00 | $5.00 | $30.00 |
| gpt-image-2.5-flare | $8.00 | $5.00 | $30.00 |
| gpt-image-2(上一代) | $8.00 | $5.00 | $30.00 |
| gpt-image-1(更早) | $10.00 | $5.00 | $40.00 |
單位是每 100 萬 tokens,不是每張圖。批次模式全部打五折。
所以「premium」換來的不是更高的價格,是更長的等待時間。這讓選型變得很乾淨:
但要小心一個陷阱:每百萬 token 同價,不等於每張圖同價。Sunburst 官方定位是「更精確、生成時間較長」,它有沒有因此吐出更多 output token、讓單張成本變高,我沒有測到。定價頁自己也註明實際成本要用官方的計算器估。
所以正確的講法是:不用比牌價,但實際單張成本仍然要算過。牌價既然一樣,選型就先問一句「這張圖趕不趕」——趕就用 Flare,不趕、要精修就用 Sunburst(快慢與精細度都是官方說法,我沒驗過)。
再看第三、四列:2.5 系列跟真正的上一代 gpt-image-2 是同價,並沒有比較便宜;要往回比到更早的 gpt-image-1($10/$40)才看得出降價。這點值得講清楚,因為只列 gpt-image-1 會讓人誤以為這一代又降了一次。至於能力有沒有同步往上,那是官方說法,我沒有驗證。
如果你要接 API,有個坑先講
我實際去打了 API,遇到一個文件上沒寫的狀況:GET /v1/models 列不到這兩個模型。
我手上四把不同專案的金鑰查下來,image 相關的清單全部只列到 gpt-image-2。但直接呼叫 gpt-image-2.5-flare,是通得過模型驗證的——請求會一路走到額度檢查,而不是回「模型不存在」。
換句話說:模型清單沒列,不等於模型不存在。如果你的程式碼是「先查清單、比對到才呼叫」,會在這裡誤判成「2.5 還沒開放」,然後自動退回舊模型。你甚至不會收到錯誤訊息。(要講清楚:我因為帳上額度用完,一張圖都沒實際生成成功,所以我能證明的是「模型名稱有效」,不是「一定能用」。)
另外一個小細節:沒有不帶後綴的 gpt-image-2.5,直接呼叫會明確回「模型不存在」。你一定得自己選 Flare 或 Sunburst。
誠實踩煞車
講完好的,該講不好的了。
第一,我的樣本很小。四題、單日、每題只生一次。這足以說「這四題這樣」,不足以說「它一定比較強」。你自己的題目跑出來可能不一樣,發布前務必自己放大看過。
第二,所有能力數字都是 OpenAI 自己公布的。延遲最多低 50%、資訊圖表改善——這些我沒有能力獨立驗證,OpenAI 是利益相關方。我能驗的只有中文字形,而那是我自己實測的部分。
第三,安全測試整體改善,但有一個類別退步。先講對 OpenAI 有利的那半:整體漏網違規率 Sunburst 1.09%、Flare 1.41%,都優於上一代 Images 2.0 的 1.64%,性內容、極端主義、政治三類全部改善。但在「不法行為」這個類別,漏網率 Sunburst 2.86%、Flare 3.27%,兩個都比 Images 2.0 的 2.45% 差。官方的說法是「輕微退步不具統計顯著性」,並註明沒有任何一項漏網差異達到 p<0.05。這個前提要一起講:那些提示詞是刻意設計來產出違規圖的,不代表你平常用會遇到這個比例。但如果你要拿它產對外的行銷素材,這個數字值得知道。
第四,Flare 和 Sunburst 的實際差別我沒測到。網頁版只給你一個「Images 2.5」,不提供選擇;要比只能走 API,而我這次卡在額度沒跑成。所以文中關於兩者差異的描述全部是官方說法,不是我驗證過的結果。
那到底能不能用?
| 用途 | 文字條件 | ChatGPT Images 2.5 的實測結果 |
|---|---|---|
| 封面主標 | 1–2 行、10 字內、字級大 | 可以直接用 |
| 主標+副標 | 含中英數混排 | 可以用 |
| 難字標題 | 繁簡易混字 | 可以用,但要逐字驗 |
| 資訊圖/圖解 | 多個文字區塊、字級小 | 這次過了,但還是要逐字驗 |
最後一列跟我 8 月寫的不一樣——那時我對 Nano Banana Pro 的結論是「會出壞字,先別用」。
但要講清楚我改的是什麼:我沒有重測 Nano Banana Pro,那句話對它仍然有效(也可能它這 38 天已經改善了,我不知道)。這裡新增的是我對 Images 2.5 的建議——可以試,但驗的動作不能省。
給三種人的建議
如果你只是偶爾做張圖:放心用,但養成一個習慣——圖存下來之後,放大到 100% 逐字看一遍,特別盯筆畫多的字(辦、變、關、鍵、體、廳)和字級最小的那一行。壞字都出現在那裡。
如果你要量產:先確認你的檢查流程是人工還是自動。目前沒有可靠的自動化繁體字形檢測,所以「量產」的瓶頸不在生成速度,在你有沒有人力逐張驗。這件事要先想清楚再擴大規模。
如果你是主管:不要因為「AI 現在寫得出中文了」就把設計外包給它。它會畫壞,而且畫壞的時候不會告訴你——它交出來的時候一樣自信。真正該建立的不是工具,是「誰負責放大看過」這個責任歸屬。
你是機長,AI 是機組人員
這次測試最值得記住的,其實不是四題全過,是那個假的錯誤訊息。
機組人員回報「任務失敗」的時候,機長不會直接照著重來一次。他會先看儀表。
畫面上的錯誤訊息是機組人員的口頭回報,重新整理之後看到的那張圖才是儀表。這次它們剛好互相矛盾——而且是報錯的那個錯了。
模型愈強,這種事只會愈常發生:能力跑在前面,介面跟不上。你能做的不是不信任它,是知道該看哪一個儀表。
常見問題
Q:我要付費才能用 ChatGPT Images 2.5 嗎?
官方寫的是推送給 ChatGPT、ChatGPT Work 與 Codex 使用者的所有層級,發布當天開始推。實際到你帳號的時間可能不一樣,這點官方沒有給時間表。
Q:它畫的繁體中文可以直接商用嗎?
字形正確與否跟商用授權是兩件事。這篇只談字形。授權條款請看你自己那份合約,我不是律師,這篇不是法律意見。
Q:SynthID 浮水印是這次新增的嗎?
不是。OpenAI 在 2026 年 5 月 19 日就宣布採用 C2PA + SynthID 雙層機制了,Images 2.5 是延續,不是新增。兩者差別是:C2PA 是 metadata,重新存檔就可能掉;SynthID 是像素層的隱形浮水印,裁切壓縮都還在。
Q:Flare 和 Sunburst 我該選哪個?
兩個價格完全一樣,所以不用從成本考慮。官方的說法是 Flare 快、Sunburst 精細。但我沒有實測驗證過這個差異,這是官方說法不是我的結論。
Q:我在 ChatGPT 網頁版可以選 Flare 還是 Sunburst 嗎?
不行。這兩個模型只在 API 端分開,網頁版只給你一個「Images 2.5」,沒有選項。
資料來源
- OpenAI 官方發布文(openai.com/index/introducing-chatgpt-images-2-5,2026/9/8)——功能、供應範圍、兩個模型的定位
- OpenAI System Card(deploymentsafety.openai.com/chatgpt-images-2-5)——對抗性測試數字、分類別漏網率、統計顯著性註記
- OpenAI API 定價頁(developers.openai.com/api/docs/pricing)——Flare 與 Sunburst 逐欄價格比對
- 本文四題實測:ChatGPT 網頁版登入帳號,2026/9/9 上午(第一題 08:38、第四題 08:55),每題單次生成不重抽,原圖如文中所示。網頁版不顯示模型名稱,我無法從介面確認帳號當下的版本
- API 探測:以四把不同專案的金鑰實際呼叫
/v1/models與/v1/images/generations,2026/9/9 - 對照組:本站 2026/8/4 的 Nano Banana Pro 四題實測(測試日 8/2,模型 Gemini 3 Pro Image,走 Gemini API,與本次的網頁版產線不同)
查證說明
①四題實測是我自己跑的,每題只生一次、不重抽、不挑圖、不修圖、不疊字,文中所有測試圖皆為模型原始輸出。②壞字判定是人工目視放大比對(與 Noto Sans CJK TC 字型排版對照),不是自動化字形檢測。③我無法從介面確認我測的就是 Images 2.5——ChatGPT 網頁版不顯示模型名稱,我測的時間是官方發布的隔天早上;本文前提是官方所說的「發布當天推送所有層級」為真。④兩次測試的產線不同:8/2 那次走 Gemini API 打 Nano Banana Pro,這次是 ChatGPT 網頁版,網頁端可能有我看不到的提示詞處理,兩邊不完全可比。⑤我沒有重測 Nano Banana Pro,中間隔了 38 天,它是否已改善我不知道;本文對它 8 月的評價沒有撤回,也沒有更新。⑥四題裡有兩題(第一題與第四題)與 8/2 那次逐字同題,第二、三題是同考點不同題目,其中第三題 8 月那次的字數還更多(21 字對 12 字);因此本文不宣稱哪一家比較強,只陳述「同題再考一次的結果」。另外兩次的完整提示詞我沒有留檔比對,只能確認圖面文字相同,措辭強度是否一致無法查證。⑦能力宣稱(延遲最多降 50%、資訊圖表改善、多輪一致性、Flare 快/Sunburst 精細)全部是 OpenAI 自己公布的,非第三方驗證,OpenAI 是利益相關方。⑧安全測試數字來自官方 System Card,那些提示詞是刻意設計來產出違規圖的,官方明講不代表實際流量比例;本文整體改善(1.09%/1.41% 優於 1.64%)與單一類別退步兩邊都寫,並附上官方「不具統計顯著性」的說法。⑨Flare 與 Sunburst 的實際差異我沒有測到——網頁版不提供選擇,API 端我卡在額度沒跑成。⑩定價單位是每 100 萬 tokens,不是每張圖;每 token 同價不等於每張圖同價,實際成本請用官方計算器估。定價表已列出真正的上一代 gpt-image-2(與 2.5 系列同價),避免只跟更早的 gpt-image-1 比而讓降價看起來比實際大。⑪「按重試會扣兩次額度」是推論不是量測,我沒有比對額度計數。⑫載入緩慢的觀察來自單一機器、單一網路、單日,沒有跨環境驗證。⑬SynthID 不是這次新增,2026/5/19 就已宣布。⑭API 那段的「模型清單列不到但通得過模型驗證」是我實跑出來的,非官方文件記載;但我一張圖都沒生成成功(額度為 0),所以只能證明模型名稱有效。⑮本文的「辦」字對照圖使用三格法:把一個一定正確的標準字形走一遍同樣的縮放與壓縮當對照組,避免拿模糊的圖去證明自己不模糊。⑯本文的封面圖不是 Images 2.5 畫的,是我的產線既有的 Nano Banana Pro(Gemini 3 Pro Image)流程產出的——一併揭露,免得看起來像拿受測者的作品當自己的證據。⑰Nano Banana Pro 是 Google 的產品,不是 ChatGPT Images 的上一代;本文是跨廠商比較,不是版本升級。文中的「上一代」一律只指 OpenAI 自己的前代(gpt-image-2/Images 2.0)。
「它說失敗的時候,先看儀表再決定」——這句話適用的不只是生圖
想跟上這類消息:我的電子報大約一到兩週一封,把新發布翻成能用的判斷 → startupforyou.substack.com
如果你是主管:與其看廠商的示範,不如讓團隊拿自己的素材跑一次。我的企業內訓就是在做這件事——用貴公司真實的資料現場做,當場知道哪些真的做得到、哪些做不到。想聊聊寫信到 ai@autolab.cloud,或看看 AI 顧問教練團。
關於作者
黃敬峰(AI峰哥/阿峰老師),企業 AI 實戰培訓專家,服務客戶包含國泰人壽、工研院、士林電機、中嘉寬頻、電通、城邦媒體等。聯絡方式:ai@autolab.cloud