Claude Opus 5 實測解析:價格沒漲、實力大跳,但「開到最高」反而掉分

一句話結論

Anthropic 在 7/24 發布 Claude Opus 5,維持 $5/$25 的價格拿到大幅提升的成績。但真正值得上班族和老闆記住的不是「又更強了」,而是它自家公布的數據裡藏著一個反直覺的事實:把 AI 的「用力程度」開到最高,分數反而可能變低,錢還多花。

7 月 24 日,Anthropic 發布了 Claude Opus 5。照慣例,這種消息隔天就會被寫成一堆「史上最強」的文章。

但我看完官方公告和幾份第三方實測後,覺得最有價值的一段不是那些破紀錄的數字,而是一個很多人會看漏的細節——這個模型有五段「用力程度」可以調,而開到最大那一段,在兩個測試上的分數反而比第二段低,成本卻更高。

這件事對你我的意義,比多少分還重要。我先把規格講完,再來談這個。

Claude Opus 5 到底改了什麼?

先把可以查證的硬規格擺出來:

  • 價格:每百萬 token 輸入 $5、輸出 $25——跟上一代 Opus 4.8 完全一樣,沒有漲價。
  • 脈絡長度:100 萬 token,與前一代相同(大約是一本厚書再多一點的量)。
  • 模型代號claude-opus-5
  • 另有「快速模式」,速度約為預設的 2.5 倍,價格則是兩倍。

價格沒動、能力大幅上升,這是這次發布最實在的一點。對照組是同門的 Claude Fable 5:據 The Decoder 報導,Opus 5 以大約一半的 token 價格,達到接近 Fable 5 的表現。

數字有多好看?(也有不好看的)

這是我認為最該完整攤開的部分——因為多數報導只挑贏的講。以下數據來自 Anthropic 官方公告與 The Decoder 整理的對照表:

測試項目Opus 5對照結果
Frontier-Bench v0.1
代理式終端編程
43.3%GPT-5.6 Sol 34.4%
Fable 5 33.7%
Opus 4.8 21.1%
✅ 第一,且是前代兩倍
ARC-AGI-3
沒見過的新問題
30.2%GPT-5.6 Sol 7.8%
Opus 4.8 1.5%
✅ 差距最懸殊的一項
GDPval-AA v2
知識工作 Elo 分
1,861Fable 5 1,747
GPT-5.6 Sol 1,736
✅ 領先
DeepSWE v1.1
代理式編程
68.8%GPT-5.6 Sol 72.7%
Fable 5 69.7%
排第三,兩個都輸
OSWorld 2.0
實際操作電腦
超越 Fable 5 最佳成績✅ 約三分之一成本
Zapier AutomationBench
自動化流程
約次佳者 1.5 倍✅ 同等成本下

我特別把 DeepSWE 那一列標出來:在這項代理式編程測試上,Opus 5 是第三名,前面還有 GPT-5.6 Sol 和自家的 Fable 5。這不是黑它,而是說明一件很重要的事——沒有任何一個模型在所有事情上都最強。誰跟你說「用這個就對了」,通常是還沒看完整張表。

為什麼「開到最大」反而可能更差?

這是我認為這次發布最值得寫進課堂的一段。

Claude Opus 5 有五段「用力程度」(官方叫 effort)可以調:low、medium、high、xhigh、max。直覺上你會覺得——那當然開 max 啊,最強的當然最好。

但 The Decoder 檢視 Anthropic 自家公布的測試數據後指出:在兩個測試項目上,Opus 5 在 max 這一檔的分數,反而比第二高的檔次略低,而成本更高。

換句話說,那個「用力」的旋鈕不是音量鍵,比較像是換一條路走。走大路不一定比較快到,有時候還多繞了一段、多付了油錢。

官方自己怎麼建議?(這裡很多人傳錯,我把原文查了)

Anthropic 的技術文件對 Opus 5 的建議是:編程和代理類工作從 xhigh 開始,其他吃智力的工作用 high;而 low 和 medium 在 Opus 5 上比前幾代更強,只要你自己測過品質守得住,就可以大方拿它們來控成本,真正需要時再往上開到 max。文件還特別提醒:如果你是從舊模型沿用設定過來的,請重新測一次,別直接照搬。

(網路上有說法是「官方建議多數任務用 low/medium」——那其實是寫給 Opus 4.7/4.8 的段落,不是 Opus 5。這種細節錯很容易在轉述中被放大,所以我回去查了原始文件。)

第三方實測怎麼說?

光看官方數據不夠。程式碼審查工具 CodeRabbit 用自己的實際案例測了 Opus 5(x-high 檔位),結果很值得玩味:

  • 抓到已知問題的比例:55.2%,反而低於他們原本用的基準線(GPT-5.6 系列)的 61.1%。
  • 建議的精準度較高:39.3% vs 35.2%——講的話比較少廢話。
  • 代價是瑣碎意見多了快 4 倍:92 則 vs 23 則。
  • 而且吃更多資源:輸入 token 約多 50%、輸出約多 65%。
  • 強項在設定錯誤與程式碼品質;弱項在邏輯錯誤、競態條件、API 誤用

他們的結論不是「快換」,而是:給它一個明確的專科角色,別讓它當唯一的把關者。

這句話幾乎可以原封不動搬到任何公司的 AI 導入會議上。

誠實說:這篇不能告訴你什麼

我得把話講清楚,免得你把這篇當成採購依據:

  1. Benchmark 不等於你的工作。上面每一個測試都是特定情境下的分數,跟「幫你回客戶信」「整理這個月的銷售表」不是同一件事。
  2. 模型發布首週的數據都要打折看。官方數據是廠商自己跑的;第三方實測樣本也有限。真正的體感通常要一兩個月後才穩定。
  3. 我沒有做獨立實測。這篇的數字全部來自官方公告、The Decoder 的整理與 CodeRabbit 的公開報告,我做的是交叉比對,不是自己重跑一遍。
  4. 「max 掉分」是在特定測試上觀察到的現象,不代表你的每個任務都會這樣——這正是官方要你「自己重測一次」的原因。

那對上班族和老闆,實際意義是什麼?

我在企業培訓現場最常被問的一句話是:「老師,那我們公司到底要用哪一個?」

這次的發布剛好給了一個很好的答案框架——不要問「哪個最強」,要問「哪一檔剛好夠用」

三個可以直接拿去用的判斷:

  • 預設不要開到最大。 大部分日常工作(寫信、摘要、整理會議記錄)用中等檔位就綽綽有餘,開最大只是多花錢多等時間。
  • 把「省下來的成本」當成一個指標來管。 同樣一份工作,用對檔位可能差好幾倍成本。這在一個月幾萬次呼叫的公司裡,是真實的數字。
  • 不要指望一個模型全包。 連 Opus 5 都有輸的項目,你公司的流程更該是「不同任務配不同工具」,而不是全押一個。

我常跟學員說,你是機長,AI 是機組人員。這次的數據又補上了一課:機組人員裡最資深的那位,不見得每趟航班都該派上場。派對人、派對時機,才是機長的本事。

而這件事,以前是需要一個懂技術的人坐在旁邊才做得到的判斷。現在它變成一個管理決策——會判斷「這個任務值不值得用貴的」,比會操作任何一個工具都值錢。

常見問題 FAQ

Q:那我現在該換到 Opus 5 嗎?

如果你是一般使用者(用網頁版聊天),基本上不用做什麼——平台會自動給你當前最好的選項。如果你是公司在用 API,建議照官方說的:拿你自己真實的工作重新測一輪各個檔位,再決定配置,不要直接照搬舊設定。

Q:價格真的沒漲嗎?

沒漲。輸入每百萬 token $5、輸出 $25,跟 Opus 4.8 相同。快速模式是兩倍價、約 2.5 倍速度,屬於另外的選項。

Q:既然最高檔可能更差,那是不是永遠別用 max?

不是。官方的說法是「真正值得的任務再開到 max」。重點在於「你要有測過的依據」,而不是憑感覺一路拉到底。

Q:這些 benchmark 我看不懂,有沒有簡單的判斷方法?

有。挑三件你每週真的會做的事,用兩三個模型各跑一次,自己比。這比看任何排行榜都準——因為排行榜測的不是你的工作。

資料來源

以下所有數據均於 2026 年 7 月 25 日查證,並交叉比對官方公告與兩份第三方報告:

註:模型評測數字會隨版本與測試方法變動,本文為發布首週的公開資料整理,不構成採購建議。

想把「怎麼選、怎麼配」變成公司的能力?

如果你是想自己搞懂的個人:歡迎訂閱我的電子報 startupforyou.substack.com,每週一篇看得懂的 AI 應用。

如果你是替公司做決定的主管或 HR:這種「哪個任務配哪個工具、開到哪一檔」的判斷力,正是我在企業內訓裡花最多時間帶的部分。想聊聊你們的情況,寫信到 ai@autolab.cloud,或看看 AI 顧問教練團

關於作者
黃敬峰(AI峰哥/阿峰老師),企業 AI 實戰培訓專家,服務客戶包含國泰人壽、工研院、士林電機、中嘉寬頻、電通、城邦媒體等。聯絡方式:ai@autolab.cloud

ClaudeOpus 5AI模型比較模型選型成本控制企業AIAI趨勢

常見問題

那我現在該換到 Opus 5 嗎?

如果你是一般使用者(用網頁版聊天),基本上不用做什麼——平台會自動給你當前最好的選項。如果你是公司在用 API,建議照官方說的:拿你自己真實的工作重新測一輪各個檔位,再決定配置,不要直接照搬舊設定。

價格真的沒漲嗎?

沒漲。輸入每百萬 token $5、輸出 $25,跟 Opus 4.8 相同。快速模式是兩倍價、約 2.5 倍速度,屬於另外的選項。

既然最高檔可能更差,那是不是永遠別用 max?

不是。官方的說法是「真正值得的任務再開到 max」。重點在於「你要有測過的依據」,而不是憑感覺一路拉到底。

這些 benchmark 我看不懂,有沒有簡單的判斷方法?

有。挑三件你每週真的會做的事,用兩三個模型各跑一次,自己比。這比看任何排行榜都準——因為排行榜測的不是你的工作。