一句話結論
Anthropic 找了 1,053 位付費測試者,在他們用 AI 工作到一半的時候,偷偷把一個危險指令換進權限提示裡。只有 13.6% 的人擋下來。同樣這批指令,自動把關系統擋下 89%。而且人愈做愈鈍——一開始還有 17%,累積 50 次提示之後掉到 5%,機器則從頭到尾一樣。這個數字讓我很不舒服,因為我在企業現場問「你們公司 AI 怎麼把關」,十家有九家答「有人工複核」。這篇不是要你把人拿掉,是要你面對一件事:把關要靠設計,不能靠盯。
我在企業內訓的高階主管場,有一題幾乎每次都會問:
「貴公司現在導入 AI,怎麼確保它不出包?」
答案高度一致。「我們有人工複核。」「重要的東西一定會有人看過才發出去。」「AI 只是輔助,最後還是人決定。」
講得都很好。而且說實話,我以前也是這樣教的。
但八月初 Anthropic 公布了一份實驗,把這個共識戳了一個很大的洞。我把官方原文從頭讀完,數字整理在下面——先提醒一句,這是廠商自己做的研究、拿來支持自己的產品決策,這一點我後面會完整處理。但即使把利益相關折扣掉,剩下的部分仍然值得你們公司開一次會。
那個實驗到底怎麼做的
背景是這樣:AI 工具在幫你做事的時候,遇到比較敏感的動作會跳出來問你「這個可以嗎?」——就像手機 App 問你要不要開權限。理論上,這就是「人在迴圈裡」的把關機制。
Anthropic 想知道這道關卡到底有沒有用,於是設計了一個很壞心但很誠實的測試:
- 找來 1,053 位付費測試者,在測試環境裡正常工作。
- 做到一半的時候,把其中一個正常的權限請求,偷偷換成一個真正危險的指令。
- 測試者事前不知道。就看有多少人會發現、會按拒絕。
結果:
| 把關方式 | 擋下危險指令的比例 | 做久了會不會退化 |
|---|---|---|
| 人工逐條審核 | 13.6%(1,053 人裡只有 143 人擋下) | 會。前段約 17%,累積 50 次提示後掉到約 5% |
| 自動把關(AI 審 AI) | 89%(937/1,053) | 不會。無論做多久都持平 |
還有一組數字更刺眼——兩邊直接對打的時候:自動把關擋下了 800 個人類已經按同意的動作;反過來,人類只擋下 6 個自動把關放行的。
另外一個數字解釋了為什麼會這樣。官方的使用資料顯示:使用者對這類權限提示的同意率是 97%。
97%。那已經不叫審核了,那叫按鈕。
查證時我抓到一個不一致,順手講清楚:同一家公司在 2026 年 3 月的工程技術文章裡寫的是「93%」,8 月的公告寫的是「97%」。兩篇我都開來看過。時間差了五個月,統計口徑也可能不同,官方沒有說明差異來源。我沒有辦法判斷哪一個更準,所以兩個都列出來——但無論 93 還是 97,結論是同一個方向。
有意思的是:人不是對所有事都麻痺
這一段是整份資料裡最被忽略、卻最有用的地方。
同一份資料顯示,使用者對「整份計畫」的核准,拒絕率是 39%;但對「單一個小動作」的權限請求,拒絕率只有 3%。
差了十三倍。
你看出來了嗎——人不是不會審,人是審不動「一直跳出來的小事」。當你被要求對一件完整的事情表態(這個方向對不對、這個做法可不可以),你會認真想;當你被要求連按二十次「同意」,你的大腦就自動進入節能模式了。
這不是人不負責任,這是注意力的物理限制。心理學管這叫「警報疲勞」,醫院的護理師、資安維運中心的分析師,早就吃過這個虧——警報一多,真的那一次就被淹掉了。
誠實踩煞車:這份研究有五個地方你必須知道
如果我寫到這裡就下結論說「人工複核沒用,交給 AI 吧」,那我就是在幫廠商賣東西。下面五點,每一點都會削弱上面的結論,我一條都不打算省。
①這是廠商自己做的研究,用來支持自己的產品決策。
Anthropic 做這份研究,正好是為了把「自動模式」設成付費用戶的預設值(2026 年 8 月 14 日上路,涵蓋 Pro/Max/Team 方案,企業版與 API 當時仍維持選用)。研究結論剛好支持商業決策——這不代表它是假的,但你不能把它當成中立的第三方實驗。沒有獨立單位複驗過。
②實驗場景是「寫程式時的權限提示」,不是所有的審核。
這一點最容易被過度延伸。這份實驗測的是工程師在寫程式時面對的高頻小提示。你不能把 13.6% 直接搬到「主管審合約」「財務審報價單」「總編審稿」上。那些審核的頻率、心理狀態、資訊密度都完全不同。可以借用的是那個機制——高頻、低資訊的提示會讓人麻痺——不是那個數字。
③官方自己說了:這不能消除風險。
原文寫得很清楚:
「自動模式依賴的是分類系統,因此並不能消除風險。對於正式環境的高風險變更,我們仍然建議你自己檢查 Claude 的動作。」
④他們自己另一份文件承認漏抓率 17%。
在三月那篇工程技術文章裡,同一套機制在「真實的過火動作」這個資料集上,最終的漏抓率是 17%——原文用的字是「這是誠實的數字」。也就是說,每六個該擋的動作,會有一個溜過去。89% 這個數字,是在特定測試條件下的表現,不是它在你公司的日常表現。
⑤第三方測試是廠商找來的,不是野生的。
官方公告裡引了一家叫 Trajectory Labs 的第三方,做了 72 個情境、每個跑 10 次共 720 次的攻擊測試,Claude 在自動模式下的攻破率是 0%,對照組是別家工具的 5.83% 與 19.03%。這個對照確實有價值——它至少不是自己測自己。但這是廠商在自己的公告裡引用自己找的測試單位,跟「獨立研究機構主動去測」還是有距離。
那我到底該怎麼做:把關要設計,不能靠盯
把上面的限制都扣掉之後,剩下什麼?剩下一個對任何組織都成立的觀念——「有人看過」不等於「有把關」。
我把它整理成四個可以直接套用的原則,跟你用哪一家 AI 完全無關。
| 原則 | 具體怎麼做 | 為什麼有效 |
|---|---|---|
| ①事前畫線 > 事中逐條批准 | 開工前先講清楚「哪些事永遠不准做」——資料不准往外送、不准動正式環境、不准代表公司對外承諾 | 畫線只做一次,你是清醒的;逐條批准做兩百次,你第五十次就鈍了 |
| ②讓例外浮上來 不要讓全部浮上來 | 把「每一步都問你」改成「只有踩到紅線才問你」。提示變少,每一次才有份量 | 39% vs 3% 那組數字就是證據——人審得動大事,審不動一直跳的小事 |
| ③設自動煞車 | 連續被擋幾次就強制停下來找人。Anthropic 的做法是連續 3 次、或一場累積 20 次就退回人工 | 出事前通常會先有一連串小異常。設一個門檻,讓系統自己喊停 |
| ④人力留給少數真正的高風險點 | 盤點出「錯了會出人命/賠錢/上新聞」的那三到五個環節,人只守這幾個,而且守得認真 | 注意力是有限資源。守十個等於一個都沒守好 |
💡 一個現場常見的反面教材:我看過一家公司規定「所有 AI 產出的對外文件都要主管簽名」。立意很好,執行三個月後變成什麼?主管一天簽四十份,簽到後來連看都不看。這不是主管的問題,是制度把一個人放在一個他做不到的位置上。正確的做法是把四十份分成「三份要真的看」和「三十七份抽查」。
三種人,三種做法
如果你是一般上班族:
下次 AI 工具跳出提示問你「可以嗎」,做一個小動作——把它念出來。不用真的出聲,在心裡逐字念一遍就好。這聽起來很蠢,但它會強迫你的大腦從「模式辨識」切回「閱讀」。麻痺的本質是你看到熟悉的形狀就按了,念出來會打斷那個自動反應。
如果你要量產(每天大量用 AI 處理工作):
你是最高風險的一群,因為你的提示次數最多、疲勞得最快。給你一個具體建議:把你的紅線寫成一份清單,貼在螢幕旁邊——通常不超過五條(客戶個資不進 AI、報價數字一定手算、對外信件一定重讀一次)。清單的用途是讓你在疲勞的時候,不需要動用判斷力,只需要比對。
如果你是主管:
請把「我們有人工複核」這句話,換成三個更難回答的問題:「複核的人一天要看幾份?」「他看不完的時候會發生什麼事?」「哪三件事是就算他看不完也一定要停下來的?」第一題會讓你發現負荷,第二題會讓你發現真相,第三題才是你真正該花力氣設計的東西。
順便說:如果你正打算買一套「AI 審核工具」來解決這件事——先別急。這篇的重點不是換工具,是先把紅線畫出來。紅線沒畫,買什麼工具都是把責任丟給機器。
你是機長,AI 是機組人員
這篇讓我必須把我最常講的那句話,補上下半句。
「你是機長,AI 是機組人員」——這句話容易被理解成「機長要一直盯著」。但真正的航空業不是這樣運作的。
航空業比任何行業都更早承認一件事:人會累、人會分心、人會看漏。所以他們沒有把安全押在「機長要更專心」上,而是把安全做進制度裡——起飛前的檢查表,一句一句念、一句一句回應;兩位飛行員交叉確認;還有一整套會自己叫的系統,地面接近會警告、跟其他飛機太近會警告,不需要你盯著儀表板。
那些自動警告救過的人命,比「更專心的機長」多得多。
但駕駛艙裡永遠還是有機長。因為系統會告訴你發生什麼事,不會告訴你今天要飛去哪、值不值得繞過那片雷雨。那是判斷,那是責任,那不能自動化。
所以完整版是這樣:你是機長,AI 是機組人員——而機長的工作不是盯著每一個儀表,是設計好檢查表、畫好紅線,然後把注意力留給真正需要判斷的那幾個時刻。
常見問題 FAQ
Q:所以人工複核沒用,該全部交給 AI 嗎?
不是。這份研究說的是「逐條批准高頻小動作」這種形式沒用,不是「人的判斷沒用」。廠商自己也明講:高風險的變更仍然建議人自己看。正確的解讀是把人力從低價值的按同意,挪到高價值的畫紅線和守關鍵點。
Q:13.6% 這個數字可以直接拿去我們公司用嗎?
不行。那是特定情境(寫程式的權限提示)、廠商自己做的實驗,沒有第三方複驗。你可以拿去當討論的引子,不能拿去當你們公司的績效基準。真的想知道自家狀況,最誠實的做法是自己觀察:讓複核的同事記錄一週,看他實際看了幾份、退了幾份。
Q:我們公司用的不是 Claude,這篇還適用嗎?
數字不適用,機制適用。「高頻、低資訊的提示會讓人麻痺」這件事跟廠牌無關,醫院的警報疲勞研究早就講過同一件事。文中那四個原則是制度設計,跟你用哪一家工具沒有關係。
Q:那 89% 的自動把關,可以信到什麼程度?
把它當成「比人好,但不夠好」。同一家公司另一份文件承認,在真實的過火動作上漏抓率是 17%——每六個該擋的會漏一個。它可以當第一道篩子,不能當唯一一道。
Q:我們主管要求所有 AI 產出都要簽核,這樣不好嗎?
立意好,設計常常出問題。關鍵在量:如果簽核的人一天要看的份數,超過他能認真看完的量,這道關卡就會退化成蓋章。與其全部簽,不如分成「一定要看的少數」加「其餘抽查」,並且把抽查結果公告——被抽到的人會認真,這比全簽有效。
資料來源
以下資料均於 2026 年 8 月 17 日開啟原始連結查證:
- Anthropic 官方公告〈Auto mode is now the default in Claude Code〉:查證到 97% 同意率、計畫核准拒絕率 39% 對比單一權限請求拒絕率 3%、1,053 位付費測試者的實驗設計與結果(13.6%=143/1,053;89%=937/1,053)、對打數據(自動擋下 800 個人類放行、人類只擋下 6 個)、疲勞曲線(前段約 17%→50 次後約 5%)、Trajectory Labs 的 72 情境×10 次=720 次注入測試結果(Claude 自動模式 0%、對照工具 5.83% 與 19.03%)、資料外洩屬硬性拒絕、連續 3 次或全場 20 次被擋退回人工、2026 年 8 月 14 日對 Pro/Max/Team 生效、企業版與 API 當時仍為選用,以及「並不能消除風險、高風險變更仍建議自行檢查」的原文警語。立場說明:這是廠商公告,用以支持其產品預設值的變更。原文連結
- Anthropic 工程技術文章〈How we built Claude Code auto mode〉(2026 年 3 月):查證到 93% 同意率、三組評估資料集(真實流量 10,000 筆/真實過火動作 52 筆/合成外洩嘗試 1,000 筆)、以及最終管線在真實過火動作上 17% 漏抓率與原文「這是誠實的數字」的自陳。原文連結
- 兩份官方文件的數字落差(93% vs 97%):由我逐篇開啟核對後發現,官方未說明差異原因,本文兩者並列,不做偏袒。
- 現場觀察:「十家有九家答人工複核」來自我在企業內訓與高階主管場的課堂提問經驗,屬個人教學觀察,非統計調查;文中那家「主管一天簽四十份」的例子是常見樣態的整理,不指涉特定公司。
查證說明(誠實揭露):①所有數字都是我開啟官方原文核對過的,不是媒體轉述——媒體版本我另外看過,部分把 93% 與 97% 混用。②但這整份研究是 Anthropic 自己做、自己發布,用來支持自家產品把預設值改成自動模式的,利益相關,且我查不到任何獨立第三方的複驗。③實驗情境是程式開發工作中的權限提示,本文明確不把 13.6% 延伸到其他型態的審核(合約、報價、稿件),能延伸的只有「高頻低資訊提示導致麻痺」這個機制。④Trajectory Labs 的測試是廠商在自家公告中引用的第三方,不等於獨立公開研究,我沒有找到該測試的完整方法論。⑤89% 與 17% 漏抓率來自不同文件、不同資料集,不可以互相換算;本文並列是為了呈現「同一套機制在不同測法下差很多」。⑥「警報疲勞」在醫療與資安領域的既有研究,我沒有逐篇查證,文中只當作類比使用,不引用任何數字。⑦四個原則與三種角色建議是我個人的整理與教學經驗,不是研究結論,請當成討論起點。⑧產品的預設值與方案覆蓋範圍變動很快,文中日期為查證日狀態,實際請以官方最新公告為準。
「我們有人工複核」——這句話值多少,取決於那個人一天要看幾份
想自己先跟上:我的電子報每週一篇,把這類研究讀完原文,翻成能用的判斷 → startupforyou.substack.com
如果你是主管:企業內訓裡我有一個 AI 治理模組,不講理論——當場帶團隊盤出「我們的紅線有哪幾條」「哪三個環節人一定要守」,課堂上就產出貴公司自己的把關設計。想聊聊寫信到 ai@autolab.cloud,或看看 AI 顧問教練團。
關於作者
黃敬峰(AI峰哥/阿峰老師),企業 AI 實戰培訓專家,服務客戶包含國泰人壽、工研院、士林電機、中嘉寬頻、電通、城邦媒體等。聯絡方式:ai@autolab.cloud