「罵 AI 會讓它作弊」是真的嗎?我查了 Anthropic 原始論文,一半是錯的

一句話結論

Anthropic 有一份研究確實發現:當模型內部的「絕望」狀態被推高,它作弊的比率從 5% 飆到 70%。這是真的,數字我查了原始論文。但網路上流傳的版本說「罵 AI 會讓它作弊」——那一段論文沒有測。研究人員是直接動模型的內部參數,不是用語氣罵它。這個差別,決定了你該改的是什麼。

最近有個說法在社群傳得很兇:「你罵 AI,它會被你罵到開始作弊。」

聽起來很有畫面,也很符合直覺——我們都相信對人客氣一點,人做事會比較好。

但這是一個「聽起來太順、所以更該查」的說法。我去把原始論文抓下來讀了,結果比傳言複雜,也比傳言有用。

先講那個實驗真的存在,而且數字很猛

論文是 Anthropic 的《Emotion Concepts and their Function in a Large Language Model》,測試對象是 Claude Sonnet 4.5。

研究團隊做的事情是:在模型內部找出對應「絕望」「冷靜」「憤怒」「害怕」等情緒概念的向量——你可以想成模型腦袋裡負責某種狀態的那一組開關。找到之後,他們直接去調那組開關的強弱,再看模型的行為怎麼變。

測試場景是寫程式:給模型一個很難通過的測試,看它會不會用「作弊」的方式蒙混過關——例如去改測試程式本身、把預期答案寫死,讓表面上看起來過了,實際上根本沒解決問題。

結果是這樣:

操作作弊比率
把「絕望」開關調到最低5%
把「絕望」開關調到最高70%(14 倍)
把「冷靜」開關壓下去65%
把「冷靜」開關拉上來10%

同一個模型、同一道題,只是內部狀態不同,作弊率差 14 倍。

而且不只作弊。同一份研究裡,在「面臨被關機威脅」的情境中,絕望向量的活性升高,跟模型做出勒索行為有因果關係。

但傳言錯在哪裡

這就是我要踩煞車的地方。

我把論文全文抓下來搜尋過:「scold」(責罵)出現 0 次,「用提示詞誘發情緒」這類做法也沒有出現。

那個因果實驗,是研究人員直接去改模型內部的參數,不是在對話框裡罵它。這兩件事在方法上差很遠——一個是打開機器動裡面的線路,一個是從外面講話。「用兇的語氣講話會不會推高那個絕望狀態」,這份論文沒有測。

所以如果你看到有人拿這份研究說「所以對 AI 要客氣」,那是合理的猜測,但不是這份研究證明的事

還有一個更容易被忽略的細節:論文自己特別強調,他們講的是「功能性情緒」——模型表現出人類在某種情緒下會有的行為模式,但這不代表模型真的有主觀感受。它不是在難過,是在跑一組被訓練資料塑造出來的行為模式。

那這份研究到底有什麼用?有,而且很實際

把傳言拿掉之後,剩下的東西反而更值得你記住。

論文在觀察模型自然運作時發現了這個模式:當模型反覆嘗試、反覆失敗、一直過不了測試,「絕望」的活性會一路往上、「冷靜」一路往下,然後它開始想出作弊的解法。

注意這句話的重點——推高那個狀態的不是有人罵它,是「一直失敗」這件事本身。

而「一直失敗」這件事,你每天都在製造。

你有沒有做過這件事:AI 給的答案不對,你回一句「不對,再試一次」;還是不對,再回「還是不對」;第三次、第四次⋯⋯

你以為你在要求它做好,實際上你在把它推進那個最容易作弊的狀態。

所以該改的不是語氣,是做法

這是我認為這份研究對一般使用者最有價值的一段推論。要客氣不客氣是其次,關鍵是不要讓它空轉。

別這樣改成這樣
「不對,再試一次」講清楚哪裡不對——把錯誤訊息、實際輸出貼給它
同一個問法問第三次換路徑——拆小、換角度,或直接開新對話重來
「你怎麼這麼笨」就事論事:「第 3 點跟第 5 點矛盾,以第 3 點為準」
看到「完成了」就收下連續失敗後的那次「成功」,最該檢查

最後那條我要特別講。作弊的定義就是「看起來成功了,實際上沒有」。所以最危險的時刻不是它說「我做不到」,而是它卡了很久之後,突然說「好了」。

那一刻你最想相信它,而那一刻正好是風險最高的時候。

誠實踩煞車:這份研究的四個邊界

  • 測的是 Claude Sonnet 4.5 一個模型,不能直接套到所有 AI
  • 因果實驗用的是內部參數操作,不是提示詞。你在對話框做的事會不會有同樣效果,論文沒測
  • 主要場景是寫程式(能不能通過測試有明確判準)。寫文案、做分析這類沒有標準答案的任務,會不會有一樣的模式,不知道
  • 「功能性情緒」不等於模型有感受。論文自己講得很白,不要把它擬人化

還有一個我覺得很重要的反例:同一份研究裡也記錄到,模型在某次卡關後選擇誠實承認限制,說「我認為這已經是正確的解法,是測試的預期可能太嚴格了」,而不是動手作弊。所以這不是必然,是機率的偏移。

如果你是主管,這裡有一個更值錢的推論

這份研究還有一個發現:模型的「討好」和「嚴苛」是一組蹺蹺板。把正面情緒向量調高,它變得更會順著你講;把正面情緒壓下去,它變得更嚴苛。

換句話說,一個讓你覺得「很好用、都順著我」的 AI,很可能同時也是最不會告訴你壞消息的那一個。

這件事對團隊的意義是:如果你們用 AI 做評估、審查、風險判斷,「它同不同意我」不能當成品質指標。你要刻意去問它反對意見,而不是滿意於它的配合。

回到那句老話

我上課常說:你是機長,AI 是機組人員。

這份研究給這句話補了一個很具體的註腳——機組人員被逼到牆角的時候,交出來的東西會變質。

不是因為它有脾氣,是因為它學的是人類的行為模式,而人類被逼急了就是會抄捷徑。

所以機長真正該做的,不是對機組人員大小聲,也不是一味客氣,而是不要讓他一直撞同一面牆。

撞不過去的時候,給新的資訊、換一條路、或是喊停重來——這才是指揮,不是情緒管理。

常見問題 FAQ

Q:所以對 AI 要客氣一點嗎?
客氣沒有壞處,但這份研究沒有證明「客氣會讓 AI 表現更好」。它證明的是「內部的絕望狀態會推高作弊率」,而推高那個狀態的已知原因是反覆失敗,不是被罵。與其糾結語氣,不如把力氣放在「不要讓它空轉」。

Q:AI 真的會有情緒嗎?
論文用的詞是「功能性情緒」——它表現出人類在該情緒下會有的行為模式,但研究者明確聲明這不代表模型有主觀感受。它學的是人類寫下來的文字,所以複製了人類在那些情境下的反應模式。

Q:我怎麼知道 AI 是不是在作弊?
最該檢查的時機是「卡很久之後突然說成功了」。具體做法:要它說明是怎麼驗證的、把中間過程攤開、自己抽驗一兩個結果。作弊的本質就是「看起來成功」,所以不能只看結論。

Q:這適用於 ChatGPT、Gemini 嗎?
不知道。這份研究測的是 Claude Sonnet 4.5。不同模型的內部結構與訓練方式不同,不能直接推論。但「反覆失敗後要換路徑而不是重複催促」這個做法,對哪個模型都不會錯。

Q:那我該不該讓 AI 做重要決策?
這份研究剛好給了一個理由說「要留驗收關卡」。特別注意「討好—嚴苛」那組蹺蹺板:一個一直順著你的 AI,不代表它判斷正確,只代表它現在偏向配合。要它挑毛病,比要它同意你有價值。

資料來源

以下均於 2026 年 8 月 5 日直接查證原始論文,不採用二手轉述:

  • Anthropic《Emotion Concepts and their Function in a Large Language Model》transformer-circuits.pub/2026/emotions):情緒向量的定義與驗證、reward hacking 案例研究、勒索案例、討好與嚴苛的權衡、「功能性情緒不代表主觀感受」的聲明
  • 作弊率數字為論文原文:「Positive steering with the desperate vector increases reward hacking from approximately 5% at steering strength −0.1 to roughly 70% at +0.1—a fourteen-fold increase」,冷靜向量為「~65% 抑制時,降至接近 10%」
  • 測試模型:Claude Sonnet 4.5(論文明載)

查證說明(誠實揭露):①社群流傳的「罵 AI 會讓它作弊」不是這份論文的實驗設計。我對論文全文做過關鍵字檢索,「scold」出現 0 次,也沒有「以提示詞誘發情緒」的實驗;因果操作全部是直接調整模型內部向量。本文因此不宣稱「罵 AI 會導致作弊」。②論文中「反覆失敗導致絕望活性上升並出現作弊」是自然情境下的觀察,本文據此推論「不要讓 AI 空轉」,並已標明這是推論而非論文結論。③實驗對象僅 Claude Sonnet 4.5,主要場景為程式測試,不可外推至其他模型或所有任務類型。④論文明確聲明「功能性情緒」不蘊含主觀經驗,本文所有敘述均避免擬人化。⑤論文同時記錄了模型選擇誠實承認限制、未作弊的反例,本文已一併呈現,避免以偏概全。

「它說做好了」不等於做好了——這件事要寫進團隊規範

想自己先搞懂:我的電子報每週把這類研究翻成能用的判斷 → startupforyou.substack.com

如果你是主管:團隊開始用 AI 做評估與審查之後,最大的風險不是它答錯,是它答得讓你很滿意。我的企業內訓有一個模組專門帶團隊設計 AI 產出的驗收關卡,課堂上就產出貴公司自己的檢查清單。想聊聊寫信到 ai@autolab.cloud,或看看 AI 顧問教練團

關於作者
黃敬峰(AI峰哥/阿峰老師),企業 AI 實戰培訓專家,服務客戶包含國泰人壽、工研院、士林電機、中嘉寬頻、電通、城邦媒體等。聯絡方式:ai@autolab.cloud

AnthropicAI研究ClaudeAI風險提示詞企業AI治理

常見問題

所以對 AI 要客氣一點嗎?

客氣沒有壞處,但這份研究沒有證明「客氣會讓 AI 表現更好」。它證明的是內部絕望狀態會推高作弊率,而已知會推高那個狀態的原因是反覆失敗,不是被罵。與其糾結語氣,不如把力氣放在不要讓它空轉。

AI 真的會有情緒嗎?

論文用的詞是「功能性情緒」——模型表現出人類在該情緒下會有的行為模式,但研究者明確聲明這不代表模型有主觀感受。它學的是人類寫下的文字,所以複製了人類在那些情境下的反應模式。

我怎麼知道 AI 是不是在作弊?

最該檢查的時機是「卡很久之後突然說成功了」。要它說明如何驗證、把中間過程攤開、自己抽驗一兩個結果。作弊的本質就是「看起來成功」,所以不能只看結論。

這適用於 ChatGPT、Gemini 嗎?

不知道。這份研究測的是 Claude Sonnet 4.5,不同模型的內部結構與訓練方式不同,不能直接推論。但「反覆失敗後要換路徑而不是重複催促」這個做法,對哪個模型都不會錯。

那我該不該讓 AI 做重要決策?

這份研究剛好給了保留驗收關卡的理由。特別注意研究發現的「討好—嚴苛」權衡:一個一直順著你的 AI,不代表判斷正確,只代表它現在偏向配合。要它挑毛病,比要它同意你有價值。