Gemini 3.5 Transcribe 能分辨誰在說話——但開了這功能,音檔上限從 1 小時掉到 30 分鐘

一句話結論

Google 八月二十六日推出 Gemini 3.5 Transcribe,最大賣點是能分辨誰在說話——這正是「會議逐字稿」卡最久的一關。但官方文件寫了三件行銷頁沒強調的事:開了說話者分辨,音檔上限從 1 小時掉到 30 分鐘即時串流不支援分辨;語言清單裡我查到的中文只有簡體普通話與繁體粵語,沒有台灣繁中的獨立條目。你的會議如果是九十分鐘、五個人、講國語,這三件事你都會撞到。

企業導入 AI,最常見的第一個需求不是寫文案,是會議記錄

而會議記錄最難的一段從來不是「把聲音變成字」——那件事三年前就做得不錯了。難的是「這句話是誰講的」。沒有這一段,逐字稿就是一大坨文字,你還是得從頭聽一次才知道誰答應了什麼。

八月二十六日,Google 發表 Gemini 3.5 Transcribe,把說話者分辨(speaker diarization)放進了主打功能。這值得看,但也值得先把文件讀完再決定要不要換。我把官方部落格和 API 文件都翻過一遍,下面是查到的東西。

它做到了什麼

照 Google 官方部落格的說法,這個模型的重點功能有這些:

  • 聰明轉錄:會處理講者的自我修正、移除贅字(呃、然後、那個)、自動排版
  • 自動語言偵測:號稱可偵測並轉錄超過 85 種語言,支援句中與句間的語言切換(中英夾雜不用手動設定)
  • 說話者分辨:能標出不同的人
  • 自訂詞彙:可以餵專有名詞、縮寫、人名進去,讓它認得
  • 字級時間戳:每個字對應到影片的第幾秒

Google 自己公布的準確度數字是:串流的字錯率(WER)4.0%、非串流 2.6%;在 FLEURS 這個公開測試集上,串流 5.50%、非串流 5.04%。另外宣稱「產出最終逐字稿的時間改善 70%」。

這些都是廠商自己公布的數字,我沒有看到第三方獨立評測,也沒有中文分項的成績。當成參考,不要當成保證。

坑一:開了說話者分辨,音檔上限砍掉一半

這是我認為最該先知道的一條。API 文件寫得很清楚:

一般的檔案轉錄支援最長 1 小時的音檔。但當你啟用說話者分辨或字級時間戳這類功能,「音訊處理限制為 30 分鐘」。

換句話說,你最想要的那個功能,會讓可處理的長度變成一半。

而台灣企業的會議,九十分鐘是常態,兩小時也不稀奇。這代表你必須切檔。

切檔會衍生一個實務問題,這一點是我的推論、文件沒有明講:說話者標籤是「說話者 1、說話者 2」這種相對編號,不同段落各自處理時,編號很可能對不起來——第一段的「說話者 2」到第二段可能變成「說話者 1」。你如果要串成一份完整逐字稿,中間需要人工對齊,或是自己想辦法用重疊片段去比對。

所以「能分辨說話者」這件事,在超過三十分鐘的會議上,不是開了就自動好了

坑二:即時串流不支援說話者分辨

這個模型有兩個版本:gemini-3.5-transcribe(處理檔案)和 gemini-3.5-transcribe-live(即時)。

而說話者分辨只在檔案處理那一邊。文件在即時串流那一欄直接標「不支援」,並要你改用非串流的音訊轉錄端點。

所以如果你想像的畫面是「開會的時候螢幕上即時跑出誰在說什麼」——這個版本做不到。你得先錄完,再丟進去跑。

坑三:官方語言清單裡,我沒找到台灣繁中

這一點我要講得特別小心,因為它牽涉到「查不到」和「不支援」的差別。

官方文件宣稱支援超過 85 種語言,並附上 BCP-47 語言代碼清單。我在清單裡查到的中文相關項目只有兩個:

代碼文件上的標示
cmn-Hans-CNMandarin Chinese (Simplified)/中文普通話(簡體)
yue-Hant-HKCantonese (Traditional)/粵語(繁體)

沒有 cmn-Hant-TW,也沒有 zh-TW 的獨立條目。

這代表什麼、不代表什麼,要分清楚:

  • 不代表它聽不懂台灣人講國語。語音辨識的聲學模型認的是發音,普通話和台灣國語差距沒有大到聽不懂。
  • 但很可能代表輸出的文字會是簡體,而且台灣特有的詞彙(例如「小編」「里長」「勞健保」「發票載具」)辨識率可能不理想。
  • 我沒有實測。這篇是文件查證,不是實測報告。真實效果如何,你要自己丟一段錄音進去試。

如果你要用,自訂詞彙那個功能就是你的補救工具——它最多可以餵 1,000 個詞,不過文件也說「通常在 100 個詞以內效果最好」。所以把貴公司的產品名、部門名、常出現的人名整理成一份一百字以內的清單,是實務上最划算的一步。

坑四:官方兩個地方寫的人數不一樣

這件事我查到的時候愣了一下,所以照實寫。

來源說話者上限的寫法
Google 官方部落格(發表文)支援最多三位說話者(三位以上為實驗性質)
Gemini API 官方文件支援最多八位說話者(三位以上的歸屬為實驗性質)

兩邊都是 Google 官方,但一個寫三、一個寫八。我兩個頁面都讀過,也在兩份不同的 API 文件頁面上重複確認了「最多 8 位」這個寫法。

合理的解讀是:八是技術上限,三是「能穩定用」的上限——因為兩邊都同意「三人以上是實驗性質」。

對你的意義很直接:四個人以上的會議,說話者標籤請當成草稿,不要當成事實。寫進正式會議記錄之前,人要看過。

那到底該不該用?

你的情境這個模型合不合用
一對一訪談、兩人通話,30 分鐘內最甜蜜的區間——人數在穩定範圍、長度不超限
單人錄音、講稿、Podcast合用,而且不需要說話者分辨,可用滿 1 小時
五人以上、90 分鐘的部門會議要切檔、要人工對齊編號、標籤僅供參考
想在會議中即時看到誰在說話做不到——即時串流不支援分辨
不會寫程式,只想有個按鈕可以按這是 API/AI Studio 層級的東西,不是現成 App

誠實踩煞車

  • 我沒有實測。這篇是把官方部落格與 API 文件讀完之後的整理,所有規格都標了出處。中文(尤其台灣國語)的實際辨識品質,我沒有測過,不敢下結論。
  • 準確度數字是 Google 自己公布的,沒有第三方獨立驗證,也沒有中文分項。WER 這個指標對中文本來就比較難詮釋(中文沒有空格,斷詞方式會影響計算)。
  • 價格我沒有查到明確的每分鐘官方定價。官方部落格沒寫價格;API 文件裡出現的是一個估算(以每秒 25 個音訊 token 輸入、每分鐘 175 個文字 token 輸出換算,即時轉錄約每分鐘 0.009 美元)。那是估算不是定價表,實際帳單請以官方定價頁為準。
  • 這不是一般人打開就能用的產品。官方列出可用的地方包括 Google AI Studio、Gemini Enterprise Agent Platform、Android 的 Gboard、macOS 版 Gemini App,並說之後會進 Chrome。但「開一個 App 上傳會議錄音、自動標好誰是誰」這種完整體驗,目前要自己組。
  • 語言清單那點,是「我查不到」而不是「確定不支援」。我在兩份官方文件頁面上都只找到那兩個中文相關代碼。文件可能更新、可能有我沒讀到的頁面。要用之前請自己丟一段台灣國語的錄音去試,這比讀任何人的文章都準。

三種人,三種做法

如果你是一般上班族:這篇你可以只記住一件事——會議逐字稿的「誰說的」目前還是草稿等級。不管你用哪家工具,超過三個人的會議,那個標籤都要人看過才能發出去。特別是牽涉到「誰答應了什麼」「誰負責什麼」的段落,標錯人的代價比漏字大太多。

如果你是要量產、要串流程的人:三件事先想好。第一,切檔策略——三十分鐘一段,段與段之間留重疊,方便對齊說話者。第二,自訂詞彙清單——把公司產品名、部門名、常出現的人名整理成一百字以內。第三,不要在流程末端才放人工檢查,說話者標籤要在進入摘要環節之前就先修正,否則錯誤會被摘要放大。

如果你是主管:會議逐字稿是很好的 AI 入門專案,因為痛點明確、成效看得見。但請把驗收標準訂在「決議與待辦事項有沒有正確歸屬到人」,不要訂在「字有沒有打對」。字打錯了讀得出來,人標錯了讀不出來——那才是會出事的地方。

回到那句老話

我上課常說:你是機長,AI 是機組人員。

這個模型的定位很像一個聽力很好、但不太認得人的新進助理

他可以把整場會議一字不漏打下來,速度比你快得多,中英夾雜也難不倒他。但你問他「剛剛答應下週交件的是誰」,他會給你一個答案——而那個答案,你必須自己確認

機長的工作從來不是自己去打逐字稿,而是知道助理哪一段可以放手、哪一段一定要複查

這篇文章真正想給你的,就是那條線畫在哪裡:字,可以放手;人,要複查。

常見問題 FAQ

Q:它支援台灣的繁體中文嗎?
官方語言清單裡我查到的中文只有 cmn-Hans-CN(普通話簡體)和 yue-Hant-HK(粵語繁體),沒有台灣繁中的獨立條目。這不代表它聽不懂台灣國語,但輸出很可能是簡體,台灣在地詞彙也可能認不準。請自己實測,不要照我的文章下結論。

Q:我的會議有兩小時,怎麼辦?
開了說話者分辨就只能處理 30 分鐘,所以要切成四段跑,再自己把說話者編號對齊。或者接受一個折衷:不開說話者分辨,用滿 1 小時的上限,把「誰說的」交給人工標。哪個划算,取決於你的會議人數——人少的時候人工標很快。

Q:跟現在市面上的會議記錄工具比,值得換嗎?
不知道,我沒有做橫向實測。而且要注意層級不同:這是一個模型/API,市面上的會議記錄工具是完整產品(含錄音、上傳、摘要、分享、權限)。合理的比較方式是等這個模型被整合進你已經在用的產品之後,再比效果。

Q:那個「移除贅字、自動排版」的功能,會不會改到我的原意?
有可能,這是所有「聰明轉錄」功能共同的取捨。逐字稿的用途如果是會議摘要,清理過的版本比較好讀;如果用途是訪談引用、法遵紀錄、或要放進課程教材,你會希望保留原話。官方的轉錄模式參數裡有 verbatim(逐字)這個選項,要用哪一種,取決於你要拿它做什麼。

Q:一小時的會議大概要花多少錢?
我查不到官方的每分鐘定價表,只查到 API 文件裡的一個估算(即時轉錄約每分鐘 0.009 美元)。以那個估算推,一小時大約 0.5 美元出頭,但那是估算、且是即時轉錄的估算,不是檔案轉錄的定價。要編預算請以官方定價頁為準,不要用我這個數字。

資料來源

以下均於 2026 年 8 月 30 日直接查證 Google 官方頁面:

  • Google 官方部落格〈Intelligent transcription with Gemini 3.5 Transcribe〉blog.google,2026 年 8 月 26 日):功能總覽、85 種以上語言、WER 4.0%/2.6%、FLEURS 5.50%/5.04%、最終逐字稿時間改善 70%、可用平台清單,以及「最多三位說話者、三位以上為實驗性質」的說法。
  • Gemini API 官方文件〈Audio transcription〉ai.google.dev/gemini-api/docs/transcribe):「最多 8 位說話者(三位以上的歸屬為實驗性質)」「啟用說話者分辨或字級時間戳時,音訊處理限制為 30 分鐘」、中文相關語言代碼僅 cmn-Hans-CNyue-Hant-HKdiarization_mode 參數用法。
  • Gemini API 模型頁〈Gemini 3.5 Transcribe〉(ai.google.dev 模型文件):兩個模型 ID(gemini-3.5-transcribegemini-3.5-transcribe-live)、即時串流不支援說話者分辨、一般檔案上限 1 小時、自訂詞彙最多 1,000 個詞(建議 100 個以內)、每分鐘約 0.009 美元的估算。

查證說明(誠實揭露):本文是文件查證,不是實測——我沒有實際跑過這個模型,中文辨識品質、說話者分辨的真實準確度均未經我驗證。②Google 官方部落格與 API 文件對說話者上限的寫法不一致(三 vs 八),我在兩份不同的 API 文件頁面重複確認過「8」這個數字,本文將兩種寫法並列呈現,未擅自取一。「八是技術上限、三是可穩定使用的上限」是我的推論。③語言支援的部分是「我在官方清單中查不到台灣繁中條目」,不等於官方聲明不支援;文件可能更新或有我未讀到的頁面。④準確度數字全部是 Google 自行公布,無第三方驗證、無中文分項。⑤價格是 API 文件中的估算值而非定價表,本文已標明,且該估算對應的是即時轉錄。⑥「切檔會造成說話者編號對不齊」是我依規格所做的推論,官方文件沒有明講,實際行為請自行驗證。

字可以放手,人要複查——這條線畫錯,會議記錄就會出事

想自己看懂新工具的規格與限制:我的電子報大約一到兩週拆一個 → startupforyou.substack.com

如果你是主管:會議記錄是最好上手的 AI 專案,但驗收標準訂錯就白做。我的企業內訓有一個模組專門帶團隊把錄音、逐字稿、摘要、待辦歸屬串成一條流程,課堂上就用貴公司自己的會議錄音跑一次。想聊聊寫信到 ai@autolab.cloud,或看看 AI 顧問教練團

關於作者
黃敬峰(AI峰哥/阿峰老師),企業 AI 實戰培訓專家,服務客戶包含國泰人壽、工研院、士林電機、中嘉寬頻、電通、城邦媒體等。聯絡方式:ai@autolab.cloud

Gemini語音轉文字會議記錄GoogleAI工具逐字稿

常見問題

Gemini 3.5 Transcribe 支援台灣的繁體中文嗎?

官方語言清單裡查到的中文相關代碼只有 cmn-Hans-CN(普通話簡體)與 yue-Hant-HK(粵語繁體),沒有台灣繁中的獨立條目。這不代表它聽不懂台灣國語,但輸出很可能是簡體,台灣在地詞彙也可能認不準。本文為文件查證而非實測,建議自己丟一段錄音實際測試。

我的會議有兩小時,超過 30 分鐘上限怎麼辦?

啟用說話者分辨後只能處理 30 分鐘,所以要切成多段處理,再自行對齊說話者編號。另一個折衷做法是不開說話者分辨、用滿 1 小時的上限,把「誰說的」交給人工標記——會議人數少的時候,人工標其實很快。

說話者分辨最多支援幾個人?

官方兩處寫法不一致:Google 官方部落格寫「最多三位(三位以上為實驗性質)」,Gemini API 文件寫「最多 8 位(三位以上的歸屬為實驗性質)」。兩邊都同意三位以上屬實驗性質,因此實務上建議:四人以上的會議,說話者標籤請當草稿看待,寫進正式紀錄前要人工確認。

可以在會議進行中即時看到誰在說話嗎?

不行。這個模型有檔案版與即時版兩種,說話者分辨只在檔案處理那一邊,官方文件在即時串流欄位直接標示不支援,並要求改用非串流的音訊轉錄端點。要有分辨,必須先錄完再跑。

「移除贅字、自動排版」會不會改到原意?

有可能,這是所有智慧轉錄功能共同的取捨。用途若是會議摘要,清理過的版本比較好讀;若是訪談引用、法遵紀錄或課程教材,你會希望保留原話。官方的轉錄模式參數中有 verbatim(逐字)選項可選。

一小時的會議大概要花多少錢?

查不到官方的每分鐘定價表。API 文件裡出現的是一個估算(以每秒 25 個音訊 token 輸入、每分鐘 175 個文字 token 輸出換算,即時轉錄約每分鐘 0.009 美元)。那是估算而非定價表,且對應的是即時轉錄,編預算請以官方定價頁為準。