一句話結論
Google 八月二十六日推出 Gemini 3.5 Transcribe,最大賣點是能分辨誰在說話——這正是「會議逐字稿」卡最久的一關。但官方文件寫了三件行銷頁沒強調的事:開了說話者分辨,音檔上限從 1 小時掉到 30 分鐘;即時串流不支援分辨;語言清單裡我查到的中文只有簡體普通話與繁體粵語,沒有台灣繁中的獨立條目。你的會議如果是九十分鐘、五個人、講國語,這三件事你都會撞到。
企業導入 AI,最常見的第一個需求不是寫文案,是會議記錄。
而會議記錄最難的一段從來不是「把聲音變成字」——那件事三年前就做得不錯了。難的是「這句話是誰講的」。沒有這一段,逐字稿就是一大坨文字,你還是得從頭聽一次才知道誰答應了什麼。
八月二十六日,Google 發表 Gemini 3.5 Transcribe,把說話者分辨(speaker diarization)放進了主打功能。這值得看,但也值得先把文件讀完再決定要不要換。我把官方部落格和 API 文件都翻過一遍,下面是查到的東西。
它做到了什麼
照 Google 官方部落格的說法,這個模型的重點功能有這些:
- 聰明轉錄:會處理講者的自我修正、移除贅字(呃、然後、那個)、自動排版
- 自動語言偵測:號稱可偵測並轉錄超過 85 種語言,支援句中與句間的語言切換(中英夾雜不用手動設定)
- 說話者分辨:能標出不同的人
- 自訂詞彙:可以餵專有名詞、縮寫、人名進去,讓它認得
- 字級時間戳:每個字對應到影片的第幾秒
Google 自己公布的準確度數字是:串流的字錯率(WER)4.0%、非串流 2.6%;在 FLEURS 這個公開測試集上,串流 5.50%、非串流 5.04%。另外宣稱「產出最終逐字稿的時間改善 70%」。
這些都是廠商自己公布的數字,我沒有看到第三方獨立評測,也沒有中文分項的成績。當成參考,不要當成保證。
坑一:開了說話者分辨,音檔上限砍掉一半
這是我認為最該先知道的一條。API 文件寫得很清楚:
一般的檔案轉錄支援最長 1 小時的音檔。但當你啟用說話者分辨或字級時間戳這類功能,「音訊處理限制為 30 分鐘」。
換句話說,你最想要的那個功能,會讓可處理的長度變成一半。
而台灣企業的會議,九十分鐘是常態,兩小時也不稀奇。這代表你必須切檔。
切檔會衍生一個實務問題,這一點是我的推論、文件沒有明講:說話者標籤是「說話者 1、說話者 2」這種相對編號,不同段落各自處理時,編號很可能對不起來——第一段的「說話者 2」到第二段可能變成「說話者 1」。你如果要串成一份完整逐字稿,中間需要人工對齊,或是自己想辦法用重疊片段去比對。
所以「能分辨說話者」這件事,在超過三十分鐘的會議上,不是開了就自動好了。
坑二:即時串流不支援說話者分辨
這個模型有兩個版本:gemini-3.5-transcribe(處理檔案)和 gemini-3.5-transcribe-live(即時)。
而說話者分辨只在檔案處理那一邊。文件在即時串流那一欄直接標「不支援」,並要你改用非串流的音訊轉錄端點。
所以如果你想像的畫面是「開會的時候螢幕上即時跑出誰在說什麼」——這個版本做不到。你得先錄完,再丟進去跑。
坑三:官方語言清單裡,我沒找到台灣繁中
這一點我要講得特別小心,因為它牽涉到「查不到」和「不支援」的差別。
官方文件宣稱支援超過 85 種語言,並附上 BCP-47 語言代碼清單。我在清單裡查到的中文相關項目只有兩個:
| 代碼 | 文件上的標示 |
|---|---|
cmn-Hans-CN | Mandarin Chinese (Simplified)/中文普通話(簡體) |
yue-Hant-HK | Cantonese (Traditional)/粵語(繁體) |
沒有 cmn-Hant-TW,也沒有 zh-TW 的獨立條目。
這代表什麼、不代表什麼,要分清楚:
- 不代表它聽不懂台灣人講國語。語音辨識的聲學模型認的是發音,普通話和台灣國語差距沒有大到聽不懂。
- 但很可能代表輸出的文字會是簡體,而且台灣特有的詞彙(例如「小編」「里長」「勞健保」「發票載具」)辨識率可能不理想。
- 我沒有實測。這篇是文件查證,不是實測報告。真實效果如何,你要自己丟一段錄音進去試。
如果你要用,自訂詞彙那個功能就是你的補救工具——它最多可以餵 1,000 個詞,不過文件也說「通常在 100 個詞以內效果最好」。所以把貴公司的產品名、部門名、常出現的人名整理成一份一百字以內的清單,是實務上最划算的一步。
坑四:官方兩個地方寫的人數不一樣
這件事我查到的時候愣了一下,所以照實寫。
| 來源 | 說話者上限的寫法 |
|---|---|
| Google 官方部落格(發表文) | 支援最多三位說話者(三位以上為實驗性質) |
| Gemini API 官方文件 | 支援最多八位說話者(三位以上的歸屬為實驗性質) |
兩邊都是 Google 官方,但一個寫三、一個寫八。我兩個頁面都讀過,也在兩份不同的 API 文件頁面上重複確認了「最多 8 位」這個寫法。
合理的解讀是:八是技術上限,三是「能穩定用」的上限——因為兩邊都同意「三人以上是實驗性質」。
對你的意義很直接:四個人以上的會議,說話者標籤請當成草稿,不要當成事實。寫進正式會議記錄之前,人要看過。
那到底該不該用?
| 你的情境 | 這個模型合不合用 |
|---|---|
| 一對一訪談、兩人通話,30 分鐘內 | 最甜蜜的區間——人數在穩定範圍、長度不超限 |
| 單人錄音、講稿、Podcast | 合用,而且不需要說話者分辨,可用滿 1 小時 |
| 五人以上、90 分鐘的部門會議 | 要切檔、要人工對齊編號、標籤僅供參考 |
| 想在會議中即時看到誰在說話 | 做不到——即時串流不支援分辨 |
| 不會寫程式,只想有個按鈕可以按 | 這是 API/AI Studio 層級的東西,不是現成 App |
誠實踩煞車
- 我沒有實測。這篇是把官方部落格與 API 文件讀完之後的整理,所有規格都標了出處。中文(尤其台灣國語)的實際辨識品質,我沒有測過,不敢下結論。
- 準確度數字是 Google 自己公布的,沒有第三方獨立驗證,也沒有中文分項。WER 這個指標對中文本來就比較難詮釋(中文沒有空格,斷詞方式會影響計算)。
- 價格我沒有查到明確的每分鐘官方定價。官方部落格沒寫價格;API 文件裡出現的是一個估算(以每秒 25 個音訊 token 輸入、每分鐘 175 個文字 token 輸出換算,即時轉錄約每分鐘 0.009 美元)。那是估算不是定價表,實際帳單請以官方定價頁為準。
- 這不是一般人打開就能用的產品。官方列出可用的地方包括 Google AI Studio、Gemini Enterprise Agent Platform、Android 的 Gboard、macOS 版 Gemini App,並說之後會進 Chrome。但「開一個 App 上傳會議錄音、自動標好誰是誰」這種完整體驗,目前要自己組。
- 語言清單那點,是「我查不到」而不是「確定不支援」。我在兩份官方文件頁面上都只找到那兩個中文相關代碼。文件可能更新、可能有我沒讀到的頁面。要用之前請自己丟一段台灣國語的錄音去試,這比讀任何人的文章都準。
三種人,三種做法
如果你是一般上班族:這篇你可以只記住一件事——會議逐字稿的「誰說的」目前還是草稿等級。不管你用哪家工具,超過三個人的會議,那個標籤都要人看過才能發出去。特別是牽涉到「誰答應了什麼」「誰負責什麼」的段落,標錯人的代價比漏字大太多。
如果你是要量產、要串流程的人:三件事先想好。第一,切檔策略——三十分鐘一段,段與段之間留重疊,方便對齊說話者。第二,自訂詞彙清單——把公司產品名、部門名、常出現的人名整理成一百字以內。第三,不要在流程末端才放人工檢查,說話者標籤要在進入摘要環節之前就先修正,否則錯誤會被摘要放大。
如果你是主管:會議逐字稿是很好的 AI 入門專案,因為痛點明確、成效看得見。但請把驗收標準訂在「決議與待辦事項有沒有正確歸屬到人」,不要訂在「字有沒有打對」。字打錯了讀得出來,人標錯了讀不出來——那才是會出事的地方。
回到那句老話
我上課常說:你是機長,AI 是機組人員。
這個模型的定位很像一個聽力很好、但不太認得人的新進助理。
他可以把整場會議一字不漏打下來,速度比你快得多,中英夾雜也難不倒他。但你問他「剛剛答應下週交件的是誰」,他會給你一個答案——而那個答案,你必須自己確認。
機長的工作從來不是自己去打逐字稿,而是知道助理哪一段可以放手、哪一段一定要複查。
這篇文章真正想給你的,就是那條線畫在哪裡:字,可以放手;人,要複查。
常見問題 FAQ
Q:它支援台灣的繁體中文嗎?
官方語言清單裡我查到的中文只有 cmn-Hans-CN(普通話簡體)和 yue-Hant-HK(粵語繁體),沒有台灣繁中的獨立條目。這不代表它聽不懂台灣國語,但輸出很可能是簡體,台灣在地詞彙也可能認不準。請自己實測,不要照我的文章下結論。
Q:我的會議有兩小時,怎麼辦?
開了說話者分辨就只能處理 30 分鐘,所以要切成四段跑,再自己把說話者編號對齊。或者接受一個折衷:不開說話者分辨,用滿 1 小時的上限,把「誰說的」交給人工標。哪個划算,取決於你的會議人數——人少的時候人工標很快。
Q:跟現在市面上的會議記錄工具比,值得換嗎?
不知道,我沒有做橫向實測。而且要注意層級不同:這是一個模型/API,市面上的會議記錄工具是完整產品(含錄音、上傳、摘要、分享、權限)。合理的比較方式是等這個模型被整合進你已經在用的產品之後,再比效果。
Q:那個「移除贅字、自動排版」的功能,會不會改到我的原意?
有可能,這是所有「聰明轉錄」功能共同的取捨。逐字稿的用途如果是會議摘要,清理過的版本比較好讀;如果用途是訪談引用、法遵紀錄、或要放進課程教材,你會希望保留原話。官方的轉錄模式參數裡有 verbatim(逐字)這個選項,要用哪一種,取決於你要拿它做什麼。
Q:一小時的會議大概要花多少錢?
我查不到官方的每分鐘定價表,只查到 API 文件裡的一個估算(即時轉錄約每分鐘 0.009 美元)。以那個估算推,一小時大約 0.5 美元出頭,但那是估算、且是即時轉錄的估算,不是檔案轉錄的定價。要編預算請以官方定價頁為準,不要用我這個數字。
資料來源
以下均於 2026 年 8 月 30 日直接查證 Google 官方頁面:
- Google 官方部落格〈Intelligent transcription with Gemini 3.5 Transcribe〉(blog.google,2026 年 8 月 26 日):功能總覽、85 種以上語言、WER 4.0%/2.6%、FLEURS 5.50%/5.04%、最終逐字稿時間改善 70%、可用平台清單,以及「最多三位說話者、三位以上為實驗性質」的說法。
- Gemini API 官方文件〈Audio transcription〉(ai.google.dev/gemini-api/docs/transcribe):「最多 8 位說話者(三位以上的歸屬為實驗性質)」、「啟用說話者分辨或字級時間戳時,音訊處理限制為 30 分鐘」、中文相關語言代碼僅
cmn-Hans-CN與yue-Hant-HK、diarization_mode參數用法。 - Gemini API 模型頁〈Gemini 3.5 Transcribe〉(ai.google.dev 模型文件):兩個模型 ID(
gemini-3.5-transcribe與gemini-3.5-transcribe-live)、即時串流不支援說話者分辨、一般檔案上限 1 小時、自訂詞彙最多 1,000 個詞(建議 100 個以內)、每分鐘約 0.009 美元的估算。
查證說明(誠實揭露):①本文是文件查證,不是實測——我沒有實際跑過這個模型,中文辨識品質、說話者分辨的真實準確度均未經我驗證。②Google 官方部落格與 API 文件對說話者上限的寫法不一致(三 vs 八),我在兩份不同的 API 文件頁面重複確認過「8」這個數字,本文將兩種寫法並列呈現,未擅自取一。「八是技術上限、三是可穩定使用的上限」是我的推論。③語言支援的部分是「我在官方清單中查不到台灣繁中條目」,不等於官方聲明不支援;文件可能更新或有我未讀到的頁面。④準確度數字全部是 Google 自行公布,無第三方驗證、無中文分項。⑤價格是 API 文件中的估算值而非定價表,本文已標明,且該估算對應的是即時轉錄。⑥「切檔會造成說話者編號對不齊」是我依規格所做的推論,官方文件沒有明講,實際行為請自行驗證。
字可以放手,人要複查——這條線畫錯,會議記錄就會出事
想自己看懂新工具的規格與限制:我的電子報大約一到兩週拆一個 → startupforyou.substack.com
如果你是主管:會議記錄是最好上手的 AI 專案,但驗收標準訂錯就白做。我的企業內訓有一個模組專門帶團隊把錄音、逐字稿、摘要、待辦歸屬串成一條流程,課堂上就用貴公司自己的會議錄音跑一次。想聊聊寫信到 ai@autolab.cloud,或看看 AI 顧問教練團。
關於作者
黃敬峰(AI峰哥/阿峰老師),企業 AI 實戰培訓專家,服務客戶包含國泰人壽、工研院、士林電機、中嘉寬頻、電通、城邦媒體等。聯絡方式:ai@autolab.cloud