跳至主要內容
科技 分析

每小時 0.10 美元的轉錄費,微軟把語音 AI 從示範品變成耗材

微軟推出 MAI-Transcribe-2,60 種語言平均詞錯誤率 5.2%,每小時 0.10 美元的限時定價,把語音轉文字市場的競爭從準確率推向速度與價格的綜合賽。

YIM NEWS 編輯台 閱讀約 7 分鐘

9 月 3 日,微軟在官方部落格發布 MAI-Transcribe-2,稱其為目前最快、最準、最便宜的 AI 語音轉文字模型。這類說法在 AI 產業已經聽到麻痺,但這次值得停下來看的,是幾個具體數字湊在一起之後的含義:60 種語言、FLEURS 測試集平均詞錯率 5.2%、限時價每小時音訊 0.10 美元、優惠持續到 2026 年底。

換算一下這個價位意味著什麼。一場三小時的會議錄音,轉成逐字稿的成本不到一美元,折合新臺幣約三十元出頭。過去找人工聽打,三小時的逐字稿行情通常是數千元臺幣等級,還要等上一到兩個工作天。價格差了兩個數量級以上,這中間被擠壓掉的工作,就是接下來幾年內容產業與辦公室工作流要重新分配的部分。

5.2% 這個數字要怎麼讀

先看準確率。微軟公布的資料是,MAI-Transcribe-2 在 FLEURS 測試集上,無論是指定語言模式還是自動推斷語言模式,平均詞錯率都是 5.2%。作為對照,同一測試中 Gemini 3.1 Pro 的兩項結果分別是 5.3% 和 5.8%,GPT-Transcribe 是 10.4% 和 10.6%,而開源陣營最常用的 Whisper v3-Large 是 22.8% 和 23.5%。

這個分佈值得注意的地方有兩層。第一,第一名的差距極小。MAI-Transcribe-2 與 Gemini 3.1 Pro 在指定語言模式下只差 0.1 個百分點,這種差距在實際使用中幾乎感受不到,說明「準確率」這個競爭軸正在鈍化,頭部模型已經貼近這項測試的天花板。第二,Whisper 的 22.8% 說明開源通用模型與專用轉錄模型之間,仍有明顯的工程差距。很多團隊直接拿 Whisper 做產品,以為「語音轉文字已經解決了」,實際上在多語言與噪音場景下還有一段距離。

詞錯誤率降到 5% 上下是個實務門檻。打個比方,過去 20% 出錯率的逐字稿像一份被雨淋過的筆記,讀的人得靠前後文猜;5% 左右則接近一位細心同事的手抄,偶爾漏個字,但直接引用不太需要逐句核對。對字幕、會議紀錄、客服品質稽核這些場景來說,這是「AI 草稿需要人工校一遍」與「AI 產出可以直接進工作流」的分界線。

真正的分水嶺在速度與價格的組合

單看準確率,微軟與 Google 幾乎打平。讓 MAI-Transcribe-2 有差別的,是速度與價格的組合拳。

速度上,微軟援引 Artificial Analysis 的評測,稱 MAI-Transcribe-2 比 GPT-Transcribe 快 10 倍、比 Scribe v2 快 7 倍、比 Gemini 3.5 Transcribe 快 5 倍。轉錄是典型的批次型工作:一家媒體網站一天要處理幾十支影片、一間客服中心每晚要清幾千通錄音。在這種場景裡,「快五倍」直接等於同樣的機器預算能清五倍的存量,或者說,過去必須排隊過夜的批次,現在下班前就能出結果。

價格上,限時每小時 0.10 美元的定價,配合 2026 年底的優惠期限,明顯是一個搶市佔的動作。這種定價策略近一年在模型市場反覆出現, DeepSeek 就曾用周末低谷價把 API 定價表變成某種排班表,我們在DeepSeek 周末全天改收低谷價的分析裡談過,模型公司開始用電信與電力產業的離峯定價邏輯,把閒置算力折價出售。微軟這次的限時低價沒有分時段,但它同樣指向一件事:轉錄這類推理成本可預估、需求可規模化的工作,正在變成以量計價的基礎服務,像水電,用多少算多少。

對開發者而言,這帶來一個實際的判斷題:要不要把轉錄供應商綁死在一家身上。0.10 美元的限時價很好看,但 2026 年底之後回復原價時,已經把資料管線接上去的團隊就會面對遷移成本的秤。這與模型 API 領域的整體處境相似,當供應商調價時,便宜模型這筆帳往往要重新算一次,遷移的彈性比單價更需要提早設計。

說話人分離與逐詞時間戳:從「文字」到「可編輯的素材」

功能面上,MAI-Transcribe-2 補上了兩個過去必須靠後處理工具鏈才能完成的能力。

一是說話人分離(speaker diarization),模型能在一段錄音裡區分不同發言者,把文字歸屬到對應的人。訪談節目、法庭筆錄、多人會議,這些場景過去的做法是先轉文字再靠另一套模型標說話者,兩段式流程的對齊誤差常常把人名張冠李戴。原生化之後,一段 API 呼叫解決。

二是逐詞時間戳,每個詞都標註在音訊中的精確位置。這個功能聽起來技術味很重,但它影響的是很日常的事:剪影片時找那句話的出處、字幕與畫面對齊、長錄音裡檢索某個關鍵詞出現的第幾分第幾秒。過去做一支採訪影片,字幕對齊是剪接助理最耗時的苦工之一,逐詞時間戳讓這段工時直接歸零。

另外兩個設計也看得出微軟瞄準的是生產環境而非展示環境。verbatim 模式保留語氣詞與口誤,給合規稽核與爭議取證用;clean 模式刪掉語氣詞,輸出可直接當筆記或字幕的文字。加上關鍵詞偏置(可以把專有名詞、人名加重權重)、噪音環境轉寫、以及 60 語種內自然混用無需預先指定語言,這份功能清單幾乎是照著媒體、客服、法務三個行業的痛點逐一勾出來的。

對一般工作者的實際意義

把鏡頭拉回日常工作現場。如果你是 podcast 製作人、記者、人資面試官、客服主管,這次發布傳遞的訊號可以整理成三個判斷。

第一,逐字稿的成本正在趨近於零,商業模式裡任何「因為轉錄很貴所以做不到」的環節都該重新檢視。以前不做全文檢索的錄音資料庫、以前不逐句分析的客服通話,現在的瓶頸只剩下儲存與隱私合規,成本不再是理由。

第二,說話者分離加逐詞時間戳的組合,讓錄音第一次變成「可搜尋、可引用、可剪輯」的結構化素材。這對內容團隊的意義,接近當年紙本文件全面數位化:檔案還是那些檔案,但取用的方式完全變了。

第三,供應商競爭進入組合賽。準確率已經不是選型的關鍵差異,速度、單價、功能原生度、以及多年後的遷移成本,才是。目前 MAI-Transcribe-2 已可在 Microsoft Foundry、MAI Playground 與 OpenRouter 上試用或呼叫,OpenRouter 的加入值得一提,它讓開發者能在同一個介面下與其他模型直接比價比效果,降低了評估門檻。

頭部模型貼著 5% 詞錯率、每小時音訊收一毛美金、說話者與時間座標原生化輸出。這三件事放在一起,語音轉文字作為一門獨立生意正在收縮,但它作為所有音訊密集行業的底層耗材,才剛開始鋪開。下一個值得觀察的訊號,是 2026 年底限時價結束時,這個市場的單價會停在誰的位置。

#mai-transcribe-2+語音辨識產業#微軟+ai模型定價#逐詞時間戳+內容工作流