排名第一名就最好用嗎?讀懂 TTS 模型評測榜單的四個數字
從 Hugging Face Open TTS Leaderboard 的 WER、CER、RTFx、TTFA 與 SIM 指標出發,說明文字轉語音模型的評測方式與限制,以及選型時該怎麼自行驗證。
(事件日期:2026 年 9 月底)Hugging Face 推出的 Open TTS Leaderboard,把多個開放權重的文字轉語音模型放在同一個頁面上比較。這類榜單對開發者的價值很實際:不用自己架測試環境,就能先縮小候選名單。但在看排名之前,有個更前面的問題值得先問:榜單測量的能力,跟你產品實際需要的語言、文字內容、設備和等待時間,是不是同一回事?
這篇文章把榜單上的四個指標拆開來講,說明每個數字能回答什麼問題、不能回答什麼。
榜單測的是「指定條件下的表現」
文字轉語音(Text-to-Speech,TTS)做的事情是把文字變成語音。選型時大家常把幾個問題混在一起:「聽得懂嗎」「聽起來自然嗎」「像不像指定的說話者」「生成得多快」。這些是不同的能力,需要不同的測量方法,把它們壓成一個排名,反而看不出哪個模型適合你的場景。
公平比較的起點,是讓所有模型面對相同的文字、資料集、推論參數和運算設備。如果模型 A 測的是短句、模型 B 測的是長句,或者兩者分別在不同硬體上計時,分數就混入了測試條件的差異。Open TTS Leaderboard 的做法是統一測試文本與硬體,把結果放在同一頁。
但固定條件只能減少變因,不能保證測試內容涵蓋你的實際工作。產品可能要唸繁體中文姓名、地址、藥品名稱或產品型號,也可能遇到臺灣國語、臺語夾中文、英文縮寫、數字和標點。如果評測文本裡沒有這些特徵,整體平均分無法告訴你模型碰到它們會怎麼發音。測試集的長短也有影響:短句檢查基本發音,長句才會暴露句尾漏字、停頓不自然或前後語氣不一致。
另一個容易被忽略的點:榜單的排序欄位決定了誰排前面。一個模型可懂度高、另一個起音快,用不同欄位排序就會得到不同名次。語音助理重視第一段音訊多快出現,批次製作旁白重視總生成時間與錯字率,兩者在乎的指標根本不同。脫離用途的單一總分,意義有限。
WER 與 CER:內容聽得清楚嗎
詞錯誤率(Word Error Rate,WER)的測法有點繞:把合成出來的音訊交給自動語音辨識(ASR)模型轉回文字,再跟原本輸入的文字比對。插入、刪除或替換的詞越多,錯誤率越高。打個比方,這像請一個速記員聽打,再用他的筆記跟原稿對照,藉此估計說話者講得清不清楚。
中文、日文、韓文因為沒有以空格分詞的書寫習慣,較常用字元錯誤率(Character Error Rate,CER),以字元層級計算差異。看中文模型的成績時,用 CER 比較合理。
要注意的是,這兩個數字同時受合成模型和 ASR 評分器影響。合成音如果把專有名詞唸得很清楚,ASR 仍可能因為不熟悉那個詞而轉錯;反過來,ASR 的語言模型也可能靠上下文猜出正確文字,掩蓋含糊的發音。所以 WER/CER 適合當「可懂度」的代理指標,不能代表自然度、情緒表現或聽者的偏好。
語音 AI 的評測與定價這兩年變化很快,類似的「指標 vs. 實用」落差也出現在轉錄市場。微軟近期推出低價轉錄模型時,每小時 0.10 美元的轉錄服務就是把競爭從準確率推向速度與價格的例子,同樣提醒我們單一指標讀不出全貌。
RTFx 與 TTFA:兩種完全不同的「快」
反即時因子(RTFx)的計算是生成的音訊秒數除以運算所花的秒數。數值越高,代表每秒運算能生成越多音訊。它適合觀察批次處理效率,例如一次要產出幾小時的有聲書。但這個數字高度依賴硬體、批次大小、模型執行方式和工作負載。把單張高階 GPU 的批次成績,拿來預測筆電 CPU 上的生成速度,兩者沒有可比性。
首段音訊時間(Time to First Audio,TTFA)量的是另一件事:送出文字後,多久能拿到第一段可播放的音訊。互動式語音服務,例如客服機器人或語音助理,使用者在乎的是等多久才聽到第一個回應,而不是整段音訊多快做完。一個批次效率頂尖的模型,如果起音慢,用在即時對話裡體驗可能很差。
這就像餐廳的兩種出餐邏輯:辦桌看重的是整桌菜在時限內全部上齊,櫃檯外帶看重的是第一份餐點幾秒內遞到手上。兩者都叫「快」,量法完全不同。
SIM:像不像那個聲音
聲音相似度(SIM)估計的是生成的聲音與參考聲音有多接近,常用在語音複製的場景。如果產品需要固定一位虛擬主播或品牌旁白的聲音,這個指標的參考價值較高;如果只是要一個清楚的合成聲音唸稿,SIM 的高低就不是重點。
拿到候選名單之後,自己要做的事
榜單的價值在於用自動化流程擴大可比較的模型數量,讓你先依需求縮小範圍。但真正要做決定,仍需要用自己的條件驗證。實務上的順序大致是:先定義不能妥協的條件,例如必須支援繁體中文、TTFA 要低於某個門檻、必須能在目標硬體上跑、授權條款允許商業使用;接著用產品實際會出現的文本做測試,包括姓名、地址、中英夾雜和數字;最後是找人實際聆聽,因為自然度與聆聽疲勞目前仍無法完全用自動指標取代。
模型選單越長,分配工作的難度就越高,這個現象在語音領域同樣成立。先前分析模型選單變長之後怎麼分配工作時的邏輯也適用於此:先看任務的可驗證性與成本,再決定把哪個模型放在哪個環節。
回到開頭的問題:排名最高的模型是不是就最好用?榜單能告訴你的,是指定測試集與執行條件下的指標表現。它不能告訴你的,是你的產品文本、延遲要求、硬體環境和授權需求下會發生什麼。把榜單當篩選工具,而不是決策依據,這四個數字才能真正派上用場。
主題