跳到主要內容
測試檔案庫
.wav

STT 語音辨識測試音檔

開發語音辨識(STT)管線時,你需要已知內容的音檔才能驗證辨識準確度 — 網路抓的 Podcast 有版權,自錄的沒有標準答案。

這套測試音檔由語音合成器產生(英文語音),三種難度:短版(5 秒)、長版(38 秒)、噪音版(降頻寬加粉紅噪音 — 惡劣環境模擬),附完整逐字稿當標準答案。全部 16kHz / 16bit / 單聲道 PCM,正是 Whisper 等 STT 引擎的原生輸入格式。

Download Sample File

Free test file, safe content, instant download.

SHA2567e9bef643ddb97e34ba41df7...

檔案資訊

短版
sample-speech-short.wav — 約 5 秒、清晰語音
長版
sample-speech-long.wav — 約 38 秒、連續語音
噪音版
sample-speech-noisy.wav — 降帶寬 + 粉紅噪音(hard mode)
逐字稿
sample-speech-transcript.txt — 標準答案對照用
規格
16kHz / 16bit / mono PCM — Whisper 原生輸入格式
授權
CC0 — 合成語音、無真人聲音權問題

使用方式

  1. 1下載三個 WAV 與逐字稿。
  2. 2餵給 Whisper/Google STT/Azure 進行辨識。
  3. 3將結果與逐字稿比對計算 WER(字錯誤率)。
  4. 4用噪音版測前處理(降噪/增益)效果。

常見問題

這個測試檔案安全嗎?

安全。本站所有檔案皆由程式自動產生,內容為空白或範例性質,不含巨集、指令碼或任何惡意內容,可放心用於開發與測試環境。

為什麼用合成語音而不是真人錄音?

真人錄音有聲音權與肖像權問題,不能自由重散布;合成語音權利鏈乾淨(CC0),且內容與逐字稿完全對齊 — WER 計算結果可信。

這樣測得出真實場景的效果嗎?

合成語音適合驗證管線正確性(格式/取樣率/整合)。真實口音與環境噪音的極限測試仍需後續資料 — 噪音版正是為此設計的中間站。

可以免費商用嗎?

可以。全部檔案以 CC0 1.0 公眾領域貢獻釋出,無需標示出處,個人或商業用途皆可,包括放進產品的測試素材與教育課程。

English version

更多格式與進階測試檔(100MB、語音辨識音檔、剪輯素材包等)請見 英文主站