.wav
STT 語音辨識測試音檔
開發語音辨識(STT)管線時,你需要已知內容的音檔才能驗證辨識準確度 — 網路抓的 Podcast 有版權,自錄的沒有標準答案。
這套測試音檔由語音合成器產生(英文語音),三種難度:短版(5 秒)、長版(38 秒)、噪音版(降頻寬加粉紅噪音 — 惡劣環境模擬),附完整逐字稿當標準答案。全部 16kHz / 16bit / 單聲道 PCM,正是 Whisper 等 STT 引擎的原生輸入格式。
Download Sample File
Free test file, safe content, instant download.
SHA256
7e9bef643ddb97e34ba41df7...檔案資訊
- 短版
- sample-speech-short.wav — 約 5 秒、清晰語音
- 長版
- sample-speech-long.wav — 約 38 秒、連續語音
- 噪音版
- sample-speech-noisy.wav — 降帶寬 + 粉紅噪音(hard mode)
- 逐字稿
- sample-speech-transcript.txt — 標準答案對照用
- 規格
- 16kHz / 16bit / mono PCM — Whisper 原生輸入格式
- 授權
- CC0 — 合成語音、無真人聲音權問題
使用方式
- 1下載三個 WAV 與逐字稿。
- 2餵給 Whisper/Google STT/Azure 進行辨識。
- 3將結果與逐字稿比對計算 WER(字錯誤率)。
- 4用噪音版測前處理(降噪/增益)效果。
常見問題
這個測試檔案安全嗎?
安全。本站所有檔案皆由程式自動產生,內容為空白或範例性質,不含巨集、指令碼或任何惡意內容,可放心用於開發與測試環境。
為什麼用合成語音而不是真人錄音?
真人錄音有聲音權與肖像權問題,不能自由重散布;合成語音權利鏈乾淨(CC0),且內容與逐字稿完全對齊 — WER 計算結果可信。
這樣測得出真實場景的效果嗎?
合成語音適合驗證管線正確性(格式/取樣率/整合)。真實口音與環境噪音的極限測試仍需後續資料 — 噪音版正是為此設計的中間站。
可以免費商用嗎?
可以。全部檔案以 CC0 1.0 公眾領域貢獻釋出,無需標示出處,個人或商業用途皆可,包括放進產品的測試素材與教育課程。
English version
更多格式與進階測試檔(100MB、語音辨識音檔、剪輯素材包等)請見 英文主站。