音識(shí)別教程:如何在 1 分鐘內(nèi)轉(zhuǎn)寫(xiě) 13 分鐘音頻)
faster-whisper 語(yǔ)音識(shí)別教程如何在 1 分鐘內(nèi)轉(zhuǎn)寫(xiě) 13 分鐘音頻【免費(fèi)下載鏈接】faster-whisperFaster Whisper transcription with CTranslate2項(xiàng)目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 把長(zhǎng)音頻轉(zhuǎn)成文字比原版 Whisper 更快、更省內(nèi)存。它是基于 CTranslate2 重寫(xiě)的語(yǔ)音識(shí)別引擎最高可達(dá)原版 4 倍速度。如果你還在跑原版 Whisper 做批量轉(zhuǎn)寫(xiě)這篇教程適合你。用原版 Whisper 轉(zhuǎn)寫(xiě)時(shí)你會(huì)撞上這 3 個(gè)問(wèn)題跑原版 large-v2 模型13 分鐘音頻要 2 分 23 秒顯存占用 4708MBCPU 上 small 模型更慢要 6 分 58 秒。原版還要求系統(tǒng)單獨(dú)安裝 FFmpeg容器環(huán)境經(jīng)??ㄔ谝蕾?lài)上。faster-whisper 換用 CTranslate2 推理引擎并內(nèi)置 PyAV 解碼音頻不需要在系統(tǒng)裝 FFmpeg。? 3 分鐘安裝并完成第一次轉(zhuǎn)錄要求 Python 3.9一條命令安裝pip install faster-whisper按模型名加載時(shí)對(duì)應(yīng)的 CTranslate2 權(quán)重會(huì)自動(dòng)從 Hugging Face Hub 下載。最小可運(yùn)行示例from faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3, beam_size5) for segment in segments: print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})注意segments是生成器進(jìn)入循環(huán)后轉(zhuǎn)寫(xiě)才真正開(kāi)始。3 個(gè)值得深挖的核心能力VAD 語(yǔ)音活動(dòng)檢測(cè)先跳過(guò)靜音再轉(zhuǎn)寫(xiě)傳vad_filterTrue轉(zhuǎn)寫(xiě)前用內(nèi)置 Silero VAD 切掉靜音段。默認(rèn)策略保守只移除超過(guò) 2 秒的靜音想切得更碎可用vad_parameters把min_silence_duration_ms調(diào)低到 500。參數(shù)定義見(jiàn) faster_whisper/vad.py。批量轉(zhuǎn)寫(xiě)默認(rèn)開(kāi)啟 VAD。詞級(jí)時(shí)間戳精確到每個(gè)單詞word_timestampsTrue會(huì)把每個(gè)片段拆成單詞每個(gè)單詞帶起止時(shí)間適合做字幕對(duì)齊、關(guān)鍵詞定位。批量推理GPU 吞吐明顯提升BatchedInferencePipeline可直接替換WhisperModel.transcribe。以 distil-large-v3 在 GPU 上batch_size16為例耗時(shí)從 46 分 12 秒降到 25 分 50 秒transformers 實(shí)現(xiàn)跑同一任務(wù)WER 為 13.527 對(duì) 14.801。更多參數(shù)可在 faster_whisper/transcribe.py 中查閱。 基準(zhǔn)對(duì)比耗時(shí)與內(nèi)存差多少GPU 端large-v2RTX 3070 Ti 8GBCUDA 12.4均為 13 分鐘音頻實(shí)現(xiàn)精度耗時(shí)顯存openai/whisperfp162m23s4708MBfaster-whisperfp161m03s4525MBfaster-whisperint859s2926MBfaster-whisperbatch_size8int816s4500MBCPU 端small 模型i7-12700K8 線程原版 6 分 58 秒faster-whisper fp32 為 2 分 37 秒int8 為 1 分 42 秒內(nèi)存從 2335MB 降到 1477MB。 5 條部署建議compute 類(lèi)型、CUDA 版本與批大小GPU 場(chǎng)景優(yōu)先compute_typefloat16顯存吃緊時(shí)換int8_float16。僅用 CPU建議compute_typeint8small 模型下耗時(shí)減半內(nèi)存省 780MB1477MB 對(duì) 2257MB。CUDA 版本不匹配最新版 ctranslate2 只支持 CUDA 12 cuDNN 9CUDA 11 用戶降級(jí)到 ctranslate23.24.0。倉(cāng)庫(kù)提供基于 nvidia/cuda 鏡像的部署參考見(jiàn) docker/Dockerfile。長(zhǎng)音頻批處理批量會(huì)推高內(nèi)存int8 從 2926MB 升到 4500MB按空閑顯存定 batch_size。做橫向?qū)Ρ却_保 beam size 一致faster-whisper 默認(rèn) beam_size5原版默認(rèn)是 1否則數(shù)據(jù)不可比。3 個(gè)常見(jiàn)落地場(chǎng)景會(huì)議錄音轉(zhuǎn)寫(xiě)VAD 自動(dòng)跳過(guò)靜音段算力不浪費(fèi)在無(wú)聲音上視頻字幕生成詞級(jí)時(shí)間戳讓字幕對(duì)齊精確到單詞多語(yǔ)言語(yǔ)料本地化自動(dòng)檢測(cè)語(yǔ)言并返回置信度單條音頻還是批量任務(wù)faster-whisper 都用更少的時(shí)間和內(nèi)存給出同樣的文字結(jié)果把現(xiàn)有轉(zhuǎn)寫(xiě)流水線里的引擎換掉即可?!久赓M(fèi)下載鏈接】faster-whisperFaster Whisper transcription with CTranslate2項(xiàng)目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考