文字:用本地 Whisper 把音頻變成文字稿的完整指南)
Buzz 離線語音轉(zhuǎn)文字用本地 Whisper 把音頻變成文字稿的完整指南【免費下載鏈接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.項目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款在你自己電腦上離線完成語音轉(zhuǎn)文字的工具基于 OpenAI 的 Whisper 模型可以把音頻文件、視頻文件和麥克風(fēng)實時錄音轉(zhuǎn)成可編輯的文字稿整個過程不經(jīng)過任何云端服務(wù)。它解決什么問題兩個最常見的場景一是你手上有會議錄音、采訪或講座的音頻上傳給在線轉(zhuǎn)錄服務(wù)意味著把敏感內(nèi)容交給第三方而 Buzz 的全部計算都在本機完成文件不會離開你的電腦。二是你需要在無網(wǎng)絡(luò)的現(xiàn)場比如出差途中、機房環(huán)境立刻把錄音變成文字Buzz 只要提前把模型下載到本地之后可以完全斷網(wǎng)使用。三步跑通最小流程第一步安裝根據(jù)你的系統(tǒng)選一種方式# LinuxFlatpak 方式一條命令裝好 flatpak install flathub io.github.chidiwilliams.Buzz # 或者 Snap 方式 sudo snap install buzz # 或者從 PyPI 安裝先裝好 ffmpeg且需要 Python 3.12 pip install buzz-captions python -m buzzmacOS 和 Windows 用戶直接去官方發(fā)布頁下載.dmg或安裝程序雙擊安裝即可Windows 安裝包未做簽名安裝時出現(xiàn)警告選擇更多信息 → 仍要運行。第二步首次運行打開 Buzz 后你會看到主界面上方一排是轉(zhuǎn)錄任務(wù)的狀態(tài)欄下方是任務(wù)隊列。第一次使用建議先在幫助 → 偏好設(shè)置 → 模型里確認已下載一個模型比如 small首次下載后模型會緩存在本地之后離線也能用。第三步拿到第一段文字按Ctrl/Cmd O或點工具欄的號選擇一個 MP3、WAV 或 MP4 文件選擇任務(wù)類型轉(zhuǎn)錄或翻譯、語言建議手動指定別用自動檢測和模型檔位點Run等狀態(tài)變成 Completed 后雙擊那一行就能看到帶時間戳的文字稿可直接導(dǎo)出為 TXT、SRT 或 VTT場景和功能對照同一個 Buzz 覆蓋的能力不同下面按場景列出對應(yīng)功能和入口方便你按需查找你的場景對應(yīng)功能操作入口把本地錄音、視頻變成文字文件轉(zhuǎn)錄支持音頻和視頻文件File 菜單 → Import Media File或 Ctrl/Cmd O會議、講座邊錄邊出文字 實時錄音轉(zhuǎn)錄麥克風(fēng)輸入即時出稿選擇錄音任務(wù)、語言、麥克風(fēng)后點 Record演講、演示時現(xiàn)場展示實時字幕演示窗口Presentation window開始錄音后出現(xiàn)的 Presentation window 選項外語錄音轉(zhuǎn)成英文或其他語言翻譯任務(wù)Whisper 原生轉(zhuǎn)英文其他語言可接 AI 模型導(dǎo)入時 Task 選 Translate或在轉(zhuǎn)錄結(jié)果頁點 Translate嘈雜環(huán)境下準確率不夠轉(zhuǎn)寫前先做人聲分離提取人聲軌道導(dǎo)入選項里勾選 Extract speech需要區(qū)分誰在說話說話人識別轉(zhuǎn)錄結(jié)果頁的 speaker identification 入口剪輯視頻要字幕文件字幕合并與時長調(diào)整Resize雙擊轉(zhuǎn)錄結(jié)果 → Resize 按鈕新文件丟進去自動轉(zhuǎn)文件夾監(jiān)控Watch folder偏好設(shè)置 → Folder Watch 標簽頁給轉(zhuǎn)錄結(jié)果生成摘要、自動整理字幕插件系統(tǒng)AI summary、transcript resizer 等偏好設(shè)置 → Plugins 標簽頁參數(shù)怎么選參數(shù)主要分兩層Whisper 后端類型和模型檔位。后端類型決定跑在什么硬件上Whisper.cppC 實現(xiàn)速度快、內(nèi)存省兼容各種 GPU 甚至純 CPU官方建議實時錄音優(yōu)先用它沒有 N 卡或 Mac 用戶選它最穩(wěn)Faster Whisper優(yōu)化版比原生快很多適合有 6GB 以上顯存的 N 卡Whisper原生最準確但慢且吃內(nèi)存硬件強時再用HuggingFace支持大量第三方模型包括 Meta MMS 系列覆蓋上千種語言O(shè)penAI API唯一需要聯(lián)網(wǎng)的后端用遠端服務(wù)器跑識別需在偏好設(shè)置里填 key模型檔位決定速度和準確率的平衡檔位體積約建議用途tiny75MB快速預(yù)覽、低配電腦base142MB日常對話速度與準確率的平衡點small466MB專業(yè)轉(zhuǎn)錄日常推薦檔位medium1.5GB重要內(nèi)容的長音頻large2.9GB最高精度需要較強硬件處理慢決策建議先用 base 或 small 跑一遍你的實際音頻聽一下錯字率夠用了就別升級。large 系列內(nèi)部還有 V2、V3 和 Turbo 變體V3 準確率最高但偶發(fā)編造詞Turbo 側(cè)重速度官方 FAQ 的建議是拿自己的語言實測對比見 docs/docs/faq.md。如果音頻里有人名、術(shù)語在Advanced設(shè)置里填 Initial prompt能明顯減少這類詞的錯拼。常見問題處理問題一轉(zhuǎn)錄太慢。原因語音識別計算量大模型檔位或后端類型與你的硬件不匹配。 解法換更小的模型或改用 Whisper.cpp 后端有 6GB 以上顯存的 N 卡可換 Faster Whisper。問題二打開錄音功能報錯如 PaErrorCode-9999或錄不到聲音。原因系統(tǒng)沒有授權(quán) Buzz 訪問麥克風(fēng)。 解法到系統(tǒng)隱私設(shè)置里開啟麥克風(fēng)權(quán)限Windows 是設(shè)置 → 隱私 → 麥克風(fēng)確認 Buzz 在允許列表里。問題三Buzz 崩潰或啟動失敗。原因模型文件下載不完整或損壞。 解法在幫助 → 偏好設(shè)置 → 模型里刪除對應(yīng)模型重新下載。另外注意 Buzz 要求 CPU 支持 AVX2非常老的機器無法運行。還有一類常見需求完全離線環(huán)境使用。在有網(wǎng)電腦上下載好模型通過偏好設(shè)置 → 模型 → Show file location找到模型緩存目錄Linux 為~/.cache/Buzz把整個目錄拷到離線機器的相同位置即可倉庫里也提供了 scripts/download-models.py 幫你批量準備離線模型包。進階入口命令行Buzz 自帶 CLI適合腳本化。例如一條命令用 Whisper.cpp 的 small 模型轉(zhuǎn)錄并直接導(dǎo)出 SRT 和 VTT 字幕文件buzz add --task transcribe --model-type whispercpp --model-size small --language zh --srt --vtt meeting.mp3加--hide-gui可以不彈主窗口后臺運行完整參數(shù)列表見 docs/docs/cli.md。自動化在偏好設(shè)置的 Folder Watch 標簽頁配置一個監(jiān)控文件夾之后凡是放進該文件夾的音頻都會自動開始轉(zhuǎn)錄適合持續(xù)產(chǎn)出素材的工作流。工作流集成導(dǎo)出層支持 TXT純文字、SRT/VTT剪輯工具字幕、JSON程序化處理實時錄音開啟導(dǎo)出后文字會實時寫入文本文件可以直接喂給 OBS 這類直播軟件做實時字幕。最后說幾句Buzz 的定位很明確把 Whisper 的語音轉(zhuǎn)文字能力完整搬到本地文件、視頻、麥克風(fēng)錄音三類輸入統(tǒng)一處理轉(zhuǎn)完可編輯、可調(diào)字幕、可導(dǎo)出。三條上手建議先裝一個 small 模型拿一段 5 分鐘以內(nèi)的音頻跑通導(dǎo)入 → 轉(zhuǎn)錄 → 雙擊查看這條主線手動指定語言別依賴自動檢測這是官方明確推薦的用法如果你有持續(xù)處理的文件配好 Folder Watch如果要寫腳本直接用buzz add命令行【免費下載鏈接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.項目地址: https://gitcode.com/GitHub_Trending/buz/buzz創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考