
10 分鐘錄音訓練專屬音色模型RVC 變聲器從錄制到批量換聲的完整指南【免費下載鏈接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!項目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based Voice Conversion WebUI是一個開源的語音克隆與變聲器工具。你給它 10 到 50 分鐘的人聲錄音它訓練出一個屬于你的音色模型之后任何音頻丟進去都會用那個音色重新輸出。給視頻配音、給游戲角色換聲、做翻唱又不想碰音頻工程細節(jié)的人用的就是它。要準備多少錄音錄的時候注意什么數(shù)據(jù)量決定效果上限這是整個流程里唯一不可逆的一步。官方 FAQ 的建議是總時長 10 到 50 分鐘——因為模型靠這些樣本覆蓋你不同的發(fā)音狀態(tài)樣本越足音色還原越穩(wěn)。如果你的錄音干凈、底噪低、音色有辨識度5 到 10 分鐘也能訓出可用模型但上限就鎖住了。錄的時候把握三件事環(huán)境安靜。底噪會直接進模型訓練輪次再高也壓不下去語速、語調(diào)、情緒要有變化。別只念一種腔調(diào)模型靠這些樣本學會不同的發(fā)音狀態(tài)單條片段控制在幾十秒到一兩分鐘。過長的錄音在切分和內(nèi)存占用上都是負擔錄完統(tǒng)一轉成 WAV 即可。采樣率不用糾結預處理階段會自動重采樣到訓練時選定的檔位。我的機器跑得動嗎顯存、內(nèi)存和軟件夠不夠先說結論4GB 顯存的顯卡可以完成訓練和推理。程序啟動時會自己讀顯存大小并調(diào)整內(nèi)部參數(shù)4GB 以下會自動改用更保守的分塊配置。但如果你只有 3GB、2GB 的老卡官方 FAQ 的建議是直接放棄只能換卡或租云 GPU。除了顯存還有三樣前提不能省系統(tǒng)內(nèi)存。切分和音高提取吃 CPU 多進程內(nèi)存不夠時把CPU 進程數(shù)調(diào)低或手動把訓練音頻切短些ffmpeg。切分和重采樣全靠它Ubuntu 上sudo apt install ffmpegmacOS 上brew install ffmpeg預訓練底模。倉庫里各平臺的 dlmodels 腳本就是用來下載 assets 目錄底模的缺了底模訓練和推理都起不來最快跑通的路徑從拉代碼到一鍵訓練接下來所有命令都在項目根目錄執(zhí)行。# 拉取倉庫代碼 git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI進入目錄后建虛擬環(huán)境并按顯卡裝依賴# 建環(huán)境并安裝依賴按 CUDA 版本選文件 python -m venv rvc-env # 激活 rvc-env 后執(zhí)行 pip install -r requirments_cu118_py312.txt有 CUDA 11.8 的卡選requirments_cu118_py312.txtCUDA 12.8 選requirments_cu128_py312.txt純 CPU 選requirments_cpu_py312.txt倉庫里三個文件都在根目錄。然后啟動訓練網(wǎng)頁# 啟動 WebUI瀏覽器自動打開 7865 端口 python webui.py7865 是 configs/config.py 里寫死的默認端口被占用時可以用--port換。Windows 用戶也可以直接雙擊 go-webui.bat 走整合包路線。打開訓練頁后值得動的數(shù)字就三個其余保持默認參數(shù)英文 / 中文設置建議這樣設的理由batch size批次大小用頁面默認值OOM 就往下調(diào)默認按顯存大小自動估算約為顯存 GB 數(shù)的一半是穩(wěn)定起步值save epoch保存間隔每 10 輪存一個點間隔小才能逐個試聽挑出最早達標的那個避免過擬合total epoch總輪數(shù)數(shù)據(jù)有底噪 20~30 輪干凈且時長足可到 200 輪底噪大的數(shù)據(jù)訓太多輪模型只會把噪音也學進去官方 FAQ另外兩項影響明顯順手設一下采樣率選 48k 對應 v2 底模這是官方配置里質量上限最高的一檔配置見 configs/v2/48k.json音高提取算法選 rmvpe界面標注它效果最好且只占少量顯存harvest 低音更好但極慢pm 適合歌聲輸入提速。確認訓練集文件夾路徑、填一個實驗名后面找模型全靠它點一鍵訓練。流程會依次執(zhí)行切分、音高提取、特征提取、訓練主邏輯在 train/train.py全程日志寫在logs/實驗名/下。為什么訓練完聲音不像兩步?jīng)]做對相似度就會打折。漏了索引訓練相似度直接打折索引文件決定結果保留多少訓練集的音色。跳過它推理出來的聲音音質可能不錯但音色對不上。在網(wǎng)頁上點訓練索引它會用 faiss 把訓練特征聚成檢索庫產(chǎn)物是logs/實驗名/下added_開頭的.index文件。如果一鍵訓練結束沒看到索引多半是訓練集太大卡住了索引添加步驟重按一次訓練索引即可這是官方 FAQ 里明確說明的情況。index rate 沒調(diào)對音色泄露或音質受限切到模型推理頁點刷新音色選你的模型和索引上傳一段音頻轉換。重點調(diào)的是檢索特征占比index rate范圍 0 到 1默認 0.75調(diào)高接近 1音色完全錨定訓練集不會漏出輸入源或底模的音色但音質上限被訓練集鎖死調(diào)低到 0不做檢索保護音質可能更好但音色泄露問題會回來訓練集本身優(yōu)質且時長足時這個值反而不重要模型自己已經(jīng)不太引用外部音色變調(diào)是整數(shù)半音12 升八度、-12 降八度。保護滑條protect默認 0.33專門防清輔音和呼吸聲撕裂輸出有電音時往高調(diào)。批量轉換和實時變聲能不能做能兩個方向都有現(xiàn)成入口。批量轉換不用開網(wǎng)頁命令行直接跑tools/infer_batch_rvc.py# 批量轉換 input 目錄下每個 wav 到 output 目錄 python tools/infer_batch_rvc.py --model_name 實驗名 \ --input_path ./input --opt_path ./output \ --index_path logs/實驗名/added_xxx.index \ --f0up_key 0 --f0method rmvpe目錄里每個.wav會被逐個轉換輸出到--opt_path指定的文件夾。想說話實時變聲雙擊 go-realtime_gui.bat 啟動實時界面。官方給出的延遲數(shù)據(jù)是端到端 170ms——這是完整鏈路實測值換成 ASIO 輸入輸出設備可壓到 90ms但后者非常依賴聲卡驅動支持普通 USB 聲卡別期待這個數(shù)字。30 秒自查清單訓練跑完之后按這個順序花 30 秒驗證一遍全過就是通了? 錄音總時長到了 10 分鐘以上且底噪聽感干凈——數(shù)據(jù)量是效果上限先確認它?logs/實驗名/下有added_開頭的.index文件——沒有就回網(wǎng)頁重按一次訓練索引? 推理頁 index rate 保持在 0.75 附近保護滑條protect沒被亂調(diào)? 挑一個保存點模型把 10 分鐘錄音里沒用過的一段音頻扔進去轉換聽音色對沒對對上了整個流程就通了。接下來可以試試批量腳本和實時界面把換聲嵌進你的工作流里?!久赓M下載鏈接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!項目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考