言語(yǔ)音的完整指南)
5分鐘上手 VoxCPM從快速安裝到生成第一條多語(yǔ)言語(yǔ)音的完整指南【免費(fèi)下載鏈接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning項(xiàng)目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPMVoxCPM 是一款無(wú)離散令牌器的文本轉(zhuǎn)語(yǔ)音TTS系統(tǒng)輸入文字直接產(chǎn)出連續(xù)的自然語(yǔ)音還支持用一句描述捏音色、用一段音頻克隆音色。它適合做配音、有聲內(nèi)容和多語(yǔ)言語(yǔ)音應(yīng)用的開(kāi)發(fā)者與內(nèi)容創(chuàng)作者。這篇上手教程帶你走完安裝、出第一條語(yǔ)音、再到玩克隆的全流程。全程只需一條安裝命令和十幾行代碼最后你會(huì)拿到一個(gè)能直接播放的demo.wav48kHz 采樣率以及一套音色設(shè)計(jì)、語(yǔ)音克隆、參數(shù)調(diào)優(yōu)的實(shí)用手感。 為什么選 VoxCPM無(wú)令牌器 TTS 的三個(gè)不同點(diǎn)不做離散 token 化多數(shù) TTS 先把音頻切成離散 token 再重建VoxCPM 走擴(kuò)散自回歸路線(xiàn)全程在連續(xù)空間里建模音色和韻律的細(xì)小變化不會(huì)在量化環(huán)節(jié)丟30 種語(yǔ)言 9 種中文方言不用加語(yǔ)言標(biāo)簽輸入什么語(yǔ)言就合成什么語(yǔ)言三種拿音色的方式文字描述設(shè)計(jì)音色、參考音頻做可控克隆、音頻加文本做續(xù)寫(xiě)式極致克隆。下面這張架構(gòu)圖里文本先進(jìn) Text-Semantic LM 出語(yǔ)義再由 Residual Acoustic LM 逐段生成連續(xù)聲學(xué)表征最后交給 LocDiT 和 AudioVAE 解碼成 48kHz 波形? 30 秒環(huán)境核對(duì)Python 版本與顯存要求動(dòng)手前花半分鐘對(duì)一下清單能避開(kāi)九成安裝報(bào)錯(cuò)系統(tǒng)Linux 或 Windows有 NVIDIA GPU 體驗(yàn)最好Apple Silicon Mac 也能跑Python3.10 ~ 3.123.13 及以上暫不支持依賴(lài)PyTorch ≥ 2.5.0、CUDA ≥ 12.0pip install時(shí)會(huì)一并裝好顯存VoxCPM2 約需 8GB沒(méi)有 GPU 也能用 CPU只是速度慢網(wǎng)絡(luò)首次運(yùn)行要聯(lián)網(wǎng)拉模型權(quán)重國(guó)內(nèi)網(wǎng)絡(luò)可以稍后走 ModelScope 鏡像 PyPI 一行安裝 VoxCPM附源碼備選推薦方式只有一行裝完命令行里會(huì)多出一個(gè)voxcpm工具跑一下voxcpm --help能看到子命令就說(shuō)明裝好了pip install voxcpm需要最新開(kāi)發(fā)版時(shí)從源碼裝即可效果等同git clone https://gitcode.com/GitHub_Trending/vo/VoxCPM cd VoxCPM pip install . 第一次運(yùn)行10 行代碼生成第一條語(yǔ)音把下面腳本存成first_run.py運(yùn)行。首次執(zhí)行會(huì)自動(dòng)下載 VoxCPM2 權(quán)重國(guó)內(nèi)下載慢可先pip install modelscope用snapshot_download拉到本地再from_pretrained指向本地目錄from voxcpm import VoxCPM import soundfile as sf model VoxCPM.from_pretrained(openbmb/VoxCPM2, load_denoiserFalse) # 首次自動(dòng)下載權(quán)重 wav model.generate( text你好這是我用 VoxCPM 生成的第一條語(yǔ)音。, cfg_value2.0, # 提示遵循強(qiáng)度默認(rèn) 2.0 inference_timesteps10, # 擴(kuò)散步數(shù)越大越精細(xì)也越慢 ) sf.write(demo.wav, wav, model.tts_model.sample_rate)運(yùn)行結(jié)束工作目錄里會(huì)多出demo.wav用任意播放器打開(kāi)即可聽(tīng)到一句自然的中文——這就是你的第一個(gè)結(jié)果。 核心功能演示音色設(shè)計(jì)與零樣本克隆VoxCPM2 最出效果的玩法有兩個(gè)各配一段最小代碼。用一句描述設(shè)計(jì)全新音色不上傳任何音頻只把音色描述用括號(hào)寫(xiě)在text開(kāi)頭模型就會(huì)照描述生成一個(gè)新演員wav model.generate( text(年輕女性聲音溫柔甜美)歡迎來(lái)到 VoxCPM 的世界, seed42, # 固定隨機(jī)種子方便復(fù)現(xiàn) ) sf.write(voice_design.wav, wav, model.tts_model.sample_rate)參考音頻克隆 風(fēng)格指令微調(diào)傳一段參考音頻音色來(lái)自它括號(hào)里的指令再疊加情緒和語(yǔ)速原音色不變wav model.generate( text(語(yǔ)速稍快語(yǔ)氣歡快)這是克隆音色配上風(fēng)格指令的效果。, reference_wav_pathexamples/reference_speaker.wav, # 換成你的參考音頻 seed42, ) sf.write(clone.wav, wav, model.tts_model.sample_rate)想逐細(xì)節(jié)還原就用極致克隆同一段音頻同時(shí)傳給prompt_wav_path和reference_wav_path并補(bǔ)上prompt_text音頻對(duì)應(yīng)的文本要邊生成邊播放則改用model.generate_streaming。? 參數(shù)調(diào)優(yōu)cfg_value 與推理步數(shù)怎么取generate里真正值得動(dòng)的參數(shù)就三個(gè)按下面的感覺(jué)調(diào)即可參數(shù)默認(rèn)值什么時(shí)候調(diào)cfg_value2.0讀起來(lái)僵硬、不聽(tīng)提示 → 調(diào)高聽(tīng)起來(lái)緊張不自然 → 調(diào)低。推薦 1.0~3.0允許范圍 0.1~10inference_timesteps10出成品要細(xì)節(jié) → 提到 15~30快速試草稿 → 降到 4~8seed隨機(jī)想復(fù)現(xiàn)同一條結(jié)果就固定它比如 42音色設(shè)計(jì)和克隆類(lèi)功能每次生成的表現(xiàn)力會(huì)略有差異這是正常的——多跑 1~2 條挑最順耳的那條即可。? 進(jìn)階入口Web 界面、CLI 與 LoRA 微調(diào)不想寫(xiě)代碼時(shí)倉(cāng)庫(kù)自帶 Gradio 網(wǎng)頁(yè)運(yùn)行python app.py --port 8808后瀏覽器打開(kāi)http://localhost:8808就能點(diǎn)選生成--device auto會(huì)自動(dòng)挑 CPU/GPU。純命令行黨可以直接用子命令音色設(shè)計(jì)voxcpm design --text Hello --control warm female voice --output out.wav克隆voxcpm clone --text 文本 --reference-audio ref.wav --output out.wav還有voxcpm batch按行批量出音頻。如果你有 5~10 分鐘錄音可以用 LoRA 微調(diào)出自己的專(zhuān)屬音色入口是 scripts/train_voxcpm_finetune.py對(duì)應(yīng)配置在 conf/voxcpm_v2/倉(cāng)庫(kù)還附帶了 lora_ft_webui.py 圖形化訓(xùn)練界面。 繼續(xù)深入文檔、樣例與源碼README_zh.md中文完整文檔含支持語(yǔ)言列表、版本對(duì)比和評(píng)測(cè)數(shù)據(jù)examples/參考音頻、示例文本和訓(xùn)練數(shù)據(jù)格式樣例src/voxcpm/核心源碼模型、AudioVAE、LoRA 層都在這里關(guān)掉這篇文章打開(kāi)終端把pip install voxcpm跑起來(lái)——一分鐘后你就能聽(tīng)到自己的第一條 VoxCPM 語(yǔ)音。【免費(fèi)下載鏈接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning項(xiàng)目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考