)
3分鐘把電子書變成有聲書ebook2audiobook免費完整教程支持克隆自己的聲音【免費下載鏈接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!項目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook書架上是不是堆著一堆買了卻沒讀完的電子書ebook2audiobook簡稱 E2A是一款免費的開源轉(zhuǎn)換工具它用 AI 語音合成把電子書讀成帶章節(jié)標記的有聲書——支持 1158 種語言、9 個 TTS 引擎文本轉(zhuǎn)語音引擎還能用你自己錄的聲音來讀。下面按裝好 → 用會 → 玩出花樣的順序帶你從第一本有聲書走到批量生產(chǎn)線。先聽為快這本書會說話之后是什么樣一句話概括 E2A 能做什么你丟進一本電子書它吐出一整個有聲書架。1158 種語言從中文、英語到斯瓦希里語語言代碼用 ISO-639 格式如eng、zho兩字母代碼如en也認得23 種輸入格式.epub、.mobi、.azw3、.pdf、.txt、.docx、.html甚至掃描圖片.png、.jpg都能轉(zhuǎn)9 個 TTS 引擎XTTSv2、Bark、VITS、Tacotron2、YourTTS、GlowTTS、Tortoise、Fairseq、Piper可自由切換語音克隆上傳一段自己的錄音之后的有聲書全部用你的嗓子讀10 種輸出格式M4B、MP3、WAV、FLAC 等單聲道或立體聲任選完全本地運行轉(zhuǎn)換過程不上傳任何文件讀什么書只有你自己知道典型的使用場景通勤路上聽完一本周報和小說、給娃做睡前故事、幫視力不好的家人讀報紙、把英文原版書變成外語聽力材料。?? 一個前提只處理無 DRM 保護、合法獲取的電子書作者不對濫用負責。低門檻啟動2GB 內(nèi)存的電腦就夠跑先說實話E2A 對硬件的要求比你想的低得多但低和快是兩回事。硬件門檻來自官方 README項目最低要求推薦配置內(nèi)存2GB8GB顯存1GB4GBPython3.10 – 3.12啟動腳本自動裝好不用你操心—處理器純 CPU 即可NVIDIA 顯卡CUDA、Apple SiliconMPS、AMDROCm都能加速有 GPU 體驗接近實時沒有獨立顯卡也沒關系只是速度會從幾乎實時降到慢慢磨后面排坑章節(jié)有對應解法。兩步安裝裝完就能用# 第一步克隆倉庫 git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook# 第二步啟動首次運行會自動安裝 Python 依賴稍等片刻 ./ebook2audiobook.command # Linux / macOS # Windows 用戶直接雙擊 ebook2audiobook.cmd看到終端里蹦出http://localhost:7860/的地址后瀏覽器打開它圖形界面就來了。圖形界面四步走從上傳到拿到音頻界面是 Gradio網(wǎng)頁版交互界面風格分標簽頁操作零基礎也能跟著走完。第 1 步上傳電子書預覽章節(jié)在 Input Options 區(qū)域把文件拖進上傳框。.epub和.mobi是自動識別章節(jié)效果最好的兩種格式如果你的書里有目錄頁、版權(quán)頁這類不想被讀出來的內(nèi)容建議先在閱讀器里手動刪掉再轉(zhuǎn)換EPUB 格式?jīng)]有統(tǒng)一的章節(jié)結(jié)構(gòu)標準這是官方明確提醒的。另外這里還有個文本框入口最多 1024 個字符適合直接把一段短文轉(zhuǎn)成語音試試聲。第 2 步調(diào)音——溫度、語速、引擎怎么填切到 Audio Generation Preferences 標簽頁幾個關鍵旋鈕的推薦取值溫度Temperature控制語音的發(fā)揮空間越高越有變化、越不重復。求穩(wěn)讀小說建議從 0.6–0.8 之間起步Top-pTop-p 采樣限制模型只從最可能的前 p 比例候選詞里選調(diào)低如 0.8語音更自然、生成還更快語速Speed默認 1x通勤想趕進度可以拉高給孩子講睡前故事就放慢引擎默認 XTTSv2質(zhì)量最好、支持語音克隆純 CPU 機器可換 YourTTS 或 Tacotron2 提速輸出格式默認 M4B 單聲道一般不用動第 3 步點 Convert然后去喝杯水長書轉(zhuǎn)換需要時間進度條會在頁面上實時滾動。中途反悔了點電子書上傳組件上的 [X] 即可取消。第 4 步試聽 下載轉(zhuǎn)換完成后在結(jié)果頁直接在線試聽滿意后點下載按鈕文件同時保存在本地的audiobooks目錄下。命令行與語音克隆進階用戶的批處理路線圖形界面適合單本精修命令行headless 模式即不開界面直接跑轉(zhuǎn)換才是批量黨的主場。一個整文件夾批量轉(zhuǎn)把一堆書放進一個目錄一條命令全部讀出來# 批量轉(zhuǎn)換 books 目錄下所有電子書輸出到 audiobooks指定英語 ./ebook2audiobook.command --headless --ebooks_dir books --output_dir audiobooks --language eng所有參數(shù)一覽可用--help查看完整清單也能在 lib/conf.py 的cli_options里查到。常用的還有--output_format指定輸出格式mp3、m4b、wav……--device指定 CPU/CUDA/MPS 等計算設備--session轉(zhuǎn)換中斷或崩潰后憑會話 ID 斷點續(xù)轉(zhuǎn)不用從頭再來三步克隆自己的聲音朗讀手機隨便錄一段1–5 分鐘的人聲wav 或 mp3 都行環(huán)境不用安靜——README 明確說背景有噪聲甚至音樂都沒事E2A 會先把你的聲音去噪清洗轉(zhuǎn)換時加上--voice指向這段錄音# 用你自己的聲音讀這本書 ./ebook2audiobook.command --headless --ebook books/moby_dick.epub --voice voices/my_voice.wav --language eng批量轉(zhuǎn)換時還能用--voice_map傳入一個 JSON 映射文件給不同書配不同講述人比如給詩集配你的聲音、給歷史讀物配家人的聲音。更細的控制SML 標簽文本里可以埋入 SMLSpecial Markup Language標簽做精細編排[break]插入 0.3–0.6 秒短停頓、[pause]插入 1.0–1.6 秒長停頓、[pause:3]精確暫停 3 秒、[voice:路徑]...[/voice]在句子中間切換講述者。做多人對話的劇本式有聲書這組標簽就是全部家當。想要自動打標簽可以看倉庫內(nèi)置的 components/E2A-SML/ 組件。兩個能直接抄的作業(yè)方案方案 A通勤族地鐵聽書流水線適合每天通勤 30 分鐘以上、想聽完技術文檔或長篇小說的人。周日下午花 10 分鐘把下周想讀的書放進一個文件夾用--ebooks_dir批量轉(zhuǎn)--speed 1.2提 20% 語速輸出選 MP3 格式手機、車機、藍牙音箱全兼容如果聽書 App 支持章節(jié)跳轉(zhuǎn)就選默認的 M4B音頻同步到手機地鐵上從上次章節(jié)繼續(xù)常用輸出格式怎么選看這張表--output_format對應關系格式優(yōu)點缺點什么時候選它M4B默認帶章節(jié)標記有聲書 App 直接認個別車機不支持長篇有聲書、搭配 AudiobookshelfMP3兼容性最好到處能放無章節(jié)信息手機 / 車機 / 音箱WAV無損音質(zhì)文件體積最大要后期剪輯、二次加工FLAC無損且比 WAV 小體積仍大于 MP3自己存檔方案 B家長睡前故事 雙語啟蒙組合從公共領域書庫找一本英文版童書.epub最佳自動分章最準語速設 0.9x[pause:2]在每章之間多留兩秒節(jié)奏更舒緩想讓孩子順便學中文或反過來加一個--translate zho參數(shù)E2A 會先離線翻譯整本再合成翻譯版文件名自動加語言后綴和原版互不干擾進階玩法用你自己的聲音克隆讀給孩子聽——爸爸親自講的睡前故事比任何 AI 聲線都親切 一位做程序員的用戶在討論區(qū)留言每周日批量轉(zhuǎn)好下周 3 章技術書通勤兩小時聽完半年聽完了 5 本比啃文字快多了。另一位英語老師則拿它給學生批量生成課文音頻孩子追著問我能不能再把故事?lián)Q個人聲讀一遍。排坑與調(diào)音轉(zhuǎn)換慢、聲音不自然怎么辦問題一轉(zhuǎn)得太慢慢的根源通常是引擎跑在 CPU 上。按優(yōu)先級排查先確認 GPU 被識別了——終端啟動日志會打印檢測到的設備有卡卻沒用上可用--device CUDA手動指定有 GPU 就保持默認 XTTSv2接近實時輸出純 CPU 機器換輕量引擎引擎音質(zhì)CPU 速度適合誰XTTSv2默認高接近真人慢建議 GPU追求質(zhì)量、要語音克隆Bark高表現(xiàn)力強慢需要情緒、語氣變化YourTTS中等官方形容為Siri 水平快純 CPU 機器注意不支持零樣本克隆Tacotron2中等快純 CPU 機器只求能聽依賴裝不上、環(huán)境沖突直接用 Docker 鏡像官方說明它是完全自包含的一條docker run命令就能跑 GUI 或 headless 模式docker-compose.yml 已備好問題二聲音不自然、聽著像機器人念稿溫度先試 0.6–0.8 區(qū)間微調(diào)太高會開始編詞太低會機械Top-p 收到 0.8 左右Top-k 適當調(diào)小輸出更可預測、生成還更快換個預調(diào)好的預設模型試試--fine_tuned指向官方預設如不同口音/風格的 XTTSv2 微調(diào)模型倉庫里的 lib/conf_models.py 能看到引擎與默認參數(shù)對照音頻被截斷官方建議直接提 Issue 反饋——團隊需要各語言的句子切分樣本來修這個邏輯其他高頻疑問想邊轉(zhuǎn)邊推流加--abs_url等參數(shù)可直接寫入 Audiobookshelf 服務器掃描版 PDF、純圖片的 JPG 也能轉(zhuǎn)內(nèi)置 OCR光學字符識別會先把圖里的字認出來想自己訓練一個專屬聲音模型倉庫內(nèi)置了 components/Universal_TTS_Finetune/ 訓練組件和 Notebooks/finetune/xtts/colab_xtts_finetune_webui.ipynb 在線訓練筆記本錄 1–5 分鐘素材就能起步去哪找免費書以及進階方向素材從哪來首選公共領域書庫——古登堡計劃Project Gutenberg上的經(jīng)典作品沒有版權(quán)限制放心轉(zhuǎn)。倉庫自帶的 ebooks/tests/ 目錄里還有 80 多個語言版本的測試電子書.azw3 對應.txt想先試試某個語言的合成效果從這兒拿一本最方便。進階三條路想要自動化的停頓與換聲研究 components/E2A-SML/它負責把 SML 標簽自動加進書里想擁有只屬于你的聲音模型用 Notebooks/colab_ebook2audiobook.ipynb 在無卡環(huán)境免費跑轉(zhuǎn)換用 Universal_TTS_Finetune 訓練專屬模型后再通過--custom_model上傳zip 包需含 config.json、model.pth、vocab.json、ref.wav想改默認行為lib/conf.py 里所有默認值輸出格式、聲道、目錄都集中在那一段注釋為CAN BE MODIFIED的區(qū)域官方建議改前先備份原文件現(xiàn)在就可以動手了把倉庫拉下來從 ebooks/tests/ 挑一本測試書用默認設置轉(zhuǎn)一首有聲書出來聽聽——從第一聲開口到批量生產(chǎn)線中間只隔著一個下午?!久赓M下載鏈接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!項目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考