實(shí)戰(zhàn):B站視頻批量下載工具開(kāi)發(fā)全流程解析)
簡(jiǎn)介這是一份面向Python初學(xué)者與網(wǎng)絡(luò)爬蟲(chóng)實(shí)踐者的入門級(jí)練習(xí)資源聚焦B站小視頻的批量采集場(chǎng)景涵蓋動(dòng)態(tài)請(qǐng)求構(gòu)造、User-Agent隨機(jī)化、視頻文件大小預(yù)估及下載進(jìn)度實(shí)時(shí)反饋等核心技能點(diǎn)適用于課程實(shí)驗(yàn)、自學(xué)項(xiàng)目或技術(shù)備賽中的HTTP協(xié)議實(shí)戰(zhàn)訓(xùn)練。壓縮包共5個(gè)Python源文件總大小僅12KB結(jié)構(gòu)清晰主程序bilibili.py統(tǒng)籌調(diào)度其余task_*.py分別封裝獲取動(dòng)態(tài)接口數(shù)據(jù)、生成隨機(jī)瀏覽器頭部、計(jì)算目標(biāo)視頻體積、實(shí)時(shí)打印下載進(jìn)度等模塊化功能便于分步調(diào)試與原理理解。已有272人學(xué)習(xí)下載資源代碼簡(jiǎn)潔規(guī)范注釋充分無(wú)第三方依賴硬編碼可直接運(yùn)行并快速遷移至其他類似視頻平臺(tái)爬取邏輯中是掌握requeststimeos基礎(chǔ)組合應(yīng)用的優(yōu)質(zhì)實(shí)操范例。1. 項(xiàng)目概述與核心價(jià)值最近在整理硬盤翻出來(lái)一個(gè)幾年前寫的Python腳本名字就叫“網(wǎng)絡(luò)爬蟲(chóng)-批量爬取B站視頻-python練習(xí)源碼.zip”。當(dāng)時(shí)寫這個(gè)純粹是為了練手想看看自己能不能搞定一個(gè)相對(duì)復(fù)雜的爬蟲(chóng)任務(wù)。沒(méi)想到這個(gè)項(xiàng)目后來(lái)成了我理解網(wǎng)絡(luò)請(qǐng)求、數(shù)據(jù)解析、并發(fā)處理和反爬策略的絕佳案例。今天我就把這個(gè)“練習(xí)源碼”背后的完整思路、踩過(guò)的坑以及一些實(shí)用的技巧掰開(kāi)揉碎了跟大家聊聊。無(wú)論你是剛學(xué)完P(guān)ython基礎(chǔ)想找個(gè)項(xiàng)目練手還是對(duì)爬蟲(chóng)技術(shù)感興趣想了解如何從零構(gòu)建一個(gè)能穩(wěn)定運(yùn)行的批量下載工具這篇文章應(yīng)該都能給你一些直接的參考。簡(jiǎn)單來(lái)說(shuō)這個(gè)項(xiàng)目就是用Python寫一個(gè)腳本能夠自動(dòng)、批量地獲取B站上指定視頻的下載鏈接并保存到本地。它解決的痛點(diǎn)很直接當(dāng)你看到一個(gè)UP主的系列教程、一個(gè)精彩的合集或者只是想備份自己收藏夾里的視頻時(shí)手動(dòng)一個(gè)個(gè)點(diǎn)開(kāi)下載效率太低。這個(gè)腳本就是為了把我們從重復(fù)勞動(dòng)中解放出來(lái)。當(dāng)然我必須強(qiáng)調(diào)任何爬蟲(chóng)行為都必須在法律和網(wǎng)站服務(wù)條款允許的范圍內(nèi)進(jìn)行尊重版權(quán)和網(wǎng)站服務(wù)器的負(fù)載本分享僅用于技術(shù)學(xué)習(xí)和交流目的。2. 項(xiàng)目整體設(shè)計(jì)與思路拆解2.1 核心需求與技術(shù)選型這個(gè)項(xiàng)目的核心目標(biāo)很明確輸入一個(gè)或多個(gè)B站視頻的鏈接比如一個(gè)合集頁(yè)面、一個(gè)UP主的主頁(yè)、或一個(gè)視頻列表程序能自動(dòng)解析出所有視頻的真實(shí)播放地址并下載到本地指定文件夾。要實(shí)現(xiàn)這個(gè)目標(biāo)我們需要拆解出幾個(gè)關(guān)鍵技術(shù)環(huán)節(jié)網(wǎng)頁(yè)內(nèi)容獲取如何模擬瀏覽器向B站服務(wù)器發(fā)起請(qǐng)求并拿到返回的HTML或JSON數(shù)據(jù)。數(shù)據(jù)解析與提取如何從復(fù)雜的網(wǎng)頁(yè)源碼或接口返回的數(shù)據(jù)中精準(zhǔn)地找到我們需要的視頻標(biāo)題、BV號(hào)/AV號(hào)以及最重要的——視頻流信息。視頻流地址解析B站的視頻是分P、分清晰度、并且地址是動(dòng)態(tài)生成的如何獲取到可下載的m4s或flv/mp4直鏈。文件下載與存儲(chǔ)如何高效、穩(wěn)定地下載可能很大的視頻文件并合理命名、組織文件夾。反爬蟲(chóng)策略應(yīng)對(duì)如何應(yīng)對(duì)常見(jiàn)的反爬手段如請(qǐng)求頭校驗(yàn)、頻率限制等確保腳本能穩(wěn)定運(yùn)行一段時(shí)間?;谶@些環(huán)節(jié)我的技術(shù)選型如下請(qǐng)求庫(kù)requests。這是Python中最簡(jiǎn)單易用的HTTP庫(kù)足以應(yīng)對(duì)B站大部分接口和頁(yè)面請(qǐng)求。對(duì)于更復(fù)雜的動(dòng)態(tài)頁(yè)面早期可能需要會(huì)考慮selenium但為了效率和輕量本項(xiàng)目?jī)?yōu)先嘗試分析其API接口。解析庫(kù)jsonre(正則表達(dá)式) BeautifulSoup。B站很多數(shù)據(jù)是通過(guò)API返回的JSON格式直接用json解析最方便。對(duì)于部分嵌入在HTML中的數(shù)據(jù)用BeautifulSoup進(jìn)行HTML解析。一些特定的參數(shù)或鏈接用re進(jìn)行正則匹配往往更快。下載工具requests流式下載。對(duì)于大文件使用requests.get(streamTrue)進(jìn)行分塊下載避免內(nèi)存溢出同時(shí)可以顯示下載進(jìn)度。并發(fā)處理可選concurrent.futures或asyncioaiohttp。當(dāng)需要批量下載幾十上百個(gè)視頻時(shí)串行下載太慢。使用線程池或異步IO可以極大提升效率。本練習(xí)源碼中我使用了concurrent.futures.ThreadPoolExecutor因?yàn)樗鼘?duì)I/O密集型任務(wù)如下載效果顯著且代碼簡(jiǎn)單。注意技術(shù)選型的核心原則是“夠用就好易于維護(hù)”。requestsBeautifulSoup的組合在應(yīng)對(duì)B站這類混合了API和靜態(tài)頁(yè)面的網(wǎng)站時(shí)非常靈活。盲目上scrapy等重型框架對(duì)于這個(gè)特定任務(wù)來(lái)說(shuō)可能增加了不必要的復(fù)雜度。2.2 環(huán)境準(zhǔn)備與依賴安裝工欲善其事必先利其器。在開(kāi)始編碼前我們需要搭建好Python環(huán)境并安裝必要的庫(kù)。這里假設(shè)你已經(jīng)安裝了Python3.6及以上版本。創(chuàng)建虛擬環(huán)境推薦這是一個(gè)好習(xí)慣可以隔離項(xiàng)目依賴。# 在項(xiàng)目目錄下 python -m venv venv # 激活虛擬環(huán)境 # Windows: venv\Scripts\activate # Linux/Mac: source venv/bin/activate安裝核心依賴庫(kù)使用pip進(jìn)行安裝。pip install requests beautifulsoup4requests: 用于發(fā)送HTTP請(qǐng)求。beautifulsoup4: 用于解析HTML和XML文檔。如果你的Python版本較新json和re是標(biāo)準(zhǔn)庫(kù)無(wú)需安裝。對(duì)于并發(fā)下載concurrent.futures也是Python 3.2的標(biāo)準(zhǔn)庫(kù)。可選工具IDE/編輯器VSCode、PyCharm等它們對(duì)代碼提示、調(diào)試支持很好。在VSCode中配置Python環(huán)境也很簡(jiǎn)單安裝Python擴(kuò)展即可。瀏覽器開(kāi)發(fā)者工具這是爬蟲(chóng)工程師的“眼睛”。F12打開(kāi)在Network網(wǎng)絡(luò)選項(xiàng)卡中查看頁(yè)面加載過(guò)程中的所有請(qǐng)求XHR/Fetch類型尤其重要是找到真實(shí)數(shù)據(jù)接口的關(guān)鍵。3. 核心細(xì)節(jié)解析與實(shí)操要點(diǎn)3.1 逆向分析找到數(shù)據(jù)源頭這是爬蟲(chóng)項(xiàng)目中最關(guān)鍵、也最體現(xiàn)技術(shù)含量的部分。我們不能直接去下載網(wǎng)頁(yè)上播放器里的mp4文件因?yàn)槟莻€(gè)地址通常是臨時(shí)的、有鑒權(quán)的。我們需要找到B站提供視頻信息的原始API。操作過(guò)程實(shí)錄打開(kāi)一個(gè)B站視頻頁(yè)面例如https://www.bilibili.com/video/BV1xx411c7mD。按F12打開(kāi)開(kāi)發(fā)者工具切換到Network網(wǎng)絡(luò)選項(xiàng)卡。刷新頁(yè)面在紛繁復(fù)雜的請(qǐng)求列表中過(guò)濾XHR或Fetch類型的請(qǐng)求。仔細(xì)觀察你會(huì)發(fā)現(xiàn)一個(gè)包含web?aid或x/web-interface/view等字樣的請(qǐng)求。點(diǎn)擊它在Preview預(yù)覽或Response響應(yīng)標(biāo)簽頁(yè)里就能看到結(jié)構(gòu)清晰的JSON數(shù)據(jù)里面包含了視頻的標(biāo)題、分P信息、cid每一P的唯一標(biāo)識(shí)等。繼續(xù)尋找有一個(gè)包含playurl或x/player/wbi/playurl的請(qǐng)求這個(gè)請(qǐng)求的響應(yīng)里就藏著不同清晰度如1080p、720p對(duì)應(yīng)的視頻和音頻的m4s文件地址或直接的flv/mp4鏈接。這就是我們需要的真實(shí)下載地址。核心要點(diǎn)bvid和cidB站視頻有兩個(gè)重要ID。bvid如BV1xx411c7mD是視頻的唯一標(biāo)識(shí)用于前端展示。cid是每一P視頻的內(nèi)部標(biāo)識(shí)用于后端接口獲取流信息。通常需要先用bvid通過(guò)第一個(gè)API拿到該視頻所有分P的cid列表。接口參數(shù)這些API請(qǐng)求通常帶有大量參數(shù)如bvid、cid、qn清晰度標(biāo)識(shí)、fnval流格式標(biāo)識(shí)、fourk是否4K等。我們需要在代碼中模擬這些參數(shù)。請(qǐng)求頭Headers必須模擬瀏覽器的請(qǐng)求頭至少包含User-Agent、Referer通常設(shè)置為視頻頁(yè)面URL。有時(shí)還需要Cookie特別是登錄后才能看的視頻但出于合規(guī)考慮練習(xí)項(xiàng)目應(yīng)避免處理需要個(gè)人登錄Cookie的內(nèi)容。3.2 構(gòu)建請(qǐng)求與處理反爬拿到API地址和參數(shù)后我們需要用Python的requests庫(kù)來(lái)模擬這個(gè)請(qǐng)求。import requests import json headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/91.0.4472.124 Safari/537.36, Referer: https://www.bilibili.com, # 通常Referer是必須的 } def get_video_info(bvid): 根據(jù)bvid獲取視頻基本信息標(biāo)題分P列表 info_url fhttps://api.bilibili.com/x/web-interface/view?bvid{bvid} try: resp requests.get(info_url, headersheaders, timeout10) resp.raise_for_status() # 檢查請(qǐng)求是否成功 data resp.json() if data[code] 0: return data[data] else: print(f獲取視頻信息失敗: {data[message]}) return None except requests.exceptions.RequestException as e: print(f請(qǐng)求視頻信息時(shí)發(fā)生錯(cuò)誤: {e}) return None # 示例獲取BV1xx411c7mD的信息 video_data get_video_info(BV1xx411c7mD) if video_data: title video_data[title] pages video_data[pages] # 分P信息列表 for page in pages: print(f分P{page[page]}: {page[part]}, cid: {page[cid]})避坑技巧超時(shí)設(shè)置務(wù)必為requests.get設(shè)置timeout參數(shù)如10秒防止因網(wǎng)絡(luò)問(wèn)題導(dǎo)致程序長(zhǎng)時(shí)間卡死。異常處理使用try...except包裹網(wǎng)絡(luò)請(qǐng)求并檢查返回的JSON中code字段B站API通常0表示成功。頻率控制在循環(huán)請(qǐng)求多個(gè)視頻時(shí)務(wù)必在請(qǐng)求間添加隨機(jī)延時(shí)如time.sleep(random.uniform(1, 3))這是對(duì)目標(biāo)網(wǎng)站最基本的尊重也能有效避免因請(qǐng)求過(guò)快被暫時(shí)封禁IP。User-Agent輪換可以準(zhǔn)備一個(gè)User-Agent列表每次請(qǐng)求隨機(jī)選擇一個(gè)增加一些隨機(jī)性。3.3 解析并獲取下載鏈接拿到cid后下一步就是獲取指定清晰度的播放地址。def get_play_url(bvid, cid, quality80): 根據(jù)bvid和cid獲取視頻播放地址 quality: 清晰度標(biāo)識(shí)80表示1080P64表示720P32表示480P play_url_api https://api.bilibili.com/x/player/playurl params { bvid: bvid, cid: cid, qn: quality, # 清晰度 fnval: 80, # 指定獲取dash格式流包含分開(kāi)的視頻和音頻 fourk: 1, # 允許請(qǐng)求4K視頻 } try: resp requests.get(play_url_api, paramsparams, headersheaders, timeout10) data resp.json() if data[code] 0: dash data[data][dash] # dash格式下video和audio是分開(kāi)的 video_url dash[video][0][baseUrl] # 通常取第一個(gè)即最高畫質(zhì) audio_url dash[audio][0][baseUrl] return video_url, audio_url else: print(f獲取播放地址失敗: {data[message]}) return None, None except Exception as e: print(f解析播放地址出錯(cuò): {e}) return None, None關(guān)鍵解析fnval參數(shù)這是一個(gè)位掩碼參數(shù)。fnval80十進(jìn)制或0x80十六進(jìn)制表示請(qǐng)求DASH格式流。DASH格式將視頻和音頻分離通常能獲得更好的畫質(zhì)和更小的文件體積因?yàn)榭梢灾幌螺d你需要的清晰度。fnval1則請(qǐng)求FLV格式已逐漸淘汰。fnval16請(qǐng)求MP4格式。本項(xiàng)目選擇80獲取DASH流。返回的video_url和audio_url就是.m4s文件的直鏈。我們需要分別下載它們?nèi)缓笥霉ぞ呷鏵fmpeg合并或者尋找直接返回mp4格式的接口可能清晰度受限。實(shí)操心得直接請(qǐng)求fnval16有時(shí)可以拿到直接的mp4鏈接更方便但清晰度選項(xiàng)可能不全。DASH流是未來(lái)的趨勢(shì)雖然多了一步合并操作但更靈活、畫質(zhì)更好。在代碼中我們可以提供一個(gè)選項(xiàng)讓用戶選擇。4. 實(shí)操過(guò)程與核心環(huán)節(jié)實(shí)現(xiàn)4.1 實(shí)現(xiàn)單視頻下載函數(shù)有了視頻和音頻的直鏈我們就可以實(shí)現(xiàn)下載功能了。這里實(shí)現(xiàn)一個(gè)支持進(jìn)度顯示的流式下載函數(shù)。def download_file(url, filepath, sessionNone): 下載文件并顯示進(jìn)度 session: 可傳入一個(gè)requests.Session()對(duì)象以保持連接 if session is None: session requests.Session() headers.update({Referer: https://www.bilibili.com}) # 下載時(shí)Referer也很重要 try: resp session.get(url, headersheaders, streamTrue, timeout30) resp.raise_for_status() total_size int(resp.headers.get(content-length, 0)) downloaded 0 with open(filepath, wb) as f: for chunk in resp.iter_content(chunk_size8192): if chunk: f.write(chunk) downloaded len(chunk) if total_size 0: percent downloaded / total_size * 100 print(f\r下載中: {filepath} - {percent:.2f}% ({downloaded}/{total_size} bytes), end) print(f\n下載完成: {filepath}) return True except Exception as e: print(f\n下載失敗 {url}: {e}) return False4.2 視頻與音頻的合并下載完DASH流的.m4s文件后我們需要將它們合并成一個(gè)完整的.mp4文件。最常用的工具是ffmpeg。方法一使用subprocess調(diào)用系統(tǒng)ffmpeg命令推薦確保你的系統(tǒng)已安裝ffmpeg并添加到環(huán)境變量PATH中。import subprocess import os def merge_audio_video(video_path, audio_path, output_path): 使用ffmpeg合并音視頻 # 清理可能存在的舊文件 if os.path.exists(output_path): os.remove(output_path) cmd [ ffmpeg, -i, video_path, -i, audio_path, -c:v, copy, # 視頻流直接復(fù)制不重新編碼速度極快 -c:a, aac, # 音頻流編碼為aac或copy但有時(shí)需要統(tǒng)一格式 -strict, experimental, output_path ] try: subprocess.run(cmd, checkTrue, capture_outputTrue, textTrue) print(f合并成功: {output_path}) # 可選刪除臨時(shí)的.m4s文件 os.remove(video_path) os.remove(audio_path) return True except subprocess.CalledProcessError as e: print(f合并失敗: {e.stderr}) return False方法二使用moviepy庫(kù)純Python但較重如果不想依賴外部工具可以安裝moviepy庫(kù)pip install moviepy但它處理大文件較慢且功能可能不如ffmpeg全面。4.3 實(shí)現(xiàn)批量爬取邏輯現(xiàn)在我們將上述所有環(huán)節(jié)串聯(lián)起來(lái)實(shí)現(xiàn)批量處理。核心邏輯是輸入一個(gè)包含多個(gè)B站視頻ID或一個(gè)合集URL的列表程序遍歷列表對(duì)每個(gè)視頻執(zhí)行“獲取信息 - 獲取鏈接 - 下載 - 合并”的流程。import time import random from concurrent.futures import ThreadPoolExecutor, as_completed def process_single_video(bvid, quality80, save_dir./downloads): 處理單個(gè)視頻的完整流程 # 1. 創(chuàng)建保存目錄 os.makedirs(save_dir, exist_okTrue) # 2. 獲取視頻基本信息 print(f\n開(kāi)始處理視頻: {bvid}) video_info get_video_info(bvid) if not video_info: return False title video_info[title].replace(/, _).replace(\\, _)[:100] # 清理非法文件名 pages video_info[pages] session requests.Session() # 為這個(gè)視頻創(chuàng)建一個(gè)會(huì)話 for page in pages: page_num page[page] part_title page[part] cid page[cid] # 生成文件名 if len(pages) 1: file_base_name f{title}_P{page_num}_{part_title} else: file_base_name title print(f 正在處理分P{page_num}: {part_title}) # 3. 獲取播放地址 video_url, audio_url get_play_url(bvid, cid, quality) if not video_url or not audio_url: print(f 獲取分P{page_num}播放地址失敗跳過(guò)。) continue # 4. 下載視頻和音頻 video_temp_path os.path.join(save_dir, f{file_base_name}_video.m4s) audio_temp_path os.path.join(save_dir, f{file_base_name}_audio.m4s) output_path os.path.join(save_dir, f{file_base_name}.mp4) if os.path.exists(output_path): print(f 文件已存在跳過(guò): {output_path}) continue print(f 開(kāi)始下載視頻流...) if not download_file(video_url, video_temp_path, session): continue time.sleep(random.uniform(0.5, 1.5)) # 請(qǐng)求間延時(shí) print(f 開(kāi)始下載音頻流...) if not download_file(audio_url, audio_temp_path, session): continue # 5. 合并 print(f 合并音視頻...) if merge_audio_video(video_temp_path, audio_temp_path, output_path): print(f ? 分P{page_num}處理完成: {output_path}) else: print(f ? 分P{page_num}合并失敗。) return True def batch_download(bvid_list, quality80, save_dir./downloads, max_workers3): 批量下載視頻支持并發(fā) with ThreadPoolExecutor(max_workersmax_workers) as executor: future_to_bvid {executor.submit(process_single_video, bvid, quality, save_dir): bvid for bvid in bvid_list} for future in as_completed(future_to_bvid): bvid future_to_bvid[future] try: success future.result() if success: print(f\n視頻 {bvid} 所有分P處理完畢。) except Exception as e: print(f\n處理視頻 {bvid} 時(shí)發(fā)生未預(yù)期錯(cuò)誤: {e}) # 每個(gè)視頻任務(wù)完成后添加一個(gè)較長(zhǎng)延時(shí)避免對(duì)服務(wù)器造成集中壓力 time.sleep(random.uniform(3, 7)) if __name__ __main__: # 示例下載兩個(gè)視頻 my_bvid_list [BV1xx411c7mD, BV1Bf4y1U7QP] batch_download(my_bvid_list, quality80, save_dir./bilibili_videos, max_workers2)代碼邏輯解讀process_single_video函數(shù)封裝了處理一個(gè)視頻可能包含多P的完整流水線。batch_download函數(shù)利用ThreadPoolExecutor實(shí)現(xiàn)并發(fā)下載。max_workers控制并發(fā)數(shù)建議不要設(shè)置過(guò)高如3-5以免對(duì)目標(biāo)服務(wù)器造成過(guò)大壓力或觸發(fā)反爬。在主程序中將要下載的視頻bvid放入列表調(diào)用batch_download即可。5. 常見(jiàn)問(wèn)題與排查技巧實(shí)錄在實(shí)際運(yùn)行過(guò)程中你肯定會(huì)遇到各種各樣的問(wèn)題。下面是我在開(kāi)發(fā)和運(yùn)行這個(gè)腳本時(shí)遇到的一些典型問(wèn)題及解決方法。5.1 問(wèn)題獲取視頻信息或播放地址時(shí)返回-403或-404錯(cuò)誤碼可能原因1請(qǐng)求頭不完整或錯(cuò)誤。排查用瀏覽器開(kāi)發(fā)者工具對(duì)比你的Python腳本發(fā)送的請(qǐng)求頭與瀏覽器發(fā)送的請(qǐng)求頭。重點(diǎn)檢查User-Agent、Referer有時(shí)還需要Origin。解決確保headers字典盡可能模擬瀏覽器。Referer通常必須設(shè)置為https://www.bilibili.com或具體的視頻頁(yè)面URL??赡茉?接口參數(shù)已更新或需要額外的鑒權(quán)參數(shù)。排查B站的API接口可能會(huì)更新。重新用開(kāi)發(fā)者工具抓包查看最新的playurl接口請(qǐng)求參數(shù)。特別注意是否有w_rid和wts這類動(dòng)態(tài)簽名參數(shù)這是B站一種常見(jiàn)的反爬機(jī)制。解決如果發(fā)現(xiàn)需要w_rid和wts說(shuō)明接口已升級(jí)為WBI簽名鑒權(quán)。你需要找到生成這兩個(gè)參數(shù)的JavaScript代碼并用Python實(shí)現(xiàn)其算法或者尋找其他無(wú)需簽名的替代接口有時(shí)舊版接口仍可用。這是一個(gè)進(jìn)階挑戰(zhàn)需要一定的JS逆向能力??赡茉?視頻需要大會(huì)員或地區(qū)限制。排查在瀏覽器中確認(rèn)該視頻是否需要登錄或大會(huì)員才能觀看你想要的清晰度。解決對(duì)于需要登錄的視頻必須在請(qǐng)求頭中攜帶有效的Cookie。但請(qǐng)注意獲取和使用他人Cookie涉及隱私和安全問(wèn)題且違反B站用戶協(xié)議。本練習(xí)項(xiàng)目強(qiáng)烈建議僅處理公開(kāi)、無(wú)限制的視頻。可以嘗試獲取低清晰度如360p的流這些通常無(wú)需鑒權(quán)。5.2 問(wèn)題下載下來(lái)的.m4s文件用ffmpeg合并失敗可能原因1視頻或音頻文件本身下載不完整或損壞。排查檢查下載的.m4s文件大小是否異常小比如只有幾KB。用文本編輯器打開(kāi)看看如果里面是JSON格式的錯(cuò)誤信息如{code:-404, message:Not Found}說(shuō)明下載鏈接本身就有問(wèn)題。解決回到上一步確保獲取到的video_url和audio_url是有效的??赡苁乔逦葏?shù)qn不支持嘗試換一個(gè)清晰度如64代表720p??赡茉?ffmpeg命令參數(shù)問(wèn)題或版本不兼容。排查手動(dòng)在命令行執(zhí)行合并命令看具體的錯(cuò)誤信息。有時(shí)-c:a copy音頻流復(fù)制會(huì)導(dǎo)致問(wèn)題因?yàn)樵匆纛l格式可能比較特殊。解決將合并命令中的-c:a copy改為-c:a aac強(qiáng)制轉(zhuǎn)碼為AAC格式。確保你安裝的ffmpeg版本不是太舊。5.3 問(wèn)題并發(fā)下載時(shí)部分任務(wù)失敗或程序卡死可能原因1并發(fā)數(shù)過(guò)高觸發(fā)服務(wù)器的頻率限制或連接被重置。解決降低max_workers的值比如從5降到2或3。在每個(gè)視頻任務(wù)之間以及每個(gè)下載請(qǐng)求之間增加隨機(jī)的、更長(zhǎng)的延時(shí)time.sleep??赡茉?網(wǎng)絡(luò)不穩(wěn)定或單個(gè)任務(wù)超時(shí)。解決在download_file函數(shù)中增加重試機(jī)制。例如用循環(huán)包裹下載邏輯失敗后重試2-3次。同時(shí)確保timeout參數(shù)設(shè)置合理如30-60秒。5.4 問(wèn)題如何爬取一個(gè)UP主的所有視頻或一個(gè)合集思路我們的核心函數(shù)process_single_video需要的是bvid。所以首先要解決的是如何從一個(gè)UP主空間或合集頁(yè)面提取出所有視頻的bvid列表。方法分析頁(yè)面結(jié)構(gòu)打開(kāi)一個(gè)UP主主頁(yè)如https://space.bilibili.com/123456/videoF12查看其加載視頻列表的API。通常是一個(gè)返回JSON的接口里面包含了視頻列表和對(duì)應(yīng)的bvid。編寫列表提取函數(shù)寫一個(gè)新的函數(shù)get_video_list_by_mid(mid)其中mid是UP主的ID。這個(gè)函數(shù)模仿瀏覽器去請(qǐng)求那個(gè)API解析JSON返回一個(gè)bvid的列表。集成到主流程先調(diào)用get_video_list_by_mid獲取列表再將這個(gè)列表傳遞給batch_download函數(shù)。注意合集和頻道的頁(yè)面邏輯類似都需要先找到其對(duì)應(yīng)的數(shù)據(jù)接口。這又是一個(gè)逆向分析的過(guò)程但原理和獲取單個(gè)視頻信息是相通的。5.5 性能與優(yōu)化建議會(huì)話保持在process_single_video函數(shù)中我為每個(gè)視頻創(chuàng)建了一個(gè)requests.Session()。Session可以復(fù)用TCP連接在下載同一個(gè)視頻的多P時(shí)能稍微提升效率。斷點(diǎn)續(xù)傳當(dāng)前的下載函數(shù)不支持?jǐn)帱c(diǎn)續(xù)傳。對(duì)于超大文件可以考慮實(shí)現(xiàn)它。思路是檢查本地已下載文件大小在請(qǐng)求頭中加入Range: bytesstart-end來(lái)請(qǐng)求剩余部分。但這需要服務(wù)器支持。更優(yōu)雅的進(jìn)度條可以使用第三方庫(kù)tqdm來(lái)替代自己打印的進(jìn)度信息它會(huì)顯示一個(gè)美觀的進(jìn)度條和預(yù)估剩余時(shí)間。配置化將清晰度、保存路徑、并發(fā)數(shù)、請(qǐng)求頭等參數(shù)提取到配置文件如config.ini或命令行參數(shù)中使腳本更靈活。最后我想說(shuō)的是爬蟲(chóng)技術(shù)是一把雙刃劍。這個(gè)“B站視頻批量爬取”項(xiàng)目作為一個(gè)Python練習(xí)極大地鍛煉了我的網(wǎng)絡(luò)編程、數(shù)據(jù)分析和問(wèn)題解決能力。但在實(shí)際使用中請(qǐng)務(wù)必牢記遵守robots.txt查看目標(biāo)網(wǎng)站的robots.txt文件尊重網(wǎng)站管理員的意愿??刂普?qǐng)求頻率這是最重要的道德和技術(shù)準(zhǔn)則。過(guò)快的請(qǐng)求等同于攻擊。尊重版權(quán)下載的內(nèi)容僅限個(gè)人學(xué)習(xí)、研究使用切勿用于商業(yè)傳播或任何侵犯創(chuàng)作者權(quán)益的行為。關(guān)注接口變更網(wǎng)站前端和后端隨時(shí)在變今天能用的代碼明天可能就失效了。保持學(xué)習(xí)理解原理HTTP請(qǐng)求、數(shù)據(jù)解析比記住某個(gè)具體的API地址更重要。這個(gè)項(xiàng)目的源碼雖然叫“練習(xí)源碼”但其中涉及的思路和技巧是通用的。希望這份超詳細(xì)的拆解能幫你不僅完成這個(gè)練習(xí)更能理解爬蟲(chóng)項(xiàng)目從設(shè)計(jì)到實(shí)現(xiàn)的完整脈絡(luò)。如果在復(fù)現(xiàn)過(guò)程中遇到新問(wèn)題多利用開(kāi)發(fā)者工具觀察、多思考、多搜索解決問(wèn)題的過(guò)程本身就是最好的學(xué)習(xí)。本文還有配套的精品資源點(diǎn)擊獲取