試:vLLM 吞吐量壓測(cè)腳本完整指南)
10分鐘跑通大模型推理性能測(cè)試vLLM 吞吐量壓測(cè)腳本完整指南【免費(fèi)下載鏈接】self-llm《開源大模型食用指南》針對(duì)中國(guó)寶寶量身打造的基于Linux環(huán)境快速微調(diào)全參數(shù)/Lora、部署國(guó)內(nèi)外開源大模型LLM/多模態(tài)大模型MLLM教程項(xiàng)目地址: https://gitcode.com/GitHub_Trending/se/self-llm部署開源大模型時(shí)你最先卡住的問(wèn)題往往是這臺(tái)機(jī)器到底跑這個(gè)模型有多快選 vLLM 還是原生 Transformers差距有多少本文帶你用vLLM 吞吐量壓測(cè)benchmark_throughput官方自帶基準(zhǔn)測(cè)試腳本十分鐘拿到 requests/s、tokens/s 指標(biāo)讓感覺挺快變成可對(duì)比的數(shù)字。關(guān)鍵指標(biāo)速覽 吞吐量Throughput單位時(shí)間內(nèi)模型處理的數(shù)據(jù)總量分請(qǐng)求數(shù)和 token 數(shù)兩種口徑requests/s每秒完成多少條提示詞請(qǐng)求衡量服務(wù)能扛多少并發(fā)tokens/s每秒處理多少 token含輸入輸出衡量計(jì)算總效率輸入/輸出長(zhǎng)度壓測(cè)時(shí)人為固定的 prompt 長(zhǎng)度和生成長(zhǎng)度決定單次請(qǐng)求的負(fù)載對(duì)比基線同一腳本支持vllm、hfHuggingFace Transformers兩個(gè)后端同一臺(tái)機(jī)器跑兩次即可量化加速比圖不同大模型在各類基準(zhǔn)測(cè)試上的表現(xiàn)對(duì)比吞吐測(cè)試解決的是跑得多快這類榜單解決答得多好從零跑通第一次測(cè)試環(huán)境準(zhǔn)備你只需要一臺(tái)有 NVIDIA GPU 的機(jī)器倉(cāng)庫(kù)示例中 7B 模型用 RTX 3090 即可裝好 vLLMpip install vllm git clone https://gitcode.com/GitHub_Trending/se/self-llm cd self-llm壓測(cè)腳本已放在倉(cāng)庫(kù)的 models/Qwen2/benchmark_throughput.py把它拷到你的模型目錄旁邊即可。執(zhí)行測(cè)試以 Qwen2-7B-Instruct 為例一條命令跑起 vLLM 后端壓測(cè)python benchmark_throughput.py \ --model /root/autodl-tmp/qwen/Qwen2-7B-Instruct \ --backend vllm \ --input-len 64 \ --output-len 128 \ --num-prompts 25 \ --max-model-len 512關(guān)鍵參數(shù)說(shuō)明--model模型本地路徑--input-len/--output-len固定每條請(qǐng)求的輸入和輸出長(zhǎng)度--num-prompts測(cè)試樣本數(shù)首次跑用 25 足夠圖壓測(cè)前先在鏡像/框架層面確認(rèn) PyTorch 與 CUDA 版本匹配想量化加速比把--backend vllm改成--backend hf并加上--hf-max-batch-size 25再跑一次即可。倉(cāng)庫(kù)里 Qwen2 的 vLLM 部署教程 有完整對(duì)照流程??炊敵鼋Y(jié)果腳本跑完會(huì)打印一行核心結(jié)果Throughput: 7.68 requests/s, 1474.75 tokens/s新版 vLLM 的腳本會(huì)輸出三個(gè)值各字段含義對(duì)照如下指標(biāo)含義健康參考值requests/s每秒完成的請(qǐng)求數(shù)7B 模型消費(fèi)級(jí)顯卡上5~30長(zhǎng)度越短越高total tokens/s輸入輸出 token 總吞吐同硬件 7B 模型約 1000~6000隨長(zhǎng)度翻倍變化output tokens/s模型凈生成速度通常約為 total 的 1/1.5~1/2 區(qū)間倉(cāng)庫(kù)實(shí)測(cè)數(shù)據(jù)同一塊卡上 Qwen2-7B 走 vLLM 是 7.68 requests/s走 hf 后端只有 5.73 requests/svLLM 快約 34%DeepSeek-R1-Distill-Qwen-7B 短文本場(chǎng)景甚至跑到 29.34 requests/s。判斷你的結(jié)果是否合理看同后端、同長(zhǎng)度下的量級(jí)即可。踩坑與排障 顯存不夠OOM應(yīng)對(duì)先降--num-prompts再調(diào)小--input-len/--output-lenvLLM 默認(rèn)占 90% 顯存可用--gpu-memory-utilization 0.8留出余量。兩次結(jié)果波動(dòng)很大應(yīng)對(duì)固定--seed把--num-prompts加到 50 以上跑之前nvidia-smi確認(rèn)沒(méi)有別的進(jìn)程占著 GPU。hf 后端直接報(bào)錯(cuò)應(yīng)對(duì)--hf-max-batch-size只對(duì) hf 后端生效但必填漏了腳本會(huì)直接拋錯(cuò)反之 vllm 后端傳了它也會(huì)報(bào)錯(cuò)別混著抄命令。圖顯存緊張時(shí)換一張大顯存的卡是比降并發(fā)更直接的解法收個(gè)尾一條benchmark_throughput.py命令就能拿到 requests/s 與 tokens/s無(wú)需自己寫壓測(cè)代碼同機(jī)器、同長(zhǎng)度下對(duì)比vllm和hf兩個(gè)后端加速比一目了然指標(biāo)要固定長(zhǎng)度、固定 seed、固定樣本數(shù)才可比別拿不同配置的數(shù)硬比7B 模型單卡即可壓測(cè)先跑短文本64/128定位瓶頸再測(cè)長(zhǎng)文本現(xiàn)在就選一個(gè)你部署過(guò)的模型把上面的命令填上路徑跑一遍明天對(duì)比推理引擎時(shí)你就有數(shù)據(jù)說(shuō)話了?!久赓M(fèi)下載鏈接】self-llm《開源大模型食用指南》針對(duì)中國(guó)寶寶量身打造的基于Linux環(huán)境快速微調(diào)全參數(shù)/Lora、部署國(guó)內(nèi)外開源大模型LLM/多模態(tài)大模型MLLM教程項(xiàng)目地址: https://gitcode.com/GitHub_Trending/se/self-llm創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考