始大模型開(kāi)發(fā)與微調(diào):基于PyTorch與ChatGLM的實(shí)戰(zhàn)指南)
聊點(diǎn)實(shí)在的。這兩年“大模型開(kāi)發(fā)與微調(diào)”幾乎成了算法崗簡(jiǎn)歷上的標(biāo)配關(guān)鍵詞但真正從零開(kāi)始上手的人里十個(gè)有八個(gè)都卡在第一步環(huán)境裝不起來(lái)模型加載報(bào)錯(cuò)更別提拿自己的業(yè)務(wù)數(shù)據(jù)去微調(diào)了。這篇內(nèi)容就圍繞《從零開(kāi)始大模型開(kāi)發(fā)與微調(diào)基于PyTorch與ChatGLM》這條完整路線把我自己踩過(guò)坑之后整理出來(lái)的流程寫(xiě)一遍——從 PyTorch 環(huán)境搭建、CUDA 適配到 ChatGLM 模型加載、數(shù)據(jù)處理再到用 LoRA 跑通一次真正的微調(diào)訓(xùn)練最后配上模型合并和推理驗(yàn)證。適合剛?cè)腴T(mén)算法的同學(xué)也適合有 PyTorch 基礎(chǔ)、但還沒(méi)碰過(guò)開(kāi)源大模型微調(diào)的工程師。1. 先從整體思路說(shuō)起你真正要做的“大模型開(kāi)發(fā)”是什么1.1 預(yù)訓(xùn)練和你關(guān)系不大微調(diào)才是主線很多人聽(tīng)到“從零開(kāi)始大模型開(kāi)發(fā)”第一反應(yīng)是“我要重寫(xiě)一遍 Transformer從頭訓(xùn)練一個(gè) GPT”。真沒(méi)必要。以 ChatGLM 為例ChatGLM-6B 這種量級(jí)的模型一次預(yù)訓(xùn)練的成本是百萬(wàn)級(jí)算力小時(shí)起步個(gè)人或者小團(tuán)隊(duì)根本扛不住。實(shí)際工程里說(shuō)的“從零開(kāi)始”指的是從零開(kāi)始掌握這套工具鏈拿一個(gè)成熟的開(kāi)源基座模型加載起來(lái)用自有數(shù)據(jù)做微調(diào)最后部署成能回答業(yè)務(wù)問(wèn)題的服務(wù)。這里要先把“預(yù)訓(xùn)練”和“微調(diào)”這兩個(gè)詞掰開(kāi)。預(yù)訓(xùn)練是拿海量通用文本讓模型學(xué)會(huì)語(yǔ)言本身的規(guī)律相當(dāng)于把一個(gè)人培養(yǎng)成受過(guò)通識(shí)教育的普通人微調(diào)是用領(lǐng)域里的高質(zhì)量數(shù)據(jù)讓模型學(xué)會(huì)你期望它掌握的技能和表達(dá)方式相當(dāng)于給這個(gè)人做崗位培訓(xùn)。大模型在預(yù)訓(xùn)練階段已經(jīng)會(huì)說(shuō)話、會(huì)推理但沒(méi)接觸過(guò)你的私有數(shù)據(jù)和業(yè)務(wù)場(chǎng)景所以直接問(wèn)它“請(qǐng)按我們公司的格式寫(xiě)周報(bào)”它即使能答也答不到點(diǎn)子上。微調(diào)的目的就是讓它從“通用”走向“特定”。這里還有一個(gè)常見(jiàn)誤解微調(diào)不是“給模型灌知識(shí)”。模型記不住太多新事實(shí)它真正學(xué)的是“對(duì)話的格式、任務(wù)的模式、輸出的風(fēng)格”。想讓它記住大量知識(shí)優(yōu)先考慮檢索增強(qiáng)而不是硬灌這一點(diǎn)在后面的數(shù)據(jù)準(zhǔn)備部分還會(huì)展開(kāi)。1.2 為什么偏偏是 PyTorch 加 ChatGLM先說(shuō)框架。PyTorch 在今天的大模型圈子里基本是事實(shí)標(biāo)準(zhǔn)HuggingFace Transformers、PEFT參數(shù)高效微調(diào)、bitsandbytes、accelerate 這些工具鏈都是優(yōu)先支持 PyTorch 的。TensorFlow 也能做大模型但你搜資料時(shí)會(huì)發(fā)現(xiàn)凡是涉及 LoRA、QLoRA、DeepSpeed 的教程十篇里有九篇是 PyTorch 代碼。選 PyTorch本質(zhì)上是選生態(tài)不讓自己在起跑線上就陷入“找半天沒(méi)有一個(gè)能直接跑的 demo”的窘境。再說(shuō)模型。ChatGLM 是智譜AI開(kāi)源的中文對(duì)話大模型系列ChatGLM-6B、ChatGLM2-6B、ChatGLM3-6B 都是公開(kāi)權(quán)重可以本地跑的。為什么拿它當(dāng)教學(xué)載體三個(gè)理由第一中文效果好中文踩坑案例也多第二6B 參數(shù)量在消費(fèi)級(jí)顯卡上有機(jī)會(huì)跑微調(diào)換成 65B 的模型個(gè)人電腦基本沒(méi)戲第三它原生接近對(duì)話場(chǎng)景做完微調(diào)能直接做智能客服、文檔問(wèn)答這類(lèi)演示正反饋來(lái)得快。對(duì)于從零開(kāi)始的開(kāi)發(fā)者這個(gè)組合試錯(cuò)成本最低。1.3 零基礎(chǔ)怎么規(guī)劃學(xué)習(xí)路徑如果連 PyTorch 都還沒(méi)入門(mén)直接沖 ChatGLM 微調(diào)會(huì)很難受。我給你一個(gè)按比例分配時(shí)間的路徑先用一到兩周過(guò) PyTorch 基礎(chǔ)重點(diǎn)看張量操作、自動(dòng)求導(dǎo)、nn.Module、DataLoader 和訓(xùn)練循環(huán)這五件事不用摳得太深能跟著教程跑通一個(gè)圖像分類(lèi)或文本分類(lèi)就夠了。很多人說(shuō)自己是看入門(mén)視頻起步的這個(gè)路線沒(méi)問(wèn)題關(guān)鍵是要親手敲代碼不能只看然后花三到五天熟悉 HuggingFace 的加載與推理流程把模型加載、tokenizer 那套邏輯跑通最后再進(jìn)入微調(diào)階段。這個(gè)順序看起來(lái)慢實(shí)際上最快。我見(jiàn)過(guò)太多一上來(lái)就找“ChatGLM 微調(diào)代碼”的人結(jié)果模型加載完連 loss 是怎么算出來(lái)的都不知道訓(xùn)練崩了也不知道從哪查起。PyTorch 基礎(chǔ)不是可選項(xiàng)是排查問(wèn)題的底氣。2. 環(huán)境準(zhǔn)備PyTorch 安裝與 CUDA 適配最容易翻車(chē)的一步2.1 硬件要求先對(duì)齊別拿集顯硬扛跑 ChatGLM-6B 的推理至少要 12GB 顯存fp16 精度下做 LoRA 微調(diào)建議 16GB 以上24GB 的顯卡RTX 3090、4090 或 A5000 之類(lèi)體驗(yàn)比較舒服。全參微調(diào) 6B 模型對(duì)個(gè)人玩家就不太現(xiàn)實(shí)了動(dòng)輒 40GB 以上顯存所以后面我會(huì)把重點(diǎn)放在 LoRA 上。沒(méi)有 N 卡怎么辦兩個(gè)選擇一是用 CPU 推理跑通流程能跑但很慢而且微調(diào)基本不用想二是租云 GPU 實(shí)例按小時(shí)付費(fèi)很多平臺(tái)有 24GB 顯存的卡可選新手練習(xí)反而比買(mǎi)卡劃算。另外像 MX150 這種入門(mén)級(jí)獨(dú)顯跑點(diǎn)小規(guī)模 PyTorch 練習(xí)沒(méi)問(wèn)題大模型就別指望了該上云上云。2.2 Anaconda 創(chuàng)建隔離環(huán)境別碰系統(tǒng) Python環(huán)境管理這一步強(qiáng)烈建議用 Anaconda 建虛擬環(huán)境。原因很樸素深度學(xué)習(xí)項(xiàng)目依賴(lài)版本沖突太常見(jiàn)了今天裝的 torch 版本很可能跟下個(gè)項(xiàng)目的 torchvision 打架。用 conda 把每個(gè)項(xiàng)目隔開(kāi)出了問(wèn)題直接刪環(huán)境重建五分鐘就能恢復(fù)。conda create -n llm python3.10 conda activate llm為什么要 3.10這是個(gè)兼容性經(jīng)驗(yàn)值。ChatGLM 相關(guān)依賴(lài)鏈transformers、peft、datasets、accelerate 等在 Python 3.8 到 3.11 之間都能工作但 3.10 是這幾個(gè)庫(kù)支持最均衡的版本太低的 Python 對(duì)一些新庫(kù)支持不好太新的可能遇到個(gè)別依賴(lài)沒(méi)跟上。后續(xù)所有操作都在這個(gè) llm 環(huán)境里進(jìn)行。2.3 PyTorch 與 CUDA 版本匹配三個(gè)概念先分清這一步是新手最常翻車(chē)的地方。先記住三件事顯卡驅(qū)動(dòng)driver、CUDA Toolkit、PyTorch 編譯時(shí)用的 CUDA 版本是三樣?xùn)|西不是一回事。顯卡驅(qū)動(dòng)是底層的它決定了系統(tǒng)能不能讓程序調(diào)用 GPU。驅(qū)動(dòng)版本太老上面跑什么都會(huì)報(bào)錯(cuò)。CUDA Toolkit 是開(kāi)發(fā)庫(kù)里面是編譯器和運(yùn)行時(shí)庫(kù)。很多博客會(huì)讓你去官網(wǎng)單獨(dú)裝 Toolkit但在 PyTorch 場(chǎng)景下通常不強(qiáng)制手動(dòng)裝PyTorch 的安裝包里自帶一部分運(yùn)行時(shí)依賴(lài)。PyTorch 的 whl 包名里的 cu 后綴代表它鏈接的 CUDA 版本。比如 torch-2.1.2cu118 表示這個(gè)包匹配 CUDA 11.8torch-2.3.1cu121 匹配 CUDA 12.1。理解了這三者的關(guān)系判斷兼容性就一句話顯卡驅(qū)動(dòng)版本不能低于 PyTorch 所對(duì)應(yīng) CUDA 版本的最低驅(qū)動(dòng)要求否則程序就跑不起來(lái)。怎么知道自己該裝哪個(gè)先用一條命令看驅(qū)動(dòng)支持到什么級(jí)別nvidia-smi右上角會(huì)顯示 CUDA Version這個(gè)值代表當(dāng)前驅(qū)動(dòng)最高支持的 CUDA 版本。比如它顯示 12.1那你可以放心選擇 cu121 甚至更低的 cu118 版本安裝都不會(huì)超出驅(qū)動(dòng)能力。如果驅(qū)動(dòng)只支持到 11.8那就老老實(shí)實(shí)裝 cu118 的版本。推薦一套組合PyTorch 2.1.2 CUDA 11.8或者 PyTorch 2.3.1 CUDA 12.1。前者兼容性強(qiáng)后者更接近新版。安裝命令統(tǒng)一用 pip 就行pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118裝完先驗(yàn)證這一步別跳過(guò)import torch print(torch.__version__) print(torch.cuda.is_available()) print(torch.cuda.get_device_name(0))如果輸出的 torch.version末尾帶 cpu說(shuō)明下載成了 CPU 版本趕緊重裝如果 is_available() 是 False優(yōu)先懷疑驅(qū)動(dòng)太舊。2.4 Ubuntu 和 CentOS 下的環(huán)境坑Ubuntu 相對(duì)省心CentOS 用戶在裝依賴(lài)時(shí)容易遇到缺底層庫(kù)的問(wèn)題這里給一段通用排查思路。如果是服務(wù)器內(nèi)網(wǎng)環(huán)境不能直接在線裝就用離線方案在一臺(tái)有網(wǎng)且系統(tǒng)架構(gòu)一致的機(jī)器上執(zhí)行 pip download把所有 wheel 包拉下來(lái)打包拷貝到目標(biāo)機(jī)器再 pip install --no-index --find-links./wheelhouse 安裝。注意 PyTorch 的 wheel 包很大下載時(shí)要確認(rèn)磁盤(pán)空間充足。還有一個(gè)容易被忽略的點(diǎn)別把 pip 和 conda 混著隨便裝。我建議虛擬環(huán)境里優(yōu)先用 pip 裝 Python 包c(diǎn)onda 主要管 Python 版本和環(huán)境的創(chuàng)建銷(xiāo)毀?;煊萌菀装寻囊蕾?lài)解析搞亂后期一升級(jí)就出幺蛾子。很多人報(bào)環(huán)境問(wèn)題最后追查下來(lái)都是因?yàn)樵?jīng)在同一個(gè)環(huán)境里用 conda 裝了一個(gè)包、用 pip 裝了另一個(gè)兩個(gè)依賴(lài)圖互相覆蓋一升級(jí)就崩。2.5 低端卡也能學(xué) PyTorch但別做大模型如果你的顯卡是 MX150 這類(lèi)入門(mén)卡甚至核顯不是說(shuō)不能學(xué)。學(xué) PyTorch 基礎(chǔ)、跑小網(wǎng)絡(luò)、處理自己的小數(shù)據(jù)集完全沒(méi)問(wèn)題很多熱詞里提到的“PyTorch 處理高光譜 hdr 文件”“UCF101 視頻分類(lèi)”“TD3 強(qiáng)化學(xué)習(xí)”這類(lèi)項(xiàng)目在低配機(jī)器上都能跑。但這些項(xiàng)目練完之后要意識(shí)到大模型是另一個(gè)量級(jí)硬件不夠就上云別在本地硬耗時(shí)間。3. 加載 ChatGLM理解模型結(jié)構(gòu)再動(dòng)手寫(xiě)代碼3.1 ChatGLM 背后的 GLM 架構(gòu)是怎么回事先別急著復(fù)制粘貼代碼花五分鐘了解下它是什么。ChatGLM 系列用的是 GLMGeneral Language Model架構(gòu)和 GPT 那種標(biāo)準(zhǔn)自回歸模型有一個(gè)關(guān)鍵區(qū)別GPT 是從左往右一個(gè)字一個(gè)字預(yù)測(cè)GLM 是“自回歸空白填充”可以理解成一個(gè)高級(jí)版完形填空——給定一部分文本讓它預(yù)測(cè)被摳掉的片段預(yù)測(cè)時(shí)按自回歸方式一個(gè) token 一個(gè) token 生成。這個(gè)設(shè)計(jì)帶來(lái)的好處是GLM 既能做生成任務(wù)也能做理解任務(wù)所以中文能力表現(xiàn)不錯(cuò)。對(duì)于你來(lái)說(shuō)這些細(xì)節(jié)暫時(shí)不需要完全吃透但至少要記住它是個(gè) Transformer 家族模型所以用 transformers 庫(kù)就能加載它的代碼里帶有 chat 方法所以可以很方便地做多輪對(duì)話。這些認(rèn)知會(huì)在排查問(wèn)題時(shí)派上用場(chǎng)比如看到報(bào)錯(cuò)里出現(xiàn) Transformer 層的名字你能大概定位到是哪一部分出了問(wèn)題。3.2 用 HuggingFace Transformers 加載模型加載 ChatGLM 權(quán)重非常標(biāo)準(zhǔn)幾行代碼import torch from transformers import AutoModel, AutoTokenizer model_name THUDM/chatglm3-6b tokenizer AutoTokenizer.from_pretrained(model_name, trust_remote_codeTrue) model AutoModel.from_pretrained( model_name, trust_remote_codeTrue, torch_dtypetorch.float16, device_mapauto ).eval()這里有幾個(gè)點(diǎn)值得展開(kāi)說(shuō)說(shuō)。trust_remote_codeTrue 是因?yàn)?ChatGLM 的模型定義需要執(zhí)行官方倉(cāng)庫(kù)里附帶的自定義代碼不加這個(gè)參數(shù)會(huì)直接報(bào)錯(cuò)torch_dtypetorch.float16 是把模型權(quán)重加載成半精度顯存占用幾乎減半在消費(fèi)級(jí)顯卡上這是標(biāo)配操作device_mapauto 讓框架自動(dòng)把模型分配到可用設(shè)備上。第一次執(zhí)行會(huì)從 HuggingFace 下載權(quán)重6B 模型的 fp16 權(quán)重有 12GB 左右網(wǎng)速不理想時(shí)會(huì)很煎熬。我的經(jīng)驗(yàn)是先把權(quán)重手動(dòng)下載到本地目錄然后用本地路徑加載。下載下來(lái)后檢查目錄里要有 pytorch_model.bin 或多個(gè) .safetensors 分片文件、config.json、tokenization 相關(guān)文件缺一不可。批量下載一堆二進(jìn)制大文件時(shí)文件名要對(duì)上錯(cuò)一個(gè)文件名加載時(shí)就各種詭異報(bào)錯(cuò)。3.3 指令微調(diào)數(shù)據(jù)長(zhǎng)什么樣微調(diào) ChatGLM 這種對(duì)話模型數(shù)據(jù)格式遵循“指令-輸出”的結(jié)構(gòu)。我常用的是一份 JSONL 文件每一行是一條訓(xùn)練樣本{instruction: 請(qǐng)用一句話解釋什么是反向傳播, input: , output: 反向傳播是從損失函數(shù)出發(fā)沿網(wǎng)絡(luò)結(jié)構(gòu)反向逐層計(jì)算每個(gè)參數(shù)梯度的算法。} {instruction: 根據(jù)給定的需求寫(xiě)一段商品文案, input: 商品無(wú)線藍(lán)牙耳機(jī)賣(mài)點(diǎn)降噪、續(xù)航24小時(shí), output: 這款無(wú)線藍(lán)牙耳機(jī)主打深度降噪單次充電續(xù)航長(zhǎng)達(dá)24小時(shí)讓通勤路上徹底告別外界喧囂。}注意 input 字段是可選的沒(méi)有額外輸入就留空。數(shù)據(jù)數(shù)量上新手階段準(zhǔn)備幾百條高質(zhì)量樣本就能看到明顯效果比一次性塞幾萬(wàn)條噪聲數(shù)據(jù)強(qiáng)得多。數(shù)據(jù)質(zhì)量永遠(yuǎn)排第一格式不統(tǒng)一、答案錯(cuò)漏、指令和輸出不對(duì)齊模型都會(huì)學(xué)壞。而且微調(diào)數(shù)據(jù)要盡量貼近你真實(shí)使用場(chǎng)景否則訓(xùn)完還是“答非所問(wèn)”。3.4 關(guān)于 transformers 版本和模型兼容性這里必須專(zhuān)門(mén)說(shuō)一個(gè)常見(jiàn)誤區(qū)。很多人搜“哪個(gè)版本的 PyTorch 和 CUDA 能支持 transformers3.4.0”其實(shí)問(wèn)錯(cuò)了方向。transformers 是 Python 包它的版本約束主要來(lái)自 Python 版本和 torch 的接口跟 CUDA 版本沒(méi)有直接綁定關(guān)系。CUDA 影響的是底層能不能調(diào)用 GPUtransformers 管的是上層模型邏輯兩者不是一回事。真正要注意的是模型權(quán)重與 transformers 版本的兼容性。比如 ChatGLM2 發(fā)布時(shí)配套的 transformers 版本較老如果你裝了一個(gè)很新的 transformers可能會(huì)碰到 tokenizer 類(lèi)型找不到、模型類(lèi)不注冊(cè)之類(lèi)的報(bào)錯(cuò)。解決辦法是安裝官方 README 里 requirements.txt 指定的依賴(lài)版本別輕易追求最新版。實(shí)操中遇到這類(lèi)問(wèn)題優(yōu)先看官方倉(cāng)庫(kù)的說(shuō)明文件這是最靠譜的方案。4. 微調(diào)實(shí)操用 LoRA 跑通 ChatGLM4.1 為什么選 LoRA 而不是全參微調(diào)ChatGLM-6B 有 60 億參數(shù)全參微調(diào)時(shí)優(yōu)化器狀態(tài)和梯度都要占顯存算下來(lái) 24GB 的卡根本不夠用個(gè)人玩家基本可以放棄這個(gè)路線。LoRALow-Rank Adaptation的思路是凍結(jié)原模型全部參數(shù)只在每層注意力模塊旁邊注入兩個(gè)小矩陣訓(xùn)練時(shí)只更新這些小矩陣。用一個(gè)小類(lèi)比原模型是一本已經(jīng)印刷好的教科書(shū)LoRA 是課堂上補(bǔ)充的幾頁(yè)講義不動(dòng)原書(shū)只改講義卻能顯著改變模型的輸出風(fēng)格。LoRA 訓(xùn)練時(shí)顯存需求大幅下降實(shí)測(cè)在單張 24GB 顯卡上配合 fp16、batch_size 設(shè) 4、最大序列長(zhǎng)度 512能比較從容地訓(xùn)練。顯存再緊張就上 QLoRA它先把模型量化成 4bit 再套 LoRA甚至能在 8GB 到 12GB 顯存上跑微調(diào)但訓(xùn)練速度會(huì)慢一些。三者的對(duì)比可以看下面這張表方案訓(xùn)練參數(shù)量顯存需求6B量級(jí)效果保留度適合場(chǎng)景全參微調(diào)60億40GB以上最高有A100/H100等專(zhuān)業(yè)卡追求極限效果LoRA數(shù)百萬(wàn)到千萬(wàn)級(jí)16GB~24GB高消費(fèi)級(jí)顯卡大多數(shù)業(yè)務(wù)微調(diào)場(chǎng)景QLoRA數(shù)百萬(wàn)到千萬(wàn)級(jí)8GB~12GB較高顯存緊張優(yōu)先跑通流程只要顯存夠用優(yōu)先 LoRA顯存不夠再降級(jí)到 QLoRA。效果差距在大多數(shù)任務(wù)上肉眼分辨不出來(lái)LoRA 是性?xún)r(jià)比比較高的起點(diǎn)。4.2 安裝微調(diào)所需依賴(lài)在 llm 環(huán)境里執(zhí)行pip install peft transformers datasets accelerate bitsandbytes這幾個(gè)庫(kù)的分工peft 提供 LoRA 等參數(shù)高效微調(diào)方法transformers 負(fù)責(zé)模型和訓(xùn)練器的上層封裝datasets 用來(lái)加載和處理數(shù)據(jù)accelerate 是訓(xùn)練加速框架Trainer 底層會(huì)用到bitsandbytes 是 QLoRA 的量化后端。哪怕你暫時(shí)不用 QLoRA也建議一起裝上后面顯存不夠想切過(guò)去能省一步安裝。裝了這么多庫(kù)之后環(huán)境開(kāi)始變得脆弱。我的習(xí)慣是把當(dāng)前環(huán)境所有包版本導(dǎo)出一份pip freeze requirements.txt這樣環(huán)境一旦崩了重建之后一條命令就能復(fù)原省得二次踩坑。4.3 構(gòu)造數(shù)據(jù)集類(lèi)微調(diào)前先把數(shù)據(jù)集做成 PyTorch 的 Dataset。ChatGLM 系列的多輪格式一般是 [Round 1] 加一問(wèn)一答我們做演示時(shí)可以先用簡(jiǎn)化拼接重點(diǎn)是把流程跑通。import json import torch from torch.utils.data import Dataset class SFTDataset(Dataset): def __init__(self, data_path, tokenizer, max_len512): self.samples [] with open(data_path, r, encodingutf-8) as f: for line in f: line line.strip() if not line: continue item json.loads(line) prompt item[instruction] inp item.get(input, ) output item[output] text f問(wèn){prompt}\n{inp}\n答{output} self.samples.append(text) self.tokenizer tokenizer self.max_len max_len def __len__(self): return len(self.samples) def __getitem__(self, idx): text self.samples[idx] enc self.tokenizer( text, max_lengthself.max_len, truncationTrue, paddingmax_length, return_tensorspt, ) input_ids enc[input_ids].squeeze(0) attention_mask enc[attention_mask].squeeze(0) # 標(biāo)簽用 input_ids 本身訓(xùn)練時(shí)模型會(huì)自己 shift 一個(gè)位置 labels input_ids.clone() return {input_ids: input_ids, attention_mask: attention_mask, labels: labels}兩個(gè)重點(diǎn)解釋一下。paddingmax_length 會(huì)把所有樣本補(bǔ)到同樣長(zhǎng)度batch 訓(xùn)練時(shí)不會(huì)因長(zhǎng)度不一致報(bào)錯(cuò)代價(jià)是短樣本浪費(fèi)一點(diǎn)顯存labels 直接復(fù)制 input_ids因?yàn)樽曰貧w模型在計(jì)算 loss 時(shí)會(huì)自動(dòng)在序列維度上做 shift也就是用一個(gè) token 預(yù)測(cè)下一個(gè) token不需要手動(dòng)制造錯(cuò)位。4.4 配置 LoRA 并啟動(dòng)訓(xùn)練加載模型后用 peft 包套一層 LoRAfrom peft import LoraConfig, get_peft_model lora_config LoraConfig( task_typeCAUSAL_LM, r8, lora_alpha32, target_modules[query_key_value], lora_dropout0.1, ) model get_peft_model(model, lora_config) model.print_trainable_parameters()幾個(gè)參數(shù)說(shuō)一下。r 是低秩矩陣的秩r 越大可訓(xùn)練參數(shù)量越多、模型表達(dá)能力越強(qiáng)但也更容易過(guò)擬合8 或者 16 是常見(jiàn)起點(diǎn)lora_alpha 是放縮系數(shù)最終的實(shí)際縮放是 lora_alpha / r32 / 8 4這個(gè)值調(diào)節(jié) LoRA 更新對(duì)原模型的“音量”調(diào)太大訓(xùn)練會(huì)不穩(wěn)定調(diào)太小容易訓(xùn)不動(dòng)target_modules 要指向模型中真正做注意力投影的層對(duì) ChatGLM 來(lái)說(shuō)就是名為 query_key_value 的線性層不同模型這個(gè)字段不一樣換模型時(shí)得去模型代碼里確認(rèn)。訓(xùn)練直接用 Trainerfrom transformers import Trainer, TrainingArguments training_args TrainingArguments( output_dir./chatglm-lora, per_device_train_batch_size4, gradient_accumulation_steps8, learning_rate1e-4, num_train_epochs3, logging_steps10, save_steps500, fp16True, remove_unused_columnsFalse, ) trainer Trainer( modelmodel, argstraining_args, train_datasettrain_dataset, tokenizertokenizer, ) trainer.train()訓(xùn)練參數(shù)的設(shè)定邏輯在這里。batch_size 為 4 是顯存和速度的折中如果報(bào)顯存不足先把它降到 2 或 1gradient_accumulation_steps8 表示每 8 個(gè)小 batch 累計(jì)一次梯度等效于一次更新用了 4*832 個(gè)樣本能模擬大 batch 的穩(wěn)定性又不占顯存learning_rate 用 1e-4因?yàn)?LoRA 只訓(xùn)練少量參數(shù)學(xué)習(xí)率可以比全參微調(diào)的 2e-5 高一截fp16True 開(kāi)啟混合精度顯存減半速度還會(huì)提升是消費(fèi)級(jí)顯卡必備選項(xiàng)。自定義數(shù)據(jù)集放到 Trainer 時(shí)remove_unused_columnsFalse 必須設(shè)否則 Trainer 會(huì)自動(dòng)丟棄 data collator 用不到的列而我們的數(shù)據(jù)集返回的是字典某些字段會(huì)被誤刪導(dǎo)致報(bào)錯(cuò)。訓(xùn)練完保存兩種東西model.save_pretrained(./chatglm-lora-checkpoint) tokenizer.save_pretrained(./chatglm-lora-checkpoint)注意這里保存的是 LoRA 適配器不是整套權(quán)重文件大小只有幾十到一百多 MB。想合并回原始模型用 merge_and_unloadmerged_model model.merge_and_unload() merged_model.save_pretrained(./chatglm-lora-merged)合并產(chǎn)出一個(gè)完整的 fp16 權(quán)重可用于部署或繼續(xù)微調(diào)。兩條保存路徑用途不同適配器格式利于快速切換多個(gè)微調(diào)任務(wù)合并格式適合上線推理。4.5 推理驗(yàn)證微調(diào)前后對(duì)比訓(xùn)練完加載用的方式也要調(diào)整from peft import PeftModel base_model AutoModel.from_pretrained( THUDM/chatglm3-6b, trust_remote_codeTrue, torch_dtypetorch.float16, device_mapauto ).eval() model PeftModel.from_pretrained(base_model, ./chatglm-lora-checkpoint) model model.eval() response, history model.chat(tokenizer, 請(qǐng)解釋什么是反向傳播, history[]) print(response)推理時(shí)一定要先加載基座模型再把 LoRA 適配器掛上去順序反了會(huì)報(bào)一堆 shape 不匹配的錯(cuò)。建議你保留微調(diào)前的模型做對(duì)比同樣一個(gè)問(wèn)題微調(diào)前和微調(diào)后各問(wèn)一遍看輸出風(fēng)格、知識(shí)范圍、格式是否按預(yù)期改變。如果差異為零大概率是數(shù)據(jù)量太少或?qū)W習(xí)率太低如果訓(xùn)練集上能完美復(fù)述、測(cè)試問(wèn)法上卻答非所問(wèn)大概率是過(guò)擬合了要降 rank、加數(shù)據(jù)或加 dropout。5. 常見(jiàn)問(wèn)題與排查技巧實(shí)錄5.1 CUDA 相關(guān)報(bào)錯(cuò)怎么定位把最常見(jiàn)的情況列成速查表現(xiàn)象可能原因解決方向torch.cuda.is_available() 返回 False裝成了 CPU 版或驅(qū)動(dòng)未生效檢查 torch.version是否帶 cpu 后綴重裝對(duì)應(yīng) cu 版本再查 nvidia-smi 是否正常報(bào)錯(cuò) no kernel image is available for execution on the device顯卡太老或驅(qū)動(dòng)不支持當(dāng)前 CUDA 版本升級(jí)驅(qū)動(dòng)或換用更低版本的 cu 后綴 PyTorch訓(xùn)練時(shí)報(bào) CUDA out of memory顯存不夠先降 batch_size再考慮開(kāi) gradient_accumulation、開(kāi) fp16、縮短 max_len最后才是換 QLoRA出現(xiàn) warning: you need pytorch with cu130 or higher to use optimized cuda operati編譯時(shí)使用的 cu 版本與你當(dāng)前資源不匹配檢查顯卡驅(qū)動(dòng)版本換一個(gè)與驅(qū)動(dòng)對(duì)應(yīng)的 PyTorch 版本或升級(jí)驅(qū)動(dòng)定位 CUDA 問(wèn)題有個(gè)通用順序先 nvidia-smi 看驅(qū)動(dòng)再 python 看 torch 版本和 is_available()再跑一個(gè)最小樣例。別一上來(lái)就換環(huán)境先把三層信息收集齊大多數(shù)問(wèn)題十分鐘內(nèi)能定位。5.2 顯存不夠的最后一搏QLoRA如果降 batch_size、降序列長(zhǎng)度、開(kāi) fp16 還是 OOM終極方案是 QLoRA。做法是把基座模型加載成 4bit 量化from transformers import BitsAndBytesConfig bnb_config BitsAndBytesConfig( load_in_4bitTrue, bnb_4bit_quant_typenf4, bnb_4bit_compute_dtypetorch.float16, ) model AutoModel.from_pretrained( THUDM/chatglm3-6b, trust_remote_codeTrue, quantization_configbnb_config, device_mapauto )注意 QLoRA 的模型因?yàn)橐呀?jīng)量化訓(xùn)練完通常不推薦直接 merge 回 fp32導(dǎo)出部署時(shí)要用原模型加載再掛載適配器。另外量化加載時(shí)對(duì) transformers 和 bitsandbytes 的版本敏感如果報(bào) QuantizationSetupError先檢查 bitsandbytes 是否與當(dāng)前 torch 和 CUDA 匹配再檢查 Python 版本。5.3 模型加載時(shí)的 tokenizer 兼容性問(wèn)題“A tokenizer class must be passed”或“xxx is not a valid tokenizer class”這類(lèi)報(bào)錯(cuò)多數(shù)出現(xiàn)在新版本 transformers 加載老模型時(shí)。ChatGLM 的自定義 tokenizer 依賴(lài)倉(cāng)庫(kù)里的代碼加載時(shí) trust_remote_codeTrue 沒(méi)加是常見(jiàn)原因加了還報(bào)錯(cuò)就查 transformers 版本是不是太新。我的處理方式是看官方倉(cāng)庫(kù)的 requirements.txt把關(guān)鍵包版本對(duì)齊不要盲目追新。5.4 訓(xùn)練 loss 不降或過(guò)擬合的排查方向loss 始終不降先加一條“打印模型參數(shù)是否更新”的調(diào)試代碼確認(rèn) LoRA 適配器確實(shí)插進(jìn)去了print_trainable_parameters 有沒(méi)有輸出可訓(xùn)練參數(shù)其次看學(xué)習(xí)率是否過(guò)小1e-4 訓(xùn)不動(dòng)就試 2e-4 或 5e-4再檢查數(shù)據(jù)格式如果標(biāo)簽和輸入混在一起模型可能在學(xué)“背答案”而不是學(xué)“根據(jù)指令回答”。過(guò)擬合的判斷標(biāo)準(zhǔn)則是訓(xùn)練 loss 下降、驗(yàn)證集回答質(zhì)量反而變差這時(shí)應(yīng)該減少 epoch、增大數(shù)據(jù)量、加大 dropout而不是盲目繼續(xù)訓(xùn)。5.5 離線環(huán)境安裝的經(jīng)驗(yàn)內(nèi)網(wǎng)機(jī)器裝 PyTorch我的做法是在一臺(tái)聯(lián)網(wǎng)機(jī)器上先創(chuàng)建相同 Python 版本的虛擬環(huán)境然后執(zhí)行pip download torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 -d ./wheelhouse再把 wheelhouse 整個(gè)目錄拷貝到內(nèi)網(wǎng)機(jī)器執(zhí)行pip install --no-index --find-links./wheelhouse torch torchvision torchaudio這里有個(gè)細(xì)節(jié)torch 的 wheel 依賴(lài) nvidia 開(kāi)頭的多個(gè) CUDA 運(yùn)行庫(kù)包pip download 時(shí)要把依賴(lài)也一起下下來(lái)建議在聯(lián)網(wǎng)機(jī)器上用 pip download 命令把這些依賴(lài)一并拉取否則內(nèi)網(wǎng)裝時(shí)還是會(huì)提示找不到依賴(lài)。離線環(huán)境最容易栽的坑就是“包下全了但缺間接依賴(lài)”備一份 requirements.txt讓 pip 正常解析依賴(lài)后再下載比手動(dòng)一個(gè)個(gè)找要穩(wěn)得多。5.6 訓(xùn)練時(shí)間長(zhǎng)怎么辦LoRA 在 24GB 單卡上訓(xùn)練幾百條數(shù)據(jù)每個(gè) epoch 大概幾分鐘到幾十分鐘還算可以接受。如果數(shù)據(jù)集上萬(wàn)條單卡就有點(diǎn)吃力了。這時(shí)候優(yōu)先優(yōu)化數(shù)據(jù)不是所有數(shù)據(jù)都值得訓(xùn)練很多重復(fù)樣本反而拖慢收斂其次是調(diào)小 max_len序列長(zhǎng)度對(duì)訓(xùn)練耗時(shí)的影響是線性的把 512 改成 256時(shí)間能省一半前提是你的任務(wù)不需要長(zhǎng)上下文。千萬(wàn)不要一上來(lái)就上多機(jī)多卡那個(gè)復(fù)雜度對(duì)新手不友好單卡 LoRA 能解決的場(chǎng)景真的很多。最后再分享一個(gè)小技巧回到標(biāo)題里那句“從零開(kāi)始”我想再啰嗦一句別追求一次把所有東西都搞懂這是我從自己第一次微調(diào)就崩掉的過(guò)程里總結(jié)出來(lái)的。把目標(biāo)拆成“今天能把環(huán)境裝好”“明天能加載模型”“后天能跑通一次訓(xùn)練”這種小里程碑每完成一個(gè)都有正反饋后面碰到報(bào)錯(cuò)也不慌。而且做完一輪微調(diào)之后別急著刪代碼把它整理成一個(gè)模板換數(shù)據(jù)集、換模型、換超參數(shù)都能復(fù)用這才是真正的沉淀。紙面的知識(shí)很容易忘能跑的流程才是你自己的。