:從環(huán)境搭建到MNIST識別)
在正式開始寫之前我必須先說明一點項目標(biāo)題雖然寫著TensorFlow 2.0/Keras實戰(zhàn)但想真正跑通第一個深度學(xué)習(xí)模型大頭其實不是“神經(jīng)網(wǎng)絡(luò)有多深”而是環(huán)境、版本、典型報錯這三件事。我從零開始折騰過不止一次光Windows下面的DLL診斷和numpy版本沖突就能勸退一半想入門的人。所以這篇內(nèi)容我不會只擺幾段能跑的代碼更想把我這兩年踩過的坑、選型時的判斷邏輯、以及現(xiàn)在給新人推薦的最短路徑一次性寫清楚認(rèn)真看完直接抄作業(yè)就行不用再被網(wǎng)上那些“五分鐘學(xué)會深度學(xué)習(xí)”的標(biāo)題黨帶著走。這篇博文的適合對象非常明確有一定Python語法基礎(chǔ)、但完全沒碰過深度學(xué)習(xí)框架的人或者之前只跑過sklearn、現(xiàn)在想進神經(jīng)網(wǎng)絡(luò)方向的人。如果你連Python都沒裝好也沒關(guān)系第二章我會把環(huán)境準(zhǔn)備整個講一遍手把手來不用慌。1. 為什么選TensorFlow 2.0/Keras當(dāng)入門框架先講一個很多人都會問的問題深度學(xué)習(xí)框架那么多PyTorch也天天刷屏為什么我推薦拿TensorFlow 2.0的Keras口徑來入門1.1 Keras的發(fā)展脈絡(luò)與定位Keras最早是一個獨立的高級神經(jīng)網(wǎng)絡(luò)API2015年由Fran?ois Chollet開源底層可以切換Theano、CNTK或TensorFlow。當(dāng)年它的口號就是“為人類設(shè)計的深度學(xué)習(xí)API”目的就是降低構(gòu)建神經(jīng)網(wǎng)絡(luò)的成本。我在2018年前后用Keras時它還是個需要單獨pip install的第三方庫寫幾層全連接網(wǎng)絡(luò)確實比原生TensorFlow 1.x舒服太多。后來Google在TensorFlow 2.0里把Keras并入了官方核心tf.keras成為唯一推薦的高級接口。這個變化意味著你在2024年再學(xué)TensorFlow時不需要接觸tf.Session、tf.placeholder這些老古董從第一行代碼開始就是Keras這套聲明式寫法。對比一下TensorFlow 1.x時代的寫法你就知道Keras帶來的進步有多大。以前建一個全連接網(wǎng)絡(luò)需要定義placeholder、初始化變量、顯式開Session跑global_variables_initializer()中間加一行打印還得用tf.Print每一步都在跟計算圖打交道。Keras則是把網(wǎng)絡(luò)描述成“層的列表”model.add(Dense(128, activationrelu))一行就是一層代碼讀起來跟搭積木一樣徹底告別了會話和占位符這類繞腦概念。1.2 動態(tài)圖模式帶來的體驗飛躍TensorFlow 2.0另一項關(guān)鍵變化是默認(rèn)啟用Eager Execution動態(tài)計算圖。以前TensorFlow是“先描述圖再開會話執(zhí)行”到了2.x則變成立即執(zhí)行你寫a b結(jié)果馬上算出來調(diào)試體驗跟寫普通Python沒有區(qū)別。這一點對新手來說極度友好——你可以用print直接看中間張量的值可以一步步排查問題甚至可以import pdb在訓(xùn)練循環(huán)里打斷點。網(wǎng)上很多老教程還在講如何tf.Session()、如何tf.global_variables_initializer()這些在TF 2.x里要么扔掉要么被嚴(yán)格限制所以千萬別拿舊教程練手會把自己繞暈。1.3 Keras的易用性為什么適合入門場景Keras把建模過程抽象成五個環(huán)節(jié)構(gòu)建模型結(jié)構(gòu)、編譯決定優(yōu)化器和損失函數(shù)、喂數(shù)據(jù)訓(xùn)練、評估、預(yù)測。這五個步驟的套路高度統(tǒng)一學(xué)會一個模型后面的CNN、RNN只是換層結(jié)構(gòu)整體流程不變。這種“流程一致性”對學(xué)習(xí)新模型極其重要因為你的注意力不會被框架細(xì)節(jié)分散而是集中在真正要學(xué)的神經(jīng)網(wǎng)絡(luò)思想本身。一個沒有深度學(xué)習(xí)背景的初學(xué)者用Keras寫一個手寫數(shù)字識別模型從環(huán)境就緒到看到準(zhǔn)確率輸出快的話不到半小時。這種即時的正反饋比看完一本600頁的理論書再動手要有價值得多。另外TenserFlow 2.x的生態(tài)張得非常開要把模型部署到手機上用TensorFlow Lite要在瀏覽器里跑模型用TensorFlow.js要做端側(cè)微型設(shè)備部署還有TensorFlow Lite Micro。這一套后續(xù)進階鏈路很完整哪怕你以后轉(zhuǎn)去學(xué)PyTorch在Keras里打下的神經(jīng)網(wǎng)絡(luò)基礎(chǔ)也完全不會浪費各種概念都是相通的。2. 深度學(xué)習(xí)環(huán)境搭建從零開始準(zhǔn)備這一章看起來基礎(chǔ)但確實是整個項目里最容易被忽略又最能勸退人的部分。尤其Windows用戶裝TensorFlow時遇到的DLL問題、路徑中文問題、Python版本不匹配問題能排到所有新手疑問的前三名。我把經(jīng)驗一次性攤開講。2.1 Python環(huán)境的版本選擇TensorFlow 2.x從真正拉滿運行來說官方支持的是Python 3.8到3.11之間的版本。2024年如果你直接裝了最新的Python 3.12很可能會遇到tensorflow不能直接安裝或者安裝后導(dǎo)入報錯的尷尬。穩(wěn)妥做法是裝Python 3.9或者3.10這個范圍內(nèi)的版本兼容性最成熟網(wǎng)上遇到的坑也最少。具體裝機路徑有兩種一種是從python.org下載官方安裝包再手動配pip一種是裝Anaconda全家桶。我更推薦新手用Anaconda理由很實在它自帶了conda包管理器、Python解釋器和一整套數(shù)據(jù)科學(xué)常用庫比如numpy、pandas、matplotlib都預(yù)裝好了省去大量逐個安裝的步驟。你裝好Anaconda后打開Anaconda Prompt直接創(chuàng)建環(huán)境conda create -n tf2 python3.9 conda activate tf2用獨立環(huán)境的好處特別明顯以后你研究別的項目需要不同版本的Python或TensorFlow時不會把系統(tǒng)環(huán)境弄亂一個項目一個環(huán)境壞了直接刪掉重建跟虛擬機差不多。這也是我推薦所有深度學(xué)習(xí)初學(xué)者從第一步就養(yǎng)成的好習(xí)慣。2.2 創(chuàng)建虛擬環(huán)境與安裝TensorFlow創(chuàng)建完P(guān)ython 3.9的環(huán)境后接下來就是安裝TensorFlow。在Anaconda Prompt里先激活環(huán)境然后執(zhí)行pip install tensorflow如果是AMD顯卡或者只想用CPU做入門學(xué)習(xí)裝CPU版就夠了。CPU版會把tensorflow-cpu作為默認(rèn)安裝命名也直接是tensorflow。如果是NVIDIA顯卡且想用GPU加速需要再裝GPU支持版pip install tensorflowTensorFlow 2.11之后的版本已經(jīng)把GPU支持打包進了默認(rèn)安裝包只要本地裝了對應(yīng)版本的CUDA和cuDNN就能自動檢測GPU。比老版本省心很多以前還得單獨裝tensorflow-gpu這個包現(xiàn)在不再需要了。在國內(nèi)網(wǎng)絡(luò)環(huán)境下直接跑pip install經(jīng)常因為網(wǎng)速問題卡到懷疑人生。我建議把pip鏡像源換成清華源裝包速度快得多配置方法如下pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple配置一次后以后所有pip安裝都會默認(rèn)走國內(nèi)鏡像實測下載TensorFlow這種幾百MB的大包非常穩(wěn)定。安裝完成后在Python環(huán)境里驗證一下import tensorflow as tf print(tf.__version__)如果能正常打印出版本號且沒有任何報錯環(huán)境就算基本通了。注意別在Jupyter里直接跑這條命令測試因為Jupyter繼承的是啟動時的環(huán)境在不同conda虛擬環(huán)境間切換時容易拿到舊環(huán)境最好在命令行終端里先驗證一遍。2.3 GPU版、CPU版怎么選很多初學(xué)者上來就問“是不是一定要用GPU”。我的回答是入門階段完全不用。手寫數(shù)字識別、圖像分類這些基礎(chǔ)案例用CPU跑也就幾分鐘GPU的加速優(yōu)勢要到大型卷積網(wǎng)絡(luò)和大規(guī)模數(shù)據(jù)時才明顯。而且GPU版本的配置門檻明顯更高——除了要NVIDIA顯卡還得裝對版本的CUDA和cuDNN這兩個庫的版本兼容性在Windows上非常折騰人。如果你電腦是NVIDIA顯卡裝完后可以在命令行跑一下nvidia-smi如果輸出表格顯示了顯卡信息和驅(qū)動版本說明顯卡驅(qū)動沒有問題。想確認(rèn)TensorFlow能不能用GPU加速還可以再加一行print(tf.config.list_physical_devices(GPU))如果輸出為空說明TensorFlow沒檢測到GPU這種情況就去檢查CUDA、cuDNN的版本是否匹配。我的建議很直接首次入門用CPU版本跑通流程建立起那種“代碼寫了就能跑”的信心感再考慮要不要折騰GPU。2.4 我踩過的環(huán)境坑Windows下的DLL診斷與版本沖突這里單獨說說Windows環(huán)境下最經(jīng)典的一個報錯很多人在import tensorflow時見過這行提示[tensorflow dll diagnostic] analyzing: d:\anaconda\lib\site-packages\tensorf...后面通常跟著類似“Could not load tensorflow_cc.dll”“找不到指定模塊”之類的內(nèi)容。這個報錯的核心原因是系統(tǒng)缺少Microsoft Visual C Redistributable運行庫或者版本過舊。TensorFlow是C編譯的Windows上依賴這個運行庫才能加載底層動態(tài)鏈接庫。解決辦法很簡單去微軟官網(wǎng)下載最新版“Microsoft Visual C Redistributable for Visual Studio 2015-2022”64位和32位都裝上重啟電腦再試絕大概率能解決。另一個高頻坑是numpy版本沖突。TensorFlow某些版本對numpy的版本范圍有要求比如TF 2.10要求numpy1.24但如果你先裝了numpy 1.26或2.x再裝TensorFlow就會出現(xiàn)沖突或運行時AttributeError。裝完TensorFlow后建議順手跑一下pip list | findstr numpy看到numpy版本是1.23到1.24之間就基本穩(wěn)。如果被升級到了2.x直接用pip install numpy1.24降回來再跑一次TensorFlow測試。說起來簡單我第一次遇到這個奇怪報錯時排查了大半天最后發(fā)現(xiàn)只因為numpy太新差點把環(huán)境刪了重裝這種冤枉時間沒必要花。3. 吃透Keras的五個核心概念環(huán)境搞定以后就是知識層面的重頭戲了。深度學(xué)習(xí)入門最大的門檻在于它有一套自己的黑話體系——層、激活函數(shù)、損失函數(shù)、優(yōu)化器、epoch、batch——不把這些概念挨個搞明白即便代碼能跑也只是在“碰運氣式編程”。我用比較貼近日常經(jīng)驗的方式把這幾個概念拆開講一遍。3.1 Sequential模型像搭樂高一樣搭網(wǎng)絡(luò)Keras里最簡單、最常用的模型類是Sequential它的特點是網(wǎng)絡(luò)層按順序堆疊每一層的輸出張量自動傳給下一層作為輸入。你可以理解成一根水管水從左端進來經(jīng)過一段段不同功能的水管處理最終從右端流出去。每一段水管就是一層網(wǎng)絡(luò)管子的粗細(xì)就是神經(jīng)元數(shù)量。手寫數(shù)字識別這種任務(wù)用Sequential就完全夠用。一個標(biāo)準(zhǔn)的Sequential模型長這樣from tensorflow.keras.models import Sequential from tensorflow.keras.layers import Dense, Flatten model Sequential([ Flatten(input_shape(28, 28)), Dense(128, activationrelu), Dense(10, activationsoftmax) ])Flatten的第一步作用是把二維圖像數(shù)據(jù)展平成一維向量因為全連接層接收的數(shù)據(jù)必須是一維的矩陣形式Dense(128, activationrelu)是中間隱藏層128表示這一層有128個神經(jīng)元最后的Dense(10, activationsoftmax)輸出層有10個神經(jīng)元對應(yīng)10個數(shù)字類別softmax把輸出轉(zhuǎn)換成概率分布總和為1。還有一種是Functional API它比Sequential更靈活適合構(gòu)建有分支、有跳躍連接的復(fù)雜模型比如類似ResNet那類結(jié)構(gòu)。但入門階段先用好Sequential就夠了序列化思維能幫你更清楚地理解數(shù)據(jù)是怎樣一層層被抽象和轉(zhuǎn)換的。3.2 Dense層、激活函數(shù)與“為什么需要非線性”Dense層的中文叫全連接層意思是這一層的每個神經(jīng)元都和上一層的所有神經(jīng)元相連。用數(shù)學(xué)語言描述就是輸出 激活函數(shù)(權(quán)重矩陣 × 輸入向量 偏置項)。線性變換做不出復(fù)雜決策如果所有層都只做線性變換那無論堆多少層本質(zhì)上都等價于一層線性模型根本學(xué)不了圖像、語音這種復(fù)雜的非線性關(guān)系。所以每一層后面都要接一個非線性激活函數(shù)這是神經(jīng)網(wǎng)絡(luò)能“擬合萬物”的根本原因。最常用的激活函數(shù)有三個ReLU、softmax和sigmoid。ReLU的計算很簡單負(fù)數(shù)歸零、正數(shù)保留它計算快還能緩解梯度消失問題是隱藏層的默認(rèn)選擇relu就是Rectified Linear Unit的縮寫。softmax用于多分類輸出層把多個輸出值轉(zhuǎn)成概率所有類別的概率加起來正好等于1模型最終預(yù)測的是概率最大的那個類別sigmoid把任意實數(shù)壓縮到0到1之間適合二分類或作為最后一層的輸出但由于它兩頭飽和、容易梯度消失在深層網(wǎng)絡(luò)隱藏層里基本被ReLU取代。3.3 損失函數(shù)與優(yōu)化器告訴模型怎么學(xué)和怎么改進模型訓(xùn)練的本質(zhì)是讓“預(yù)測值”和“真實值”之間的差距越來越小這個差距的衡量標(biāo)準(zhǔn)就是損失函數(shù)。多分類問題最常用的是sparse_categorical_crossentropy它比較模型輸出的概率分布和真實標(biāo)簽之間的差距值越小表示預(yù)測越準(zhǔn)。要注意它和categorical_crossentropy的區(qū)別如果你把標(biāo)簽做成了one-hot編碼用categorical_crossentropy如果標(biāo)簽還是整數(shù)形式比如“3”表示數(shù)字3就用sparse_categorical_crossentropy。兩者目標(biāo)一樣只是標(biāo)簽格式不同。優(yōu)化器的作用是根據(jù)損失函數(shù)的結(jié)果去調(diào)整網(wǎng)絡(luò)里的權(quán)重。入門階段不需要研究太多直接閉眼選Adam就好它是目前綜合表現(xiàn)最好的優(yōu)化器之一。它結(jié)合了動量法和均方根傳播的優(yōu)點能自適應(yīng)地調(diào)整每個參數(shù)的學(xué)習(xí)率對新手上手極為友好。在編譯模型時指定model.compile( optimizeradam, losssparse_categorical_crossentropy, metrics[accuracy] )metrics[accuracy]告訴模型在訓(xùn)練過程中要額外計算并展示準(zhǔn)確率這樣每個epoch結(jié)束你就能看到百分比形式的進度反饋而不是一個抽象的浮點數(shù)。3.4 epoch、batch_size、驗證集訓(xùn)練流程里的三個關(guān)鍵參數(shù)真正開始訓(xùn)練時你會遇到三個繞不開的參數(shù)epoch、batch_size、validation_split。epoch表示整個訓(xùn)練數(shù)據(jù)集被完整遍歷的次數(shù)也就是說每跑完一輪epoch模型就已經(jīng)把數(shù)據(jù)看了一遍。batch_size是每次前向傳播和反向傳播喂給模型的樣本數(shù)量因為一次把幾萬個樣本全塞進內(nèi)存不現(xiàn)實必須分批喂。batch_size越大訓(xùn)練越快但內(nèi)存占用越大且容易收斂到較差的局部最優(yōu)batch_size越小收斂方向越不平穩(wěn)噪聲越大通常32或64是性能和穩(wěn)定性比較均衡的選擇。validation_split是訓(xùn)練時自動從訓(xùn)練集里抽出一部分比例比如0.2作為驗證集用來在每個epoch結(jié)束后檢查模型在未見數(shù)據(jù)上的表現(xiàn)及時發(fā)現(xiàn)過擬合。這些參數(shù)在Keras里只是一個數(shù)字的事history model.fit( x_train, y_train, batch_size32, epochs10, validation_split0.2 )你在訓(xùn)練日志里會看到類似“l(fā)oss: 0.4156 - accuracy: 0.8687 - val_loss: 0.2310 - val_accuracy: 0.9331”的輸出每行代表一個epoch。如果訓(xùn)練集準(zhǔn)確率很高但驗證集準(zhǔn)確率一直上不去甚至在下滑那說明模型過擬合了需要加Dropout層、早停或數(shù)據(jù)增強來處理。3.5 模型的評估與預(yù)測階段訓(xùn)練完以后就是驗收環(huán)節(jié)。先用model.evaluate()在測試集上跑一遍test_loss, test_acc model.evaluate(x_test, y_test, verbose2) print(f測試集準(zhǔn)確率: {test_acc})evaluate返回的第一個值是測試集損失第二個值是我們指定的指標(biāo)準(zhǔn)確率。對訓(xùn)練好的模型用predict()就能拿起來做推理predictions model.predict(x_test)注意predict返回的直接是每個類別的概率向量比如[0.01, 0.02, 0.9, 0.03, ...]你想知道具體預(yù)測的是哪個數(shù)字需要用np.argmax(predictions[0])找出概率最大的那個下標(biāo)。這個細(xì)節(jié)很多新手會忽略直接打印predictions看到一堆小數(shù)點數(shù)字后一臉懵其實只是沒有做最后的argmax轉(zhuǎn)換而已。4. 第一個實戰(zhàn)MNIST手寫數(shù)字識別從0到1講完核心概念就該動手寫真正的完整項目了。這里我選擇大名鼎鼎的MNIST手寫數(shù)字識別數(shù)據(jù)集它相當(dāng)于深度學(xué)習(xí)界的“Hello World”包含了6萬張訓(xùn)練圖片和1萬張測試圖片每張都是28×28像素的灰度圖內(nèi)容是0到9的手寫數(shù)字。用Keras跑它簡直不要太順手完整流程走一遍后你對深度學(xué)習(xí)的整個閉環(huán)就有了體感。4.1 加載數(shù)據(jù)與初步觀察Keras自帶MNIST數(shù)據(jù)集不需要去網(wǎng)上下載一行代碼就能加載from tensorflow.keras.datasets import mnist (x_train, y_train), (x_test, y_test) mnist.load_data()第一次運行時會自動下載數(shù)據(jù)到本地緩存目錄之后再用就直接讀取。數(shù)據(jù)加載完最好先看一眼數(shù)據(jù)的形狀print(x_train.shape) # (60000, 28, 28) print(y_train.shape) # (60000,)x_train是6萬張28×28的圖片y_train是6萬個由0到9組成的整數(shù)標(biāo)簽。為了讓小白理解“一張圖片在程序里到底是什么”可以用matplotlib畫出來看一眼import matplotlib.pyplot as plt plt.imshow(x_train[0], cmapgray) plt.title(fLabel: {y_train[0]}) plt.show()運行后你會看到一張大大的灰度“5”字圖片。這一步的意義是讓你在之后訓(xùn)練時明白模型處理的不是“圖片文件”而是一個個二維數(shù)組數(shù)組的每個值代表該像素點的灰度強弱。4.2 數(shù)據(jù)預(yù)處理歸一化與形狀調(diào)整直接拿原始像素值訓(xùn)練會有一個問題像素值范圍是0到255數(shù)值太大會拖慢收斂速度而且網(wǎng)絡(luò)內(nèi)部的梯度計算容易不穩(wěn)定。標(biāo)準(zhǔn)做法是把數(shù)值范圍縮放到0到1之間只需要除以255x_train x_train.astype(float32) / 255.0 x_test x_test.astype(float32) / 255.0這一步叫歸一化是幾乎所有深度學(xué)習(xí)任務(wù)里必備的數(shù)據(jù)預(yù)處理環(huán)節(jié)。你可以想象成一把尺子原來是0到255厘米現(xiàn)在統(tǒng)一改成0到1米算法在統(tǒng)一尺度上計算才不容易出偏差。這里還要注意原始數(shù)據(jù)是整數(shù)類型uint8需要先轉(zhuǎn)成float32再除不然整數(shù)除以整數(shù)會得到0數(shù)據(jù)就全變沒用了。如果用Sequential模型并且第一層是Flatten那么輸入形狀可以直接寫成(28, 28)不用提前把數(shù)據(jù)改成784維。因為Flatten的作用就是負(fù)責(zé)在模型內(nèi)部把二維數(shù)組展平成784個元素的向量。不過對于像卷積神經(jīng)網(wǎng)絡(luò)那種需要保留圖像二維空間信息的模型就一定要保持(28, 28)形狀千萬別把數(shù)據(jù)手動reshape成784維否則卷積層就沒辦法利用圖像的空間結(jié)構(gòu)了。4.3 構(gòu)建模型設(shè)計三層全連接網(wǎng)絡(luò)接下來就是設(shè)計網(wǎng)絡(luò)結(jié)構(gòu)。為了入門我們用三層全連接網(wǎng)絡(luò)就夠了from tensorflow.keras.models import Sequential from tensorflow.keras.layers import Dense, Flatten model Sequential([ Flatten(input_shape(28, 28)), Dense(128, activationrelu), Dense(64, activationrelu), Dense(10, activationsoftmax) ])網(wǎng)絡(luò)結(jié)構(gòu)解釋如下第一層Flatten負(fù)責(zé)把28×28的二維圖片展平變成784個輸入特征第二層Dense(128, activationrelu)是一個有128個神經(jīng)元的隱藏層負(fù)責(zé)從784個像素中學(xué)習(xí)抽象的低級特征組合第三層Dense(64, activationrelu)是第二個隱藏層進一步學(xué)習(xí)更高層的特征組合最后一層Dense(10, activationsoftmax)輸出10個數(shù)字類別的概率分布。中間的神經(jīng)元數(shù)量為什么設(shè)定為128和64沒有嚴(yán)格的理論依據(jù)更多來自實踐積累。這兩個數(shù)字能覆蓋這個任務(wù)的復(fù)雜度又不會讓模型過于臃腫。你可以試著調(diào)整成256、128看看效果會發(fā)現(xiàn)準(zhǔn)確率差異不大但訓(xùn)練時間有區(qū)別。這就是深度學(xué)習(xí)中典型的“調(diào)參”體驗——參數(shù)不同結(jié)果就不同這也是為什么動手跑實驗比只看書更能建立直覺。4.4 編譯、訓(xùn)練與結(jié)果分析模型構(gòu)建完接著編譯并開始訓(xùn)練model.compile( optimizeradam, losssparse_categorical_crossentropy, metrics[accuracy] ) history model.fit( x_train, y_train, batch_size32, epochs10, validation_split0.2 )這里我把epochs設(shè)置為10意味著整個數(shù)據(jù)集會被完整學(xué)習(xí)10輪。每輪結(jié)束后模型都會在預(yù)留的20%驗證集上跑一次用來監(jiān)控模型的泛化能力。順帶提一句訓(xùn)練過程中如果看到loss持續(xù)下降但val_loss開始升高說明模型在“死記硬背”訓(xùn)練集而不是學(xué)習(xí)通用規(guī)律也就是過擬合的跡象。實際訓(xùn)練輸出長這樣Epoch 1/10 1500/1500 [] - 3s 2ms/step - loss: 0.2987 - accuracy: 0.9110 - val_loss: 0.1510 - val_accuracy: 0.9551 Epoch 2/10 ... Epoch 10/10 1500/1500 [] - 3s 2ms/step - loss: 0.1109 - accuracy: 0.9652 - val_loss: 0.1018 - val_accuracy: 0.970010輪結(jié)束后模型在訓(xùn)練集上的準(zhǔn)確率大約能到97%左右驗證集大概96%以上。這里還有一個細(xì)節(jié)值得說loss: 0.2987的含義是訓(xùn)練集上的平均交叉熵?fù)p失數(shù)字越小表示預(yù)測和真實標(biāo)簽越接近。開頭第1輪loss可能在0.3附近到第10輪能降到0.1左右說明模型在持續(xù)學(xué)習(xí)。如果你的loss在第2輪就降到0.01以下反而要警惕是不是模型把訓(xùn)練樣本背下來了這時準(zhǔn)確率再高也說明不了好泛化能力才是真正要關(guān)注的。4.5 測試集評估與可視化預(yù)測結(jié)果模型訓(xùn)練完后最后一道工序是在從來沒有參與過訓(xùn)練的測試集上評估test_loss, test_acc model.evaluate(x_test, y_test, verbose2) print(f測試集準(zhǔn)確率: {test_acc:.4f})測試集的結(jié)果才算模型真正的“考試成績”因為模型訓(xùn)練時完全沒見過這些數(shù)據(jù)。運行結(jié)果一般會在97%左右。你還可以隨機挑幾張測試圖片來可視化預(yù)測結(jié)果直觀感受模型的判斷能力import numpy as np predictions model.predict(x_test) pred_labels np.argmax(predictions, axis1) for i in range(5): plt.imshow(x_test[i], cmapgray) plt.title(f真實值: {y_test[i]}, 預(yù)測值: {pred_labels[i]}) plt.show()看到真實值和預(yù)測值完全一致時就說明你的模型已經(jīng)具備識別手寫數(shù)字的能力了。這個從數(shù)據(jù)加載到模型評估的完整流程其實就是深度學(xué)習(xí)項目的主干流程。不管以后做圖像分類、文本分類還是別的高級任務(wù)流程骨架都是這一套。5. 初學(xué)者最常踩的坑與排查技巧這一章的內(nèi)容來自我反復(fù)折騰和幫別人解決問題的實戰(zhàn)積累相當(dāng)一部分普通教材不會寫。我把這些坑按頻率從高到低列出來建議遇到問題時直接對照著排查。5.1 tensorflow dll diagnostic相關(guān)報錯速查Windows平臺下import tensorflow時報出[tensorflow dll diagnostic] analyzing: ...類的提示是很多新手見到的第一道坎。這個報錯的原因主要有兩類一是缺少Microsoft Visual C Redistributable運行庫二是顯卡驅(qū)動與CUDA版本不匹配。CPU安裝版只需要關(guān)注第一類把運行庫裝上基本就能解決。GPU版本如果還繼續(xù)報錯就要用nvidia-smi檢查驅(qū)動去NVIDIA官網(wǎng)下載與TensorFlow要求匹配的CUDA Toolkit和對應(yīng)版本的cuDNN。這個過程相對繁瑣所以在入門階段直接裝CPU版你就能繞開一多半的DLL問題。5.2 版本兼容問題Python、numpy和TensorFlow的三角關(guān)系TensorFlow的版本敏感性在Python生態(tài)里是出了名的。比如TensorFlow要求Python版本不能太高也不能太低numpy版本又被限定在一定范圍內(nèi)太新會觸發(fā)numpy.dtype size changed之類的警告或錯誤。這類問題統(tǒng)一排查思路是查看報錯信息里是否有關(guān)鍵詞numpy、dll、protobuf、grpcio等如果出現(xiàn)了優(yōu)先檢查版本兼容。我的建議是一步到位創(chuàng)建虛擬環(huán)境時直接用Python 3.9裝完TensorFlow后立刻固定numpy版本并且不要用最新版Jupyter Notebook某些太新版本對tensorflow的兼容性不友好。只做這三件事版本類問題基本能消掉90%。5.3 訓(xùn)練太慢與內(nèi)存不足的處理思路用CPU訓(xùn)練深度神經(jīng)網(wǎng)絡(luò)時epoch跑得慢很正常但要分清楚是“正常慢”還是“卡住了”。正常慢是每個epoch都在穩(wěn)定推進只是總耗時長卡住是進度條長時間不動這種情況多半是數(shù)據(jù)管道出了問題比如在Windows上使用了多進程數(shù)據(jù)加載卻忘記加if __name__ __main__保護或者數(shù)據(jù)張量太大一次性載入了內(nèi)存。對于內(nèi)存溢出問題最簡單的做法是調(diào)小batch_size從默認(rèn)的32改成16或8內(nèi)存占用會直線下降。如果訓(xùn)練速度實在慢得忍不了就放棄CPU版去安GPU版或者在Colab、Kaggle這類云平臺上用免費GPU訓(xùn)練。我經(jīng)常跟人說深度學(xué)習(xí)的時間成本非常寶貴別在入門時因為“訓(xùn)練慢”浪費一整天的耐心該上云就上云。5.4 數(shù)據(jù)預(yù)處理與訓(xùn)練流程里的隱形坑另一個常見坑是不做數(shù)據(jù)歸一化直接訓(xùn)練。你會發(fā)現(xiàn)這種情況模型也能跑但準(zhǔn)確率可能長期卡在85%附近上不去或者loss下降極其緩慢。把輸入范圍縮放到0到1后收斂速度會明顯改善準(zhǔn)確率也有顯著提升。還有一個坑是數(shù)據(jù)集類別分布不平衡。比如MNIST里每個數(shù)字的樣本量大致均衡模型學(xué)起來很省心但現(xiàn)實項目里某類樣本特別多、某類特別少時不處理就直接訓(xùn)練模型會偏向樣本量大的類。入門時先要知道這個問題的存在特解辦法后面學(xué)梯度加權(quán)或重采樣時再消化。此外做圖像任務(wù)時不要習(xí)慣性把標(biāo)簽用one-hot編碼。MNIST的標(biāo)簽是整數(shù)直接用sparse_categorical_crossentropy就好硬要one-hot反而要多寫一句轉(zhuǎn)換代碼。等后面用到categorical_crossentropy時再學(xué)to_categorical就順理成章。5.5 常見報錯與解決方案速查表為了方便查閱我做了一張小的速查表覆蓋出現(xiàn)頻率最高的報錯報錯或癥狀主要原因處理辦法[tensorflow dll diagnostic] analyzing...缺少VC運行庫或CUDA版本不匹配安裝最新版VC RedistributableGPU版核對CUDA/cuDNN版本numpy.dtype size changednumpy版本過新降級numpy:pip install numpy1.24Could not create cudnn handle: CUDNN_STATUS_ALLOC_FAILED顯存不足或cuDNN初始化失敗調(diào)小batch_size重啟內(nèi)核釋放顯存UnknownError: Could not find a doctor to run a task數(shù)據(jù)管道線程問題減少num_workers或改用單線程加載AttributeError: module tensorflow has no attribute Session用了舊教程代碼改用Keras API不用Session訓(xùn)練準(zhǔn)確率高但驗證準(zhǔn)確率低過擬合加Dropout層、早停、增加數(shù)據(jù)量或降低模型復(fù)雜度遇到上面任何一個報錯先按表格對照著定位。如果表里沒有就把完整報錯日志粘貼到搜索引擎里搜絕大多數(shù)情況都會發(fā)現(xiàn)是別人踩過的同一個坑。6. TensorFlow還是PyTorch入門之后的下一步等你跑通MNIST掌握了Keras這套工作流大概率會開始糾結(jié)一個問題既然網(wǎng)上都在吹PyTorch我到底要不要轉(zhuǎn)過去這其實是個好問題說明你已經(jīng)開始思考框架選型了。TensorFlow 2.x在工業(yè)部署和移動端、服務(wù)端生態(tài)上有明顯優(yōu)勢。TensorFlow Serving可以方便地做模型上線服務(wù)TensorFlow Lite是移動端推理的主流方案之一TF Hub上還有大量預(yù)訓(xùn)練模型可以直接遷移學(xué)習(xí)。如果你以后的工作方向偏向工程落地、產(chǎn)品化TensorFlow會是一條順暢的鏈路。PyTorch在研究領(lǐng)域和學(xué)術(shù)論文里更流行它的動態(tài)計算圖機制讓模型定義的靈活度更高很多頂會論文的官方實現(xiàn)都以PyTorch為主社區(qū)的新模型和開源倉庫也更活躍。不過我的個人建議是入門階段不要花太多時間糾結(jié)“選哪個”。先用TensorFlow把Keras這套標(biāo)準(zhǔn)工作流跑熟了積累足夠深的神經(jīng)網(wǎng)絡(luò)概念和訓(xùn)練調(diào)參經(jīng)驗這會讓你在任何框架間遷移都很快??蚣苤皇枪ぞ叩讓拥奶荻认陆?、反向傳播、損失函數(shù)這些思想是完全共通的。真正讓你在深度學(xué)習(xí)路上走遠(yuǎn)的是對模型、數(shù)據(jù)、訓(xùn)練過程的理解而不是某個框架的API熟練度?;仡櫸易约簭牧闳腴T的過程最大的體會就是不要等“全部看懂再動手”也別在第一行代碼跑通后就急著追求復(fù)雜的模型。先照著一個標(biāo)準(zhǔn)案例完整走一遍輸入到輸出的閉環(huán)建立起第一步的正反饋然后沿著這個閉環(huán)不停地做小改動、加功能、換數(shù)據(jù)集這樣的學(xué)習(xí)效率是最高的。等你有一天能不看教程獨立完成一個圖像分類小項目時回看今天糾結(jié)的環(huán)境配置和DLL問題會發(fā)現(xiàn)那些都變成了最簡單不過的小事。