
之前在做回歸預測任務時最難受的點往往不是模型效果上不來而是模型給出一個預測值之后很難向業(yè)務方解釋清楚“為什么是這個值”。為了解決這個問題我采用了CNN-GRU 混合模型作為預測主體并結合SHAP 值分析每個特征對預測結果的貢獻。網(wǎng)上關于 CNN-GRU 做分類或回歸的例子很多但不少文章只貼代碼、不解釋維度變化也沒有把 SHAP 解釋的完整流程整合進去。這篇文章把我實際使用的代碼、訓練流程和可解釋性分析整理成一套可直接運行的教程希望對正在做回歸預測的你有所幫助。本文覆蓋以下內(nèi)容CNN-GRU 混合模型的核心原理回歸預測數(shù)據(jù)的滑窗構建與歸一化方法使用 PyTorch 搭建 CNN-GRU 回歸模型模型訓練、評估指標解讀SHAP 值的計算與可視化分析常見報錯和工程化建議。1. 背景與核心概念1.1 CNN-GRU 是什么CNN-GRU 是由卷積神經(jīng)網(wǎng)絡CNN和門控循環(huán)單元GRU組合而成的混合網(wǎng)絡結構。CNNConvolutional Neural Network善于提取局部特征。在一維時間序列數(shù)據(jù)中卷積核可以捕捉相鄰時間步之間的局部模式比如短期的趨勢變化、周期性波動等。GRUGated Recurrent Unit是 LSTM 的簡化變體通過更新門和重置門控制信息的保留與遺忘。GRU 適合建模長距離依賴關系同時參數(shù)量比 LSTM 更少訓練效率更高。將兩者串聯(lián)是一種常見做法先用 CNN 從原始輸入中提取局部特征再把 CNN 的輸出按照時間順序送入 GRU讓 GRU 繼續(xù)捕捉時間維度上的長期依賴。1.2 為什么用 CNN-GRU 做回歸預測很多真實場景中的回歸預測面對的是多變量時間序列數(shù)據(jù)比如根據(jù)過去 24 小時的多維環(huán)境數(shù)據(jù)預測未來氣溫根據(jù)歷史交易數(shù)據(jù)預測下一時段銷量根據(jù)設備傳感器數(shù)據(jù)預測剩余壽命根據(jù)歷史負荷數(shù)據(jù)預測未來用電量。這些數(shù)據(jù)通常同時具有“局部相關性”和“長期依賴性”。如果只用 CNN模型感受野有限難以建模長期依賴如果只用 GRU序列較長時訓練速度更慢而且對局部特征的提取不夠直接。CNN-GRU 先做局部特征抽象再做時序建模在很多回歸任務上效果優(yōu)于單一模型。1.3 為什么引入 SHAP 值回歸預測模型光有精度還不夠。當我們想判斷“哪個特征對預測結果影響最大”或者“某條預測為什么偏高”時就需要對模型做可解釋性分析。SHAPSHapley Additive exPlanations是一種基于博弈論 Shapley 值的模型解釋方法。它的核心思想是每個特征對預測結果的貢獻可以量化且所有特征的貢獻之和等于模型預測值相對于基線預測值的偏離程度。在復雜深度學習模型中SHAP 可以告訴我們哪些特征對預測結果影響最大樣本級別上某個特征取值是拉高了預測值還是拉低了預測值特征與預測結果之間是正相關還是負相關。所以CNN-GRU 負責把預測精度做到位SHAP 負責把預測結果解釋清楚兩者結合是一條很實用的工程路徑。2. 環(huán)境準備與項目結構2.1 運行環(huán)境說明下面的代碼以 Python 3.9 為例需要安裝以下依賴。具體版本請根據(jù)你的實際環(huán)境調(diào)整本文重點演示實現(xiàn)思路pip install numpy pandas matplotlib scikit-learn torch shap如果你使用 GPU 版本的 PyTorch 訓練需要提前安裝對應 CUDA 版本的 torch如果只是學習演示CPU 版本也能跑通。2.2 項目結構建議按照下面的目錄組織代碼cnn_gru_regression/ ├── main.py # 完整訓練與評估流程 ├── model.py # CNN-GRU 模型定義 ├── data_utils.py # 數(shù)據(jù)生成與滑窗處理 ├── explain.py # SHAP 可解釋性分析 └── requirements.txt # 依賴清單如果你希望代碼更集中也可以把全部內(nèi)容寫在一個腳本里。為了便于閱讀本文按照功能拆分講解最后你可以把代碼匯總到一個文件中運行。3. 回歸預測數(shù)據(jù)準備3.1 使用模擬數(shù)據(jù)快速驗證我們先寫一個模擬數(shù)據(jù)生成函數(shù)。這個函數(shù)會生成 4 個與目標值存在線性關系的時間序列特征并加入少量噪聲。# 文件路徑data_utils.py import numpy as np import pandas as pd def generate_demo_data(n_samples1500): 生成多變量回歸預測模擬數(shù)據(jù)。 參數(shù) n_samples: 樣本點數(shù)量 返回 pandas.DataFrame包含 4 個特征列和 1 個目標列 t np.arange(n_samples) # 構造4個特征每個特征有不同周期和噪聲 feature1 np.sin(2 * np.pi * t / 50) 0.1 * np.random.randn(n_samples) feature2 np.cos(2 * np.pi * t / 30) 0.1 * np.random.randn(n_samples) feature3 0.02 * t 0.2 * np.random.randn(n_samples) feature4 0.5 * np.sin(2 * np.pi * t / 7) 0.2 * np.random.randn(n_samples) # 目標值與特征之間保持線性組合方便后續(xù)用 SHAP 驗證解釋效果 target ( 2.5 * feature1 1.5 * feature2 0.8 * feature3 - 1.2 * feature4 0.3 * np.random.randn(n_samples) ) df pd.DataFrame({ feature1: feature1, feature2: feature2, feature3: feature3, feature4: feature4, target: target, }) return df這個方法的好處是數(shù)據(jù)可以自己生成代碼復制后能直接運行。如果你有自己的數(shù)據(jù)集只需要把“讀入 DataFrame包含特征列和目標列”這一步替換掉即可。3.2 滑窗樣本構建回歸預測里我們通常不能直接用單條樣本做預測而是用過去一段時間的特征序列預測下一個時間點的值。這個“過去一段時間”就叫做時間窗口對應的處理方式叫“滑窗”或“滾動窗口”。# 文件路徑data_utils.py def create_sequences(data, feature_cols, target_col, window_size24): 構建滑窗樣本。 參數(shù) data: DataFrame包含特征列和目標列 feature_cols: 特征列名列表 target_col: 目標列名 window_size: 時間窗口長度 返回 X: shape 為 (樣本數(shù), window_size, 特征數(shù)) 的數(shù)組 y: shape 為 (樣本數(shù),) 的數(shù)組 X, y [], [] for i in range(len(data) - window_size): X.append(data[feature_cols].iloc[i: i window_size].values) y.append(data[target_col].iloc[i window_size]) return np.array(X), np.array(y)這里需要注意窗口長度window_size決定了模型每次能看到多長的歷史信息。窗口太短會丟失長期依賴窗口太長會增加計算量也可能會引入過多噪聲。一般可以先通過實驗對比不同窗口大小再確定適合業(yè)務場景的值。3.3 時間順序切分與歸一化時序預測和普通機器學習不一樣不能隨機打亂數(shù)據(jù)再切分否則會造成“未來信息泄漏”。也就是說如果用后面的數(shù)據(jù)去訓練模型、預測前面的數(shù)據(jù)評估結果會虛高。這里我們按時間順序前 80% 作為訓練集后 20% 作為測試集。def load_train_test_data(window_size24, test_ratio0.2): 生成數(shù)據(jù)并切分為訓練集和測試集按時間順序切分。 feature_cols [feature1, feature2, feature3, feature4] target_col target data generate_demo_data(1500) split_idx int(len(data) * (1 - test_ratio)) train_df data.iloc[:split_idx] test_df data.iloc[split_idx:] # 分別對訓練集和測試集做歸一化 # 注意歸一化參數(shù)只能用訓練集 fit測試集直接 transform from sklearn.preprocessing import MinMaxScaler scaler_X MinMaxScaler() scaler_y MinMaxScaler() train_X_scaled scaler_X.fit_transform(train_df[feature_cols]) train_y_scaled scaler_y.fit_transform(train_df[[target_col]]) test_X_scaled scaler_X.transform(test_df[feature_cols]) test_y_scaled scaler_y.transform(test_df[[target_col]]) train_df_scaled pd.DataFrame(train_X_scaled, columnsfeature_cols) train_df_scaled[target_col] train_y_scaled test_df_scaled pd.DataFrame(test_X_scaled, columnsfeature_cols) test_df_scaled[target_col] test_y_scaled # 構建滑窗樣本 X_train, y_train create_sequences(train_df_scaled, feature_cols, target_col, window_size) X_test, y_test create_sequences(test_df_scaled, feature_cols, target_col, window_size) return X_train, y_train, X_test, y_test, scaler_y關于歸一化有兩個容易踩的坑整個數(shù)據(jù)集只 fit 一次MinMaxScaler然后在所有數(shù)據(jù)上 transform這在時序場景里是不可取的。因為訓練集之外的“未來數(shù)據(jù)”參與了歸一化參數(shù)計算相當于把未來的分布信息提前暴露給了模型。目標變量y也需要歸一化。深度學習模型直接回歸一個量綱較大的數(shù)值時損失值可能很大訓練不穩(wěn)定。這里我們把目標值歸一化到[0,1]區(qū)間訓練結束后再把預測結果反歸一化。4. 構建 CNN-GRU 回歸預測模型4.1 模型結構定義下面是模型的完整定義。# 文件路徑model.py import torch import torch.nn as nn class CNNGRU(nn.Module): def __init__(self, n_features, hidden_size64, num_layers1, dropout0.1, output_size1): super(CNNGRU, self).__init__() # 1D 卷積層輸入通道為特征數(shù)輸出通道為 32 self.conv1 nn.Conv1d( in_channelsn_features, out_channels32, kernel_size3, padding1 ) self.relu nn.ReLU() self.pool nn.MaxPool1d(kernel_size2) # GRU 層輸入大小是 CNN 輸出通道數(shù) self.gru nn.GRU( input_size32, hidden_sizehidden_size, num_layersnum_layers, batch_firstTrue, dropoutdropout if num_layers 1 else 0 ) # 全連接輸出層 self.fc nn.Linear(hidden_size, output_size) def forward(self, x): # 輸入 x 形狀: (batch_size, seq_len, n_features) # CNN 期望輸入形狀是 (batch_size, channels, seq_len) x x.permute(0, 2, 1) # 經(jīng)過卷積、激活、池化 x self.conv1(x) # (batch_size, 32, seq_len) x self.relu(x) x self.pool(x) # (batch_size, 32, seq_len // 2) # 轉回 GRU 需要的形狀: (batch_size, seq_len, input_size) x x.permute(0, 2, 1) # GRU 前向傳播取最后一個時間步輸出 out, _ self.gru(x) # out: (batch_size, seq_len, hidden_size) out out[:, -1, :] # 取最后一個時間步 # 全連接輸出 out self.fc(out) # (batch_size, 1) return out4.2 維度變化分析很多初學者第一次看這段代碼會卡在維度變化上這里梳理一下操作輸入形狀輸出形狀原始輸入(batch, seq_len, n_features)(batch, seq_len, n_features)permute 轉置(batch, seq_len, n_features)(batch, n_features, seq_len)Conv1d(batch, n_features, seq_len)(batch, 32, seq_len)ReLU(batch, 32, seq_len)(batch, 32, seq_len)MaxPool1d(batch, 32, seq_len)(batch, 32, seq_len // 2)permute 轉置(batch, 32, seq_len // 2)(batch, seq_len // 2, 32)GRU(batch, seq_len // 2, 32)(batch, seq_len // 2, hidden_size)取最后一個時間步(batch, seq_len // 2, hidden_size)(batch, hidden_size)Linear(batch, hidden_size)(batch, 1)需要注意MaxPool1d 的kernel_size2會讓序列長度減半。如果seq_len是奇數(shù)比如window_size25池化后長度會變成12對應關系可能變得不直觀因此建議優(yōu)先使用偶數(shù)窗口長度。4.3 為什么先 CNN 再 GRU這里簡單解釋一下設計動機CNN 的卷積核對局部模式敏感可以自動提取“相鄰幾個時間步之間的組合特征”經(jīng)過 MaxPooling 后序列長度縮短計算量降低也起到一定的特征壓縮作用GRU 接收 CNN 提取的高層特征序列繼續(xù)建模長期依賴最后用全連接層把 GRU 最后一個時間步的隱藏狀態(tài)映射為標量預測值。如果任務本身序列較短、特征較少也可以去掉 MaxPooling只保留卷積和 GRU。示例代碼保留池化是為了展示一種更通用的結構。5. 訓練與回歸評估5.1 數(shù)據(jù)集封裝與數(shù)據(jù)加載器我們使用 PyTorch 的TensorDataset和DataLoader來管理數(shù)據(jù)。from torch.utils.data import TensorDataset, DataLoader import torch X_train, y_train, X_test, y_test, scaler_y load_train_test_data(window_size24) # 轉換為 PyTorch Tensor X_train_t torch.FloatTensor(X_train) y_train_t torch.FloatTensor(y_train).view(-1, 1) X_test_t torch.FloatTensor(X_test) y_test_t torch.FloatTensor(y_test).view(-1, 1) train_dataset TensorDataset(X_train_t, y_train_t) test_dataset TensorDataset(X_test_t, y_test_t) train_loader DataLoader(train_dataset, batch_size64, shuffleTrue) test_loader DataLoader(test_dataset, batch_size64, shuffleFalse)這里有一個細節(jié)訓練數(shù)據(jù)加載時shuffleTrue但是測試數(shù)據(jù)shuffleFalse。因為訓練時我們希望每個 batch 的樣本盡量隨機幫助模型穩(wěn)定收斂測試時不需要打亂順序方便后續(xù)計算指標和可視化。5.2 模型初始化與訓練循環(huán)import torch.nn as nn import torch.optim as optim # 固定隨機種子保證結果可復現(xiàn) torch.manual_seed(42) model CNNGRU(n_featuresX_train.shape[2], hidden_size64) criterion nn.MSELoss() optimizer optim.Adam(model.parameters(), lr0.001) epochs 30 for epoch in range(epochs): model.train() train_loss 0.0 for X_batch, y_batch in train_loader: optimizer.zero_grad() y_pred model(X_batch) loss criterion(y_pred, y_batch) loss.backward() optimizer.step() train_loss loss.item() * X_batch.size(0) avg_train_loss train_loss / len(train_dataset) # 每個 epoch 后評估一次測試集 model.eval() test_loss 0.0 with torch.no_grad(): for X_batch, y_batch in test_loader: y_pred model(X_batch) loss criterion(y_pred, y_batch) test_loss loss.item() * X_batch.size(0) avg_test_loss test_loss / len(test_dataset) if (epoch 1) % 5 0: print(fEpoch {epoch 1}/{epochs}, Train Loss: {avg_train_loss:.6f}, Test Loss: {avg_test_loss:.6f})訓練過程中有兩個環(huán)境非常重要model.train()與model.eval()訓練模式會啟用 Dropout 等隨機操作而評估模式會固定這些操作保證測試輸出穩(wěn)定。with torch.no_grad()推理階段不需要計算梯度既省內(nèi)存又加快速度。5.3 回歸評估指標回歸預測常用三個指標MSE、MAE、R2。from sklearn.metrics import mean_squared_error, mean_absolute_error, r2_score model.eval() with torch.no_grad(): y_pred_all model(X_test_t).numpy().flatten() y_test_all y_test_t.numpy().flatten() # 反歸一化恢復真實尺度 y_pred_inv scaler_y.inverse_transform(y_pred_all.reshape(-1, 1)).flatten() y_test_inv scaler_y.inverse_transform(y_test_all.reshape(-1, 1)).flatten() mse mean_squared_error(y_test_inv, y_pred_inv) mae mean_absolute_error(y_test_inv, y_pred_inv) r2 r2_score(y_test_inv, y_pred_inv) print(fMSE: {mse:.4f}) print(fMAE: {mae:.4f}) print(fR2: {r2:.4f})各指標含義MSE均方誤差預測值與真實值差值的平方的平均值。MSE 對較大誤差更敏感適合關注極端偏差的場景。MAE平均絕對誤差預測值與真實值差值的絕對值的平均值。它直接反映平均誤差大小單位與真實值一致。R2決定系數(shù)表示模型解釋了目標變量多少方差。R2 越接近 1說明模型擬合效果越好R2 為 0 說明模型與直接預測平均值差不多R2 為負數(shù)說明模型效果比平均值預測還差。反歸一化這一步容易被忽略。因為訓練時對y做了MinMaxScaler所以模型輸出的是歸一化后的值。要計算真實尺度下的誤差指標必須先調(diào)用scaler_y.inverse_transform還原。5.4 可視化預測曲線為了更直觀地觀察預測效果可以把測試集上的真實值和預測值畫成曲線。import matplotlib.pyplot as plt plt.figure(figsize(12, 4)) plt.plot(y_test_inv[:200], labelTrue, linewidth2) plt.plot(y_pred_inv[:200], labelPred, linewidth2) plt.legend() plt.title(CNN-GRU Regression Prediction Results) plt.xlabel(Sample Index) plt.ylabel(Target Value) plt.savefig(prediction_result.png, dpi150) plt.show()如果前 200 個測試點上兩條曲線整體趨勢一致說明模型已經(jīng)學到了基本的時序規(guī)律。6. 使用 SHAP 解釋模型6.1 SHAP 原理簡介SHAP 的核心思想是 Shapley 值。它把模型預測值拆解為“基線值 每個特征的貢獻值”?;€值通常是訓練集上預測值的平均值。對于一條樣本假設模型預測值為f(x)基線值為E[f(x)]那么有f(x) E[f(x)] sum(每個特征的SHAP值)當一個特征的 SHAP 值為正表示該特征把預測值向上推動SHAP 值為負表示把預測值向下拉低。SHAP 值的絕對值越大說明該特征對這條樣本的影響越強。6.2 DeepExplainer 使用方法對于 PyTorch 模型SHAP 庫提供了DeepExplainer。它適用于深度學習模型計算效率比KernelExplainer更高。# 文件路徑explain.py import shap import torch # 將模型切換到評估模式 model.eval() # 選擇一部分測試樣本作為背景數(shù)據(jù) background X_test_t[:100] # 這里取少量測試樣本做解釋避免計算時間過長 X_explain X_test_t[:10] # 創(chuàng)建 DeepExplainer explainer shap.DeepExplainer(model, background) # 計算 SHAP 值 shap_values explainer.shap_values(X_explain)注意兩點background是背景樣本主要用來估計基線值。數(shù)量不一定要很多50 到 100 條通常就夠用但需要覆蓋訓練集中比較典型的特征分布。shap_values在DeepExplainer中通常返回一個列表。因為模型輸出維度是 1所以我們要看的是shap_values[0]。shap_values[0]的形狀與輸入數(shù)據(jù)一致也就是(樣本數(shù), 時間步數(shù), 特征數(shù))這意味著 SHAP 給出的不僅是“哪個原始特征重要”還包括“哪個時間步上的哪個特征重要”。這比普通表格數(shù)據(jù)回歸的解釋細節(jié)更豐富。6.3 特征重要性可視化如果我們只關心原始特征的整體重要性可以把所有時間步的 SHAP 絕對值求和。import numpy as np # shap_values[0] 形狀: (10, window_size, n_features) shap_values_0 np.array(shap_values[0]) # 對所有測試樣本和時間步求和得到每個原始特征的貢獻 feature_names [feature1, feature2, feature3, feature4] importance np.abs(shap_values_0).sum(axis(0, 1)) # (n_features,) for name, imp in zip(feature_names, importance): print(f{name}: {imp:.4f}) # 排序后可視化 sorted_idx np.argsort(importance)[::-1] plt.figure(figsize(8, 4)) plt.bar([feature_names[i] for i in sorted_idx], importance[sorted_idx]) plt.title(Feature Importance by SHAP) plt.xlabel(Feature) plt.ylabel(Mean |SHAP|) plt.tight_layout() plt.savefig(shap_feature_importance.png, dpi150) plt.show()在這個模擬數(shù)據(jù)里理論上feature1對目標值影響最大因為它的系數(shù)是 2.5。如果 SHAP 結果也顯示feature1的重要性最高說明模型學到的關系和數(shù)據(jù)生成邏輯基本一致。6.4 蜜蜂圖與依賴圖SHAP 庫自帶的summary_plot可以畫出“蜜蜂圖”既能反映特征重要性也能反映特征取值與 SHAP 值的正負關系。由于我們的輸入是三維的滑窗數(shù)據(jù)直接傳入原始X_explain會讓summary_plot難以解釋。為了方便展示我們可以把三維數(shù)據(jù)展平成二維并生成對應的扁平特征名。# 將 (10, window_size, n_features) 展平為 (10, window_size * n_features) X_flat X_explain.numpy().reshape(X_explain.shape[0], -1) # 生成扁平特征名 flat_names [] for t in range(X_explain.shape[1]): for f in feature_names: flat_names.append(ft{t}_{f}) shap_values_flat shap_values_0.reshape(shap_values_0.shape[0], -1) shap.summary_plot(shap_values_flat, X_flat, feature_namesflat_names, showFalse) plt.tight_layout() plt.savefig(shap_summary_plot.png, dpi150) plt.show()蜜蜂圖怎么看橫軸是 SHAP 值。某個點落在正半軸說明該樣本在這個特征上的取值讓預測值升高落在負半軸說明降低。點的顏色表示該特征在當前樣本中的實際大小顏色越紅表示數(shù)值越大顏色越藍表示數(shù)值越小。特征按重要性從上到下排列越靠上越重要。如果你只關心第一個時間步的特征也可以單獨取出對應切片# 只看第一個時間步 shap_summary_first_timestep shap_values_0[:, 0, :] X_first_timestep X_explain.numpy()[:, 0, :] shap.summary_plot(shap_summary_first_timestep, X_first_timestep, feature_namesfeature_names, showFalse) plt.tight_layout() plt.savefig(shap_summary_first_timestep.png, dpi150) plt.show()這種方式適合觀察“最近一個時間步”中哪些特征對預測影響最大。實際應用中你可以根據(jù)業(yè)務需求選擇查看某個時間步或全部時間步。6.5 為什么 SHAP 值要配合業(yè)務解讀SHAP 只能解釋“模型學到了什么”不能保證“真實的因果關系就是如此”。比如某個特征和預測值高度相關但它可能只是間接關聯(lián)而不是直接原因。所以做技術解釋時要把 SHAP 結果當作模型行為的證據(jù)之一而不是因果結論。7. 常見問題與排查思路在實際運行過程中經(jīng)常遇到下面幾個問題。問題現(xiàn)象常見原因解決思路模型訓練 loss 不下降數(shù)據(jù)未歸一化或學習率過大/過小檢查特征和目標值是否做了歸一化嘗試 lr0.001 或 0.0001測試集 R2 很低甚至為負訓練集和測試集數(shù)據(jù)分布差異過大或滑窗窗口太小檢查切分方式增大 window_size檢查數(shù)據(jù)是否存在強非平穩(wěn)性Conv1d 維度不匹配輸入形狀不是(batch, channels, seq_len)在進入卷積前用x.permute(0, 2, 1)調(diào)整維度MaxPool1d 后序列長度異常window_size為奇數(shù)調(diào)整窗口為偶數(shù)或不使用池化層SHAP 計算非常慢背景數(shù)據(jù)過多或者解釋樣本數(shù)量過大減小 background 數(shù)量比如 50 條減小 X_explain 數(shù)量DeepExplainer 報錯模型不在 eval 模式或數(shù)據(jù)類型不是 FloatTensor調(diào)用model.eval()確認輸入 tensor 使用torch.float32預測值始終接近某個常數(shù)模型欠擬合或者目標值分布非常集中增加訓練輪數(shù)調(diào)整隱藏層維度檢查數(shù)據(jù)生成邏輯下面單獨講一個高頻問題訓練時 loss 很低測試時 loss 很高。這在回歸預測中通常表示過擬合。常見解決辦法是增加訓練數(shù)據(jù)量減小模型復雜度比如減少 GRU 隱藏層維度加入 Dropout并在模型定義時對 GRU 多層場景設置dropout引入早停機制當測試 loss 連續(xù)若干輪不再下降時停止訓練。8. 最佳實踐與工程建議8.1 時間順序切分避免數(shù)據(jù)泄漏處理時序數(shù)據(jù)時不能直接使用train_test_split(random_state42)隨機打亂。應該按照時間順序劃分訓練集、驗證集和測試集并且驗證集和測試集都必須是訓練集之后的時間段。這樣才能真實模擬模型在“未來”數(shù)據(jù)上的表現(xiàn)。8.2 歸一化參數(shù)只能來自訓練集標準化的核心原則是scaler只能fit在訓練集上然后transform訓練集、驗證集和測試集。如果對整個數(shù)據(jù)集一起fit測試集的信息就會間接進入訓練過程導致評估結果偏樂觀。8.3 固定隨機種子深度學習模型帶有隨機性比如權重初始化、數(shù)據(jù)加載順序等。在實驗階段建議統(tǒng)一設置隨機種子import random import numpy as np import torch random.seed(42) np.random.seed(42) torch.manual_seed(42)如果使用 CUDA還需要設置if torch.cuda.is_available(): torch.cuda.manual_seed_all(42)這樣才能保證多次實驗的結果可比較。8.4 模型保存與加載訓練完成后可以用torch.save保存模型參數(shù)torch.save(model.state_dict(), cnn_gru_model.pth)加載時先實例化同一個模型再load_state_dictmodel CNNGRU(n_featuresX_train.shape[2], hidden_size64) model.load_state_dict(torch.load(cnn_gru_model.pth)) model.eval()注意這里保存的是模型參數(shù)不包含模型結構。如果你換了一臺機器運行需要保證model.py中的CNNGRU類定義一致。8.5 SHAP 解釋的工程化落地在業(yè)務系統(tǒng)中如果每次預測都要重新計算 SHAP開銷會比較大。你可以把測試集上的 SHAP 特征重要性結果保存下來作為模型的解釋報告也可以在模型服務層預留一個“解釋接口”只在需要分析特定樣例時才調(diào)用 SHAP。8.6 超參數(shù)調(diào)整建議CNN-GRU 中比較關鍵的超參數(shù)包括卷積核大小用于控制局部感受野一般取 3、5、7卷積輸出通道數(shù)控制特征抽象能力常見取值 32、64GRU 隱藏層維度控制時序記憶容量常見取值 32、64、128學習率一般從 0.001 開始訓練不收斂時降低到 0.0005 或 0.0001Batch Size根據(jù)顯存大小和數(shù)據(jù)量調(diào)整常見取值 32、64、128。建議先用小規(guī)模的模型和少量數(shù)據(jù)跑通流程再逐步擴大參數(shù)。這樣能更快定位問題。9. 總結與學習路線這篇文章圍繞CNN-GRU 回歸預測整理了一套完整的代碼實踐使用 CNN 提取局部特征使用 GRU 建模時序依賴使用滑窗和歸一化處理回歸預測數(shù)據(jù)自定義CNNGRU模型完成訓練和評估使用 MSE、MAE、R2 三個指標評估效果使用 SHAP 值的DeepExplainer計算特征貢獻并繪制特征重要性圖和蜜蜂圖。如果你還想繼續(xù)深挖可以從以下幾個方向入手嘗試用Seq2Seq Attention結構做多步回歸預測在 SHAP 的基礎上加入dependence_plot依賴圖分析單個特征與預測結果的關系對比 CNN-LSTM 與 CNN-GRU 在當前數(shù)據(jù)上的效果差異在真實業(yè)務數(shù)據(jù)上測試不同窗口長度對預測效果的影響將模型封裝成 Flask 或 FastAPI 服務實現(xiàn)在線預測和解釋報告輸出。希望這篇文章能幫你跑通 CNN-GRU 回歸預測的完整鏈路也讓你在向業(yè)務方解釋模型時不再無從下手。你可以把代碼保存下來先在自己的數(shù)據(jù)集上試一遍再根據(jù)實際數(shù)據(jù)分布調(diào)整窗口大小和模型參數(shù)。如果遇到本地環(huán)境問題也歡迎對照第 7 節(jié)的排查表格逐步檢查。