別系統(tǒng)開發(fā)實(shí)戰(zhàn))
各位做視覺開發(fā)、深度學(xué)習(xí)落地或者桌面應(yīng)用集成的朋友應(yīng)該都有類似的體會(huì)模型訓(xùn)練出來只是第一步真正要交付給客戶或業(yè)務(wù)方使用還得給模型套上一個(gè)能看得見、摸得著的“外殼”。如果你正在做安全監(jiān)管、消防預(yù)警或室內(nèi)違規(guī)行為檢測相關(guān)的項(xiàng)目那么“吸煙檢測”大概率是需求清單里繞不開的一項(xiàng)。這篇文章我打算圍繞YOLOv8 PyQt5做一套完整的抽煙吸煙檢測識(shí)別系統(tǒng)從數(shù)據(jù)集準(zhǔn)備、模型訓(xùn)練、模型導(dǎo)出到 PyQt5 界面開發(fā)、攝像頭實(shí)時(shí)推理、多線程防卡頓再到常見報(bào)錯(cuò)排查一次性講清楚。代碼我會(huì)盡量給全方便你直接復(fù)制、修改、跑通。新手可以照著做一遍理解整個(gè)視覺檢測項(xiàng)目的完整鏈路有基礎(chǔ)的開發(fā)者可以直接跳到第四節(jié)看核心代碼和工程化細(xì)節(jié)。需要先說明的是本文不涉及任何環(huán)境代理相關(guān)配置只關(guān)注模型訓(xùn)練和桌面應(yīng)用集成本身安全合規(guī)的內(nèi)容也會(huì)在文末做一個(gè)提醒。1. 背景與核心概念1.1 什么是吸煙檢測識(shí)別系統(tǒng)吸煙檢測識(shí)別系統(tǒng)本質(zhì)上是“目標(biāo)檢測Object Detection”在特定場景下的應(yīng)用。它的任務(wù)是給定一張圖片或一段視頻流算法自動(dòng)找出畫面中是否存在“正在吸煙的人”并框出吸煙目標(biāo)的位置。與我們熟悉的通用目標(biāo)檢測比如檢測行人、車輛、貓狗不同吸煙檢測有兩個(gè)難點(diǎn)目標(biāo)小。香煙、打火機(jī)在畫面中占比很小尤其是監(jiān)控?cái)z像頭距離較遠(yuǎn)時(shí)模型很容易漏檢。語義歧義。手指夾著的白色細(xì)長物體、嘴邊的白色物體與香煙有一定相似性如果不結(jié)合手部姿態(tài)、臉部區(qū)域、煙霧特征很容易誤檢。所以在實(shí)際項(xiàng)目中很多人會(huì)把“吸煙檢測”拆分成多個(gè)子任務(wù)先做人臉檢測、再做人手檢測、然后再判斷手部區(qū)域是否有香煙特征也可以用端到端的目標(biāo)檢測模型直接標(biāo)注“smoking”這個(gè)類別。前者準(zhǔn)確率高但流程復(fù)雜后者簡單直接適合快速落地。本文采用第二種方案也就是用 YOLOv8 訓(xùn)練一個(gè)端到端的吸煙檢測模型。1.2 為什么選擇 YOLOv8YOLOYou Only Look Once系列是目前工業(yè)界應(yīng)用最廣的目標(biāo)檢測算法之一。它把目標(biāo)檢測當(dāng)作回歸問題一次前向推理就能同時(shí)輸出目標(biāo)類別和邊界框位置所以速度非???。YOLOv8 是 Ultralytics 公司在 2023 年初推出的版本相比之前的 YOLOv5主要改進(jìn)點(diǎn)包括C2f 模塊在 C3 模塊基礎(chǔ)上引入更多分支連接讓梯度流動(dòng)更豐富特征提取能力更強(qiáng)。Anchor-Free 檢測頭不再依賴預(yù)設(shè)的 anchor 框簡化了后處理邏輯對(duì)小目標(biāo)更友好。解耦檢測頭Decoupled Head分類分支和回歸分支分開收斂更快精度更高。更豐富的模型規(guī)格YOLOv8n / YOLOv8s / YOLOv8m / YOLOv8l / YOLOv8x從輕量級(jí)到高精度全覆蓋。對(duì)于吸煙檢測這種小目標(biāo)場景我一般建議先用 YOLOv8s 或 YOLOv8m 起步如果推理設(shè)備性能有限比如只有 CPU再考慮 YOLOv8n。本文示例默認(rèn)使用 YOLOv8s。1.3 為什么用 PyQt5 做界面PyQt5 是 Qt5 應(yīng)用框架的 Python 綁定常被用來開發(fā) Windows / Linux 桌面軟件。對(duì)于視覺檢測項(xiàng)目PyQt5 的優(yōu)勢(shì)在于控件豐富按鈕、標(biāo)簽、下拉框、表格、畫布等都很成熟能快速搭出專業(yè)界面。信號(hào)槽機(jī)制界面交互點(diǎn)擊按鈕、選擇文件和業(yè)務(wù)邏輯之間通過信號(hào)槽解耦代碼結(jié)構(gòu)清晰。與 OpenCV 配合方便OpenCV 讀到的圖像是numpy.ndarrayPyQt5 中可以很方便地轉(zhuǎn)換成QImage/QPixmap顯示在界面上。打包部署成熟配合 PyInstaller 可以打成 exe方便交付給沒有 Python 環(huán)境的客戶。簡單來說YOLOv8 負(fù)責(zé)“看得見”PyQt5 負(fù)責(zé)“讓人看得見”。模型負(fù)責(zé)輸出坐標(biāo)和類別界面負(fù)責(zé)把結(jié)果呈現(xiàn)給用戶并提供交互入口。1.4 應(yīng)用場景工廠車間、倉庫、加油站等禁煙區(qū)域的安全監(jiān)控網(wǎng)吧、餐廳、候車室等公共場所的違規(guī)吸煙提醒家庭、宿舍場景的吸煙行為監(jiān)測森林防火中的人員吸煙行為識(shí)別配合紅外攝像頭2. 環(huán)境準(zhǔn)備與版本說明2.1 運(yùn)行環(huán)境本文以 Windows 10/11 為例代碼同樣適用于 Linux。硬件方面建議優(yōu)先使用 NVIDIA 顯卡GTX 1660Ti 及以上級(jí)別都能跑 YOLOv8s 訓(xùn)練顯存 6GB 以上比較從容。如果沒有獨(dú)立顯卡可以先用 CPU 訓(xùn)練小型模型做功能驗(yàn)證速度會(huì)慢很多但不影響理解流程。版本方面下面的組合是我目前穩(wěn)定使用的但版本更新較快你需要根據(jù)實(shí)際情況調(diào)整依賴庫參考版本說明Python3.8 - 3.11建議 3.9 或 3.10兼容性最好ultralytics8.x 最新穩(wěn)定版已集成 YOLOv8PyQt55.15.x穩(wěn)定版本opencv-python4.8 以上圖像處理torch2.x cu118 / cu121根據(jù) CUDA 版本選擇torchvision與 torch 對(duì)應(yīng)不要單獨(dú)亂裝numpy1.24.x左右避免與 torch 沖突2.2 安裝依賴建議新建一個(gè)虛擬環(huán)境避免把系統(tǒng) Python 環(huán)境搞亂。# 創(chuàng)建虛擬環(huán)境 conda create -n smoke_detect python3.9 -y conda activate smoke_detect # 安裝 PyTorch以 CUDA 11.8 為例CPU 版本請(qǐng)去 PyTorch 官網(wǎng)選對(duì)應(yīng)命令 pip install torch torchvision --index-url https://download.pytorch.org/whl/cu118 # 安裝 YOLOv8 及視覺相關(guān)庫 pip install ultralytics opencv-python # 安裝 PyQt5 pip install pyqt5 pyqt5-tools如果你在國內(nèi)網(wǎng)絡(luò)環(huán)境下安裝速度慢可以臨時(shí)切換為國內(nèi)鏡像源pip install ultralytics opencv-python -i https://pypi.tuna.tsinghua.edu.cn/simple2.3 驗(yàn)證安裝在 Python 交互環(huán)境或腳本中執(zhí)行import torch import ultralytics import cv2 from PyQt5.QtWidgets import QApplication print(torch:, torch.__version__) print(cuda available:, torch.cuda.is_available()) print(ultralytics:, ultralytics.__version__) print(opencv:, cv2.__version__)如果torch.cuda.is_available()返回False說明 PyTorch 沒有裝到 GPU 版本或者 CUDA 驅(qū)動(dòng)不對(duì)。后面第三節(jié)會(huì)單獨(dú)講怎么排查。3. 核心原理拆解YOLOv8 網(wǎng)絡(luò)與 PyQt5 架構(gòu)3.1 YOLOv8 網(wǎng)絡(luò)結(jié)構(gòu)速覽YOLOv8 的整體結(jié)構(gòu)可以分成三部分Backbone骨干網(wǎng)絡(luò)負(fù)責(zé)提取圖像特征。YOLOv8s 使用的是改進(jìn)版 CSPDarknet核心模塊是 C2f。相比 YOLOv5 的 C3C2f 把輸入特征圖分成兩支經(jīng)過多個(gè) Bottleneck 后再拼接最后經(jīng)過卷積調(diào)整通道數(shù)。這樣做的目的是增加梯度流的分支數(shù)量讓淺層特征和深層特征融合得更好對(duì)小目標(biāo)檢測有幫助。Neck頸部網(wǎng)絡(luò)負(fù)責(zé)多尺度特征融合。YOLOv8 使用 PAN-FPN 結(jié)構(gòu)簡單理解就是把 Backbone 輸出的三個(gè)不同尺寸特征圖大特征圖保留細(xì)節(jié)適合檢測小目標(biāo)小特征圖語義強(qiáng)適合檢測大目標(biāo)反復(fù)做上采樣、下采樣和橫向拼接讓每一層都具備多尺度語義信息。吸煙檢測中香煙目標(biāo)偏向小目標(biāo)所以我們需要特別關(guān)注 P3 層也就是較大尺寸的特征圖的輸出是否被充分利用。Head檢測頭YOLOv8 采用 Anchor-Free 解耦頭。每個(gè)檢測位置直接預(yù)測“中心點(diǎn)是否為目標(biāo)”和“邊界框的四邊距離”然后通過 NMS非極大值抑制過濾掉重疊框。由于沒有 anchor 數(shù)量、尺寸這些超參數(shù)訓(xùn)練時(shí)對(duì)數(shù)據(jù)集的適應(yīng)能力更強(qiáng)。如果你打開 Ultralytics 的源碼會(huì)發(fā)現(xiàn)網(wǎng)絡(luò)結(jié)構(gòu)是在ultralytics/nn/modules/head.py中定義的但實(shí)際使用時(shí)我們通常不需要手動(dòng)搭建網(wǎng)絡(luò)直接調(diào)用 YOLO 類即可。3.2 訓(xùn)練流程與關(guān)鍵參數(shù)說明YOLOv8 訓(xùn)練最核心的代碼只有幾行from ultralytics import YOLO model YOLO(yolov8s.pt) # 加載預(yù)訓(xùn)練權(quán)重 model.train(datasmoke.yaml, epochs100, imgsz640, batch16)但這里有幾個(gè)參數(shù)值得展開說明epochs完整遍歷數(shù)據(jù)集的次數(shù)。抽煙檢測數(shù)據(jù)集如果比較小幾百張到兩千張100 到 150 輪足夠如果數(shù)據(jù)集很大可以適當(dāng)減少。觀察訓(xùn)練日志當(dāng)驗(yàn)證集的 mAP 不再明顯上漲時(shí)就可以提前停止。imgsz輸入圖片尺寸。默認(rèn) 640如果香煙目標(biāo)非常小可以嘗試 960 甚至 1280但顯存占用會(huì)成倍增加。batch批大小。訓(xùn)練時(shí)受顯存限制YOLOv8s 640 輸入 batch16大概需要 8GB 左右顯存。如果顯存不足優(yōu)先把 batch 降到 8 或 4而不是直接換小模型。device指定訓(xùn)練設(shè)備例如device0表示第一張顯卡devicecpu用 CPU。YOLOv8 會(huì)自動(dòng)保存訓(xùn)練過程中的損失曲線、驗(yàn)證集檢測結(jié)果、混淆矩陣等輸出路徑在runs/detect/train/目錄下。3.3 PyQt5 界面架構(gòu)與多線程必要性PyQt5 的界面開發(fā)遵循三個(gè)基本概念信號(hào)Signal與槽Slot控件發(fā)生事件如按鈕點(diǎn)擊時(shí)發(fā)出信號(hào)槽函數(shù)響應(yīng)信號(hào)。比如button.clicked.connect(self.on_click)點(diǎn)擊按鈕后自動(dòng)調(diào)用on_click方法。事件循環(huán)app.exec_()啟動(dòng) Qt 事件循環(huán)程序在這里持續(xù)監(jiān)聽用戶操作。線程模型PyQt5 中UI 更新只能在主線程進(jìn)行。如果你的推理過程直接寫在主線程一旦模型推理耗時(shí)較長界面就會(huì)“卡死”窗口無法拖動(dòng)、按鈕無法點(diǎn)擊用戶體驗(yàn)很差。所以對(duì)于攝像頭實(shí)時(shí)檢測和視頻文件檢測我們通常把“讀取幀 模型推理”放到QThread子線程中完成然后通過信號(hào)把處理結(jié)果傳回主線程更新界面。Danger不要在子線程中直接調(diào)用QLabel.setText()、QLabel.setPixmap()等 UI 更新操作會(huì)導(dǎo)致崩潰或顯示異常。3.4 數(shù)據(jù)集準(zhǔn)備工作訓(xùn)練一個(gè)端到端的吸煙檢測模型最少需要幾百張到兩三千張標(biāo)注圖片。數(shù)據(jù)來源有兩個(gè)方向公開數(shù)據(jù)集GitHub、Kaggle 上可以找到 SMOKE 相關(guān)的目標(biāo)檢測數(shù)據(jù)集比如“Smoke Detection Dataset”。有些數(shù)據(jù)集包含 bounding box 標(biāo)注格式可能是 PASCAL VOCxml或 YOLOtxt。自行采集標(biāo)注從監(jiān)控視頻中抽幀篩選出包含吸煙行為的圖片使用 LabelImg 或 Label Studio 標(biāo)注標(biāo)注類別名統(tǒng)一為smoking。數(shù)據(jù)集的目錄結(jié)構(gòu)建議如下smoke_dataset/ ├── images/ │ ├── train/ # 訓(xùn)練集圖片 │ └── val/ # 驗(yàn)證集圖片 ├── labels/ │ ├── train/ # 對(duì)應(yīng)的 yolo 格式 txt 標(biāo)注 │ └── val/ └── smoke.yaml # 數(shù)據(jù)集配置文件其中smoke.yaml內(nèi)容如下# 文件路徑smoke_dataset/smoke.yaml path: D:/projects/smoke_dataset # 數(shù)據(jù)集根目錄Windows 注意斜杠方向 train: images/train val: images/val nc: 1 # 類別數(shù)量 names: [smoking] # 類別名稱YOLO 格式的標(biāo)注 txt 每一行代表一個(gè)目標(biāo)類別id 中心點(diǎn)x 中心點(diǎn)y 寬度 高度坐標(biāo)值都做了歸一化范圍在 0 到 1 之間。例如0 0.512345 0.432101 0.123456 0.234567表示這幅圖中有一個(gè)“smoking”目標(biāo)中心點(diǎn)在圖片的相對(duì)位置 (0.512, 0.432)寬高相對(duì)尺寸為 (0.123, 0.235)。4. 完整實(shí)戰(zhàn)案例YOLOv8PyQt5 抽煙吸煙檢測系統(tǒng)接下來進(jìn)入到文章最核心的部分。我會(huì)先帶你完成 YOLOv8 模型訓(xùn)練與導(dǎo)出再寫一個(gè)完整的 PyQt5 可視化檢測界面支持圖片檢測、視頻文件檢測和攝像頭實(shí)時(shí)檢測。4.1 創(chuàng)建項(xiàng)目結(jié)構(gòu)先新建一個(gè)項(xiàng)目文件夾名字可以叫smoke_detector。目錄結(jié)構(gòu)如下smoke_detector/ ├── train.py # 訓(xùn)練腳本 ├── detect.py # PyQt5 可視化檢測主程序 ├── smoke_dataset/ │ ├── images/ │ ├── labels/ │ └── smoke.yaml └── runs/ └── detect/ └── train/ # 訓(xùn)練輸出模型 └── weights/ └── best.pt4.2 訓(xùn)練 YOLOv8 模型在train.py中寫入# 文件路徑smoke_detector/train.py from ultralytics import YOLO def main(): # 加載預(yù)訓(xùn)練權(quán)重基于 COCO 數(shù)據(jù)集預(yù)訓(xùn)練 model YOLO(yolov8s.pt) # 開始訓(xùn)練 model.train( datasmoke_dataset/smoke.yaml, epochs150, imgsz640, batch16, device0, workers4, patience30, # 30輪沒有提升則提前停止 projectruns/detect, nametrain_smoke, exist_okTrue, ) if __name__ __main__: main()運(yùn)行python train.py訓(xùn)練結(jié)束后在runs/detect/train_smoke/weights/下會(huì)生成兩個(gè)文件best.pt驗(yàn)證集上效果最好的權(quán)重部署時(shí)優(yōu)先使用這個(gè)last.pt最后一輪的權(quán)重適合斷點(diǎn)續(xù)訓(xùn)你還可以在訓(xùn)練過程中打開runs/detect/train_smoke/val_batch0_pred.jpg這類圖片直觀查看模型在驗(yàn)證集上的檢測效果。4.3 導(dǎo)出模型為 ONNX可選如果后續(xù)需要做 C 部署、RK3588 等邊緣設(shè)備部署或者其他框架集成可以先把 PyTorch 權(quán)重導(dǎo)出為 ONNX 格式。from ultralytics import YOLO model YOLO(runs/detect/train_smoke/weights/best.pt) model.export(formatonnx, imgsz640, opset12)導(dǎo)出后在相同目錄下會(huì)生成best.onnx。這里提醒一下ONNX 導(dǎo)出后建議用onnxruntime測試一遍輸出形狀確保與 PyTorch 模型的輸出一致。不過本文的 PyQt5 系統(tǒng)直接使用.pt權(quán)重不需要導(dǎo)出。4.4 編寫 PyQt5 檢測界面下面給出一個(gè)完整可運(yùn)行的detect.py功能包括選擇圖片文件在界面上顯示檢測結(jié)果選擇視頻文件逐幀檢測并實(shí)時(shí)顯示打開攝像頭實(shí)時(shí)檢測顯示當(dāng)前檢測到的吸煙目標(biāo)數(shù)量支持調(diào)整置信度閾值先導(dǎo)入依賴# 文件路徑smoke_detector/detect.py import sys import cv2 import numpy as np from PyQt5.QtWidgets import (QApplication, QMainWindow, QWidget, QLabel, QPushButton, QVBoxLayout, QHBoxLayout, QFileDialog, QSlider, QSpinBox, QComboBox, QMessageBox) from PyQt5.QtCore import Qt, QThread, pyqtSignal, QTimer from PyQt5.QtGui import QImage, QPixmap from ultralytics import YOLO4.4.1 推理線程類視頻和攝像頭檢測需要單獨(dú)開線程避免界面卡頓。定義如下class VideoThread(QThread): frame_signal pyqtSignal(np.ndarray, int) # 傳遞圖像和檢測數(shù)量 error_signal pyqtSignal(str) def __init__(self, model, source, conf_thres0.25): super().__init__() self.model model self.source source self.conf_thres conf_thres self.running True def run(self): cap cv2.VideoCapture(self.source) if not cap.isOpened(): self.error_signal.emit(無法打開視頻或攝像頭源: {}.format(self.source)) return while self.running: ret, frame cap.read() if not ret: break # 模型推理 results self.model.predict(sourceframe, confself.conf_thres, verboseFalse) # 在圖像上繪制檢測框 annotated results[0].plot() # 返回標(biāo)注后的 BGR 圖像 # 統(tǒng)計(jì)檢測數(shù)量 count len(results[0].boxes) # 發(fā)送到主線程 self.frame_signal.emit(annotated, count) cap.release() def stop(self): self.running False這里有幾個(gè)要點(diǎn)需要說明results[0].plot()會(huì)直接在原圖上繪制檢測框、類別名和置信度返回 BGR 格式的 numpy 數(shù)組。frame_signal攜帶了圖像和當(dāng)前幀的檢測數(shù)量因?yàn)?PyQt 信號(hào)可以攜帶多個(gè)參數(shù)。線程通過running標(biāo)志位控制循環(huán)退出關(guān)閉窗口或切換檢測源時(shí)記得調(diào)用stop()。4.4.2 主窗口類接著定義主界面class SmokeDetectorWindow(QMainWindow): def __init__(self): super().__init__() self.setWindowTitle(YOLOv8 PyQt5 抽煙吸煙檢測識(shí)別系統(tǒng)) self.resize(960, 640) # 加載模型 try: self.model YOLO(runs/detect/train_smoke/weights/best.pt) except Exception as e: QMessageBox.critical(self, 模型加載失敗, str(e)) sys.exit(1) self.video_thread None self.conf_thres 0.25 self.init_ui() def init_ui(self): # 中央控件 central_widget QWidget() self.setCentralWidget(central_widget) # 主布局左側(cè)控制區(qū) 右側(cè)顯示區(qū) main_layout QHBoxLayout(central_widget) # 左側(cè)控制面板 control_panel QVBoxLayout() self.btn_image QPushButton(選擇圖片檢測) self.btn_video QPushButton(選擇視頻檢測) self.btn_camera QPushButton(打開攝像頭) self.btn_stop QPushButton(停止) self.btn_stop.setEnabled(False) # 置信度設(shè)置 conf_label QLabel(置信度閾值) self.conf_slider QSlider(Qt.Horizontal) self.conf_slider.setRange(10, 90) self.conf_slider.setValue(25) self.conf_value QLabel(0.25) self.conf_slider.valueChanged.connect(self.on_conf_changed) control_panel.addWidget(self.btn_image) control_panel.addWidget(self.btn_video) control_panel.addWidget(self.btn_camera) control_panel.addWidget(self.btn_stop) control_panel.addWidget(conf_label) control_panel.addWidget(self.conf_slider) control_panel.addWidget(self.conf_value) control_panel.addStretch() # 右側(cè)顯示區(qū) self.label_image QLabel(請(qǐng)選擇圖片、視頻或打開攝像頭) self.label_image.setAlignment(Qt.AlignCenter) self.label_image.setMinimumSize(800, 600) self.label_image.setStyleSheet(border: 1px solid #cccccc; background-color: #f8f8f8;) main_layout.addLayout(control_panel, 1) main_layout.addWidget(self.label_image, 4) # 頂部狀態(tài)欄顯示檢測數(shù)量 self.statusBar().showMessage(就緒) # 綁定按鈕事件 self.btn_image.clicked.connect(self.open_image) self.btn_video.clicked.connect(self.open_video) self.btn_camera.clicked.connect(self.open_camera) self.btn_stop.clicked.connect(self.stop_detection) def on_conf_changed(self, value): self.conf_thres value / 100.0 self.conf_value.setText({:.2f}.format(self.conf_thres))4.4.3 圖片檢測邏輯圖片檢測不需要多線程直接在按鈕回調(diào)里處理即可def open_image(self): file_path, _ QFileDialog.getOpenFileName( self, 選擇圖片, , 圖片文件 (*.jpg *.jpeg *.png *.bmp);;所有文件 (*) ) if not file_path: return # 停止視頻/攝像頭線程 self.stop_detection() image cv2.imread(file_path) if image is None: QMessageBox.warning(self, 提示, 圖片讀取失敗: {}.format(file_path)) return results self.model.predict(sourceimage, confself.conf_thres, verboseFalse) annotated results[0].plot() count len(results[0].boxes) self.show_image(annotated) self.statusBar().showMessage(檢測到吸煙目標(biāo)數(shù)量: {}置信度閾值: {:.2f}.format(count, self.conf_thres)) def show_image(self, img_bgr): # BGR - RGB - QImage rgb_image cv2.cvtColor(img_bgr, cv2.COLOR_BGR2RGB) h, w, ch rgb_image.shape bytes_per_line ch * w q_image QImage(rgb_image.data, w, h, bytes_per_line, QImage.Format_RGB888) # 縮放顯示保持長寬比 pixmap QPixmap.fromImage(q_image) pixmap pixmap.scaled(self.label_image.size(), Qt.KeepAspectRatio, Qt.SmoothTransformation) self.label_image.setPixmap(pixmap)4.4.4 視頻和攝像頭檢測邏輯視頻和攝像頭都是使用VideoThread區(qū)別只是source的值def open_video(self): file_path, _ QFileDialog.getOpenFileName( self, 選擇視頻, , 視頻文件 (*.mp4 *.avi *.mov *.mkv);;所有文件 (*) ) if not file_path: return self.start_video_thread(sourcefile_path) def open_camera(self): # 0 表示默認(rèn)攝像頭如果有多個(gè)攝像頭可以修改索引 self.start_video_thread(source0) def start_video_thread(self, source): self.stop_detection() self.video_thread VideoThread(self.model, source, self.conf_thres) self.video_thread.frame_signal.connect(self.on_frame_received) self.video_thread.error_signal.connect(self.on_thread_error) self.video_thread.start() self.btn_stop.setEnabled(True) self.statusBar().showMessage(檢測中...) def on_frame_received(self, frame, count): self.show_image(frame) self.statusBar().showMessage(實(shí)時(shí)吸煙檢測中當(dāng)前檢測數(shù)量: {}.format(count)) def on_thread_error(self, msg): self.btn_stop.setEnabled(False) QMessageBox.warning(self, 錯(cuò)誤, msg) def stop_detection(self): if self.video_thread is not None: self.video_thread.stop() self.video_thread.wait() self.video_thread None self.btn_stop.setEnabled(False)4.4.5 程序入口最后是主函數(shù)def main(): app QApplication(sys.argv) window SmokeDetectorWindow() window.show() sys.exit(app.exec_()) if __name__ __main__: main()4.5 運(yùn)行與驗(yàn)證在項(xiàng)目根目錄執(zhí)行python detect.py預(yù)期效果點(diǎn)擊“選擇圖片檢測”選擇一張包含吸煙行為的圖片右側(cè)區(qū)域顯示帶檢測框的結(jié)果狀態(tài)欄顯示檢測數(shù)量。點(diǎn)擊“選擇視頻檢測”選擇一段監(jiān)控視頻視頻畫面逐幀顯示檢測框?qū)崟r(shí)繪制窗口不卡頓。點(diǎn)擊“打開攝像頭”攝像頭畫面實(shí)時(shí)顯示移動(dòng)攝像頭對(duì)準(zhǔn)吸煙行為能實(shí)時(shí)框出目標(biāo)。拖動(dòng)“置信度閾值”滑塊檢測框的敏感度會(huì)變化閾值越高漏檢越多誤檢越少。如果你在圖片檢測時(shí)看到結(jié)果說明整個(gè)流程已經(jīng)跑通。5. 常見問題與排查思路以下是我在實(shí)際運(yùn)行中遇到較多的問題按“現(xiàn)象 → 原因 → 解決方案”整理成表格方便你快速定位。問題現(xiàn)象常見原因解決思路訓(xùn)練時(shí)報(bào)錯(cuò) CUDA out of memory顯存不足降低 batch 到 4 或 2降低 imgsz 到 640 以下或換 YOLOv8n 模型torch.cuda.is_available() 返回 FalsePyTorch 裝成了 CPU 版本或顯卡驅(qū)動(dòng)過舊使用nvidia-smi查看 CUDA 版本卸載后重裝對(duì)應(yīng)版本的 PyTorchPyQt5 窗口閃退或卡死推理放在主線程或子線程直接更新 UI把推理放到 QThread用信號(hào)槽傳回主線程更新 UI無法打開視頻或攝像頭源攝像頭被其他程序占用視頻路徑包含中文且 OpenCV 無法識(shí)別關(guān)閉其他攝像頭占用程序路徑盡量不要包含中文檢測效果不好漏檢多數(shù)據(jù)集太小、標(biāo)注質(zhì)量差、置信度閾值太高增加數(shù)據(jù)量檢查標(biāo)注框是否貼合目標(biāo)適當(dāng)降低置信度閾值檢測框抖動(dòng)明顯閾值過低導(dǎo)致誤檢或模型未收斂提高置信度閾值訓(xùn)練更多 epoch或使用 NMS 參數(shù)調(diào)節(jié)PyQt5 界面顯示圖片顏色異常OpenCV 是 BGR 格式QLabel 顯示需要 RGB使用cv2.cvtColor(img, cv2.COLOR_BGR2RGB)轉(zhuǎn)換模型加載后推理速度很慢使用了 CPU 推理檢查torch.cuda.is_available()確保模型在 GPU 上運(yùn)行best.onnx導(dǎo)出后推理結(jié)果不一致導(dǎo)出時(shí) opset 版本或動(dòng)態(tài)軸設(shè)置問題使用 YOLO 官方model.export()默認(rèn)參數(shù)或指定dynamicTrue驗(yàn)證再補(bǔ)充一個(gè)比較隱蔽的問題在 PyQt5 中使用 OpenCV 讀取視頻時(shí)如果視頻文件路徑包含中文字符在某些版本的 OpenCV 中會(huì)直接返回False。推薦的做法是先把文件復(fù)制到英文路徑或者使用imdecode方式讀取。import cv2 import numpy as np def read_image_unicode(path): data np.fromfile(path, dtypenp.uint8) img cv2.imdecode(data, cv2.IMREAD_COLOR) return img6. 最佳實(shí)踐與工程建議6.1 數(shù)據(jù)集層面樣本平衡負(fù)樣本沒有人吸煙、沒有人出現(xiàn)的空?qǐng)鼍耙惨尤胗?xùn)練集讓模型知道“沒有目標(biāo)時(shí)不應(yīng)該輸出框”。一般建議正負(fù)樣本比例在 3:1 到 5:1 之間。數(shù)據(jù)增強(qiáng)YOLOv8 默認(rèn)開啟了 mosaic、隨機(jī)翻轉(zhuǎn)、色彩擾動(dòng)等增強(qiáng)策略對(duì)提升模型泛化能力很有幫助。如果訓(xùn)練數(shù)據(jù)較少可以手動(dòng)增加亮度變化、模糊、雨霧等模擬監(jiān)控場景。標(biāo)注邊界標(biāo)注時(shí)不要只畫香煙本體最好把“手持香煙的手部區(qū)域”和“嘴部區(qū)域”整體框進(jìn)去目標(biāo)上下文信息對(duì)檢測更有利。對(duì)于正在點(diǎn)煙、拿著煙、抽煙、彈煙灰等不同姿態(tài)都要覆蓋。6.2 訓(xùn)練與推理層面多尺度訓(xùn)練如果香煙是小目標(biāo)可以在訓(xùn)練時(shí)開啟multi_scaleTrue讓模型接觸多種輸入尺寸增強(qiáng)尺度魯棒性。置信度閾值選擇在工廠場景中誤報(bào)代價(jià)較高建議閾值設(shè)置在 0.35 到 0.5在消防預(yù)警場景中漏報(bào)代價(jià)更高建議閾值設(shè)置在 0.15 到 0.25。模型量化如果部署到邊緣設(shè)備如 RK3588、Jetson Nano可以考慮將模型導(dǎo)出為 ONNX 并做 INT8 量化推理速度會(huì)有明顯提升但精度會(huì)有一定損失需要在實(shí)際數(shù)據(jù)上驗(yàn)證。6.3 PyQt5 工程層面UI 更新統(tǒng)一走信號(hào)槽主線程之外的任何線程都不要直接操作控件。攝像頭資源釋放關(guān)閉窗口時(shí)一定要調(diào)用video_thread.stop()和cap.release()否則攝像頭會(huì)被占用下次打開失敗。使用 QTimer 做定時(shí)刷新如果你的業(yè)務(wù)需要輪詢推理結(jié)果比如每 200ms 檢測一次可以用QTimer配合單幀檢測而不是開一個(gè)無限循環(huán)線程編寫更容易退出更安全。打包 exe使用 PyInstaller 打包時(shí)需要把best.pt和依賴的動(dòng)態(tài)庫一起打進(jìn)去建議用--add-data參數(shù)指定模型路徑。打包前先在一個(gè)干凈環(huán)境測試避免漏掉動(dòng)態(tài)庫導(dǎo)致 exe 在其他電腦上無法運(yùn)行。6.4 合規(guī)提醒吸煙檢測系統(tǒng)通常用于公共場所安全監(jiān)管。在實(shí)際部署前請(qǐng)確認(rèn)你的項(xiàng)目符合當(dāng)?shù)仉[私合規(guī)要求包括但不限于在監(jiān)控區(qū)域設(shè)置必要的提示標(biāo)識(shí)視頻數(shù)據(jù)存儲(chǔ)和訪問權(quán)限管理只保留業(yè)務(wù)必要的檢測結(jié)果日志避免過度采集作為技術(shù)開發(fā)者我們有責(zé)任確保系統(tǒng)只在合法授權(quán)的場景下使用。7. 總結(jié)與學(xué)習(xí)路線到這里你已經(jīng)完成了一套從訓(xùn)練到桌面落地的吸煙檢測識(shí)別系統(tǒng)?;仡櫼幌挛覀冏隽耸裁磾?shù)據(jù)處理整理數(shù)據(jù)集目錄編寫 YOLOv8 訓(xùn)練配置模型訓(xùn)練使用 YOLOv8s 訓(xùn)練自己的吸煙檢測權(quán)重并導(dǎo)出 best.pt界面開發(fā)用 PyQt5 搭建了圖片 / 視頻 / 攝像頭三種檢測入口多線程處理通過 QThread 避免界面卡頓信號(hào)槽傳遞檢測結(jié)果異常排查整理了顯存不足、路徑中文、UI 卡死等常見問題的解決辦法如果接下來你想繼續(xù)深入可以從這幾個(gè)方向選一個(gè)提升檢測精度收集更多真實(shí)監(jiān)控場景數(shù)據(jù)或加入注意力機(jī)制如 MHSA改進(jìn) YOLOv8 的 Neck專門強(qiáng)化小目標(biāo)特征。換用 YOLO11Ultralytics 后續(xù)版本中也有 YOLO11和 YOLOv8 相比在網(wǎng)絡(luò)結(jié)構(gòu)上又做了調(diào)整你可以用同樣的數(shù)據(jù)集對(duì)比一下兩者精度和速度。部署到邊緣設(shè)備把導(dǎo)出的 ONNX 模型部署到 RK3588 或其他嵌入式平臺(tái)走攝像頭 RTSP 拉流實(shí)現(xiàn)更低成本的節(jié)點(diǎn)部署。完善業(yè)務(wù)功能在 PyQt5 中加入檢測記錄查詢、截圖保存、告警彈窗、微信/短信通知等讓系統(tǒng)更接近可交付的產(chǎn)品。這篇文章提供的代碼是一個(gè)可運(yùn)行的最小閉環(huán)實(shí)際項(xiàng)目中你還需要根據(jù)自己的數(shù)據(jù)、設(shè)備和業(yè)務(wù)需求去調(diào)整。建議先跑通整套流程再針對(duì)薄弱環(huán)節(jié)優(yōu)化。如果你在復(fù)現(xiàn)過程中遇到文章里沒覆蓋到的問題歡迎在評(píng)論區(qū)描述你的報(bào)錯(cuò)信息、環(huán)境版本和操作步驟一起交流排查思路。也可以把文章收藏起來等用到的時(shí)候直接對(duì)照配置。