據(jù)集轉(zhuǎn)COCO格式:從數(shù)據(jù)解析到JSON生成的完整實(shí)踐)
簡介本資源是VisDrone數(shù)據(jù)集轉(zhuǎn)換為標(biāo)準(zhǔn)COCO格式的標(biāo)注文件包面向目標(biāo)檢測方向的算法工程師、計算機(jī)視覺學(xué)習(xí)者及YOLOX等主流框架使用者解決原始VisDrone數(shù)據(jù)集不兼容COCO訓(xùn)練流程的問題。壓縮包共4個文件10.18MB含2個標(biāo)準(zhǔn)COCO JSON標(biāo)注文件train2017/val2017、1個圖片路徑說明txt及1張下載指引jpg結(jié)構(gòu)精簡、開箱即用其中JSON文件已剔除訓(xùn)練集中10張存在標(biāo)注錯誤的樣本確保數(shù)據(jù)質(zhì)量可靠。目前已有764人學(xué)習(xí)下載所有標(biāo)注均經(jīng)YOLOX實(shí)測訓(xùn)練驗(yàn)證可直接用于模型訓(xùn)練與評估并支持導(dǎo)入百度EasyDL等平臺交叉驗(yàn)證格式合規(guī)性。用戶僅需從VisDrone官網(wǎng)下載對應(yīng)圖片并放入指定目錄即可無縫接入COCO工作流顯著降低數(shù)據(jù)預(yù)處理門檻與排錯成本。1. 項(xiàng)目概述從VisDrone到COCO一份JSON文件背后的數(shù)據(jù)工程如果你正在計算機(jī)視覺特別是目標(biāo)檢測領(lǐng)域摸爬滾打那么“VisDrone”和“COCO”這兩個名字對你來說一定不陌生。VisDrone是一個極具挑戰(zhàn)性的無人機(jī)視角數(shù)據(jù)集專注于交通場景下的車輛、行人檢測其視角獨(dú)特、目標(biāo)密集、尺度變化大是檢驗(yàn)算法魯棒性的絕佳試金石。而COCOCommon Objects in Context數(shù)據(jù)集憑借其統(tǒng)一的標(biāo)注格式和龐大的數(shù)據(jù)規(guī)模早已成為目標(biāo)檢測、實(shí)例分割等任務(wù)事實(shí)上的“標(biāo)準(zhǔn)答案”和“通用貨幣”。今天要聊的就是如何將VisDrone這座“富礦”的原始標(biāo)注熔煉成COCO格式的JSON文件。這看似只是一個格式轉(zhuǎn)換的“臟活累活”實(shí)則貫穿了數(shù)據(jù)理解、格式解析、腳本編寫和結(jié)果驗(yàn)證的完整數(shù)據(jù)工程流程。對于任何希望利用VisDrone數(shù)據(jù)在主流檢測框架如MMDetection、Detectron2、YOLO等上進(jìn)行訓(xùn)練和評估的研究者或工程師來說這都是必須跨越的一道坎。本文將帶你深入這個轉(zhuǎn)換過程的每一個細(xì)節(jié)不僅告訴你“怎么做”更會剖析“為什么這么做”并分享我踩過的坑和總結(jié)的經(jīng)驗(yàn)讓你能高效、準(zhǔn)確地得到那份關(guān)鍵的instances_train2017.json或instances_val2017.json。2. VisDrone與COCO兩種數(shù)據(jù)哲學(xué)的碰撞與融合2.1 VisDrone數(shù)據(jù)格式深度解析VisDrone數(shù)據(jù)集的標(biāo)注文件通常以.txt格式存儲每個圖像對應(yīng)一個同名的TXT文件。打開一個典型的標(biāo)注文件你會看到類似這樣的內(nèi)容54, 312, 22, 30, 1, 1, 1, 1 472, 210, 42, 22, 1, 1, 1, 1 ...每一行代表一個目標(biāo)實(shí)例包含8個用逗號分隔的數(shù)值。這8個字段的含義是VisDrone數(shù)據(jù)邏輯的核心邊界框左上角x坐標(biāo)目標(biāo)邊界框左上角在圖像中的列坐標(biāo)從0開始。邊界框左上角y坐標(biāo)目標(biāo)邊界框左上角在圖像中的行坐標(biāo)從0開始。邊界框?qū)挾饶繕?biāo)邊界框的像素寬度。邊界框高度目標(biāo)邊界框的像素高度。目標(biāo)類別一個整數(shù)代表目標(biāo)的類別。VisDrone定義了10個類別例如0忽略區(qū)域、1行人、2人、3自行車、4汽車、5貨車、6卡車、7三輪車、8遮陽三輪車、9巴士、10摩托車。特別注意類別0是“忽略區(qū)域”在訓(xùn)練時通常需要特殊處理或過濾掉。截斷標(biāo)志0表示目標(biāo)未被截斷1表示目標(biāo)被截斷部分在圖像外。這個信息對于評估很重要但在COCO格式中通常沒有直接對應(yīng)字段需要我們在轉(zhuǎn)換時決定是保留通過其他方式還是舍棄。遮擋標(biāo)志0表示無遮擋1表示被遮擋。同樣這是評估指標(biāo)的一部分COCO格式不直接支持。其他或稱為“可信度”在VisDrone的某些版本中這個字段可能表示標(biāo)注的可信度或其他屬性。注意VisDrone的類別索引是從1開始的行人1但我們在編程處理時尤其是在轉(zhuǎn)換為COCO格式其category_id通常從1開始連續(xù)時需要特別注意映射關(guān)系避免出現(xiàn)0類別忽略區(qū)域被錯誤引入。VisDrone的這種格式非常緊湊適合存儲但缺乏結(jié)構(gòu)化的描述信息比如整個數(shù)據(jù)集的類別列表、圖像信息等都是分散在各個TXT和圖像文件中的。2.2 COCO數(shù)據(jù)格式標(biāo)準(zhǔn)剖析COCO格式則是一種高度結(jié)構(gòu)化的JSON標(biāo)注格式。一個完整的COCO JSON文件如instances_train2017.json是一個龐大的字典主要包含以下幾個頂級字段info: 描述數(shù)據(jù)集的基本信息如年份、版本、描述等。licenses: 許可證信息列表。images: 一個列表列表中的每個元素是一個字典描述一張圖像的信息。這是關(guān)鍵包含id: 圖像的唯一ID整數(shù)。必須全局唯一。file_name: 圖像文件名如0000001.jpg。height: 圖像高度像素。width: 圖像寬度像素??蛇xlicense,coco_url,flickr_url等。annotations: 一個列表列表中的每個元素是一個字典描述一個目標(biāo)實(shí)例的標(biāo)注。這是核心包含id: 標(biāo)注的唯一ID整數(shù)。必須全局唯一。image_id: 該標(biāo)注所屬圖像的ID與images列表中的id對應(yīng)。category_id: 該實(shí)例的類別ID與categories列表中的id對應(yīng)。bbox: 邊界框格式為[x, y, width, height]其中(x, y)是邊界框左上角的坐標(biāo)。這里有一個關(guān)鍵點(diǎn)COCO的bbox是[x, y, width, height]而VisDrone的原始格式也是[x, y, width, height]看起來可以直接對應(yīng)。但必須驗(yàn)證坐標(biāo)原點(diǎn)是否一致通常都是左上角為原點(diǎn)并且要確保轉(zhuǎn)換后bbox的每個值都是浮點(diǎn)數(shù)在JSON中。area: 邊界框的面積width * height。這個字段很重要COCO評估API會用它來劃分小、中、大目標(biāo)。segmentation: 實(shí)例分割的多邊形點(diǎn)集對于檢測任務(wù)如果只有框可以設(shè)為空列表[]或[[]]。iscrowd: 是否為擁擠人群標(biāo)注0表示單個實(shí)例1表示一群實(shí)例crowd。VisDrone中通常都是0。categories: 一個列表列表中的每個元素是一個字典描述一個類別。包含id: 類別的唯一ID整數(shù)通常從1開始。name: 類別的名稱字符串如“person”。supercategory: 父類別字符串如“vehicle”可以為空。對比兩者你會發(fā)現(xiàn)核心的映射關(guān)系在于將VisDrone每行8個字段的文本拆解并填充到COCO JSON的images、annotations和categories這三個核心結(jié)構(gòu)中。同時我們需要為整個數(shù)據(jù)集生成info和licenses可以簡單填寫并確保所有ID的唯一性和關(guān)聯(lián)的正確性。3. 轉(zhuǎn)換腳本的核心設(shè)計與實(shí)現(xiàn)要點(diǎn)理解了兩種格式我們就可以開始設(shè)計轉(zhuǎn)換腳本。我將使用Python進(jìn)行演示因?yàn)樗胸S富的庫如json,os,PIL/opencv來處理文件和圖像。3.1 整體轉(zhuǎn)換流程設(shè)計一個健壯的轉(zhuǎn)換流程應(yīng)該包含以下步驟我將其繪制成一個清晰的邏輯流程圖來展示flowchart TD A[開始轉(zhuǎn)換流程] -- B[步驟1: 初始化COCO數(shù)據(jù)結(jié)構(gòu)] B -- C[步驟2: 定義類別映射brVisDrone - COCO] C -- D[步驟3: 遍歷VisDrone圖像文件夾] D -- E{對于每張圖片} E -- F[步驟4: 讀取圖像尺寸brPIL/OpenCV] F -- G[步驟5: 構(gòu)建image信息字典brid, file_name, height, width] G -- H[步驟6: 查找對應(yīng)標(biāo)注TXT文件] H -- I{文件存在?} I -- 是 -- J[步驟7: 逐行解析TXT標(biāo)注] I -- 否 -- K[步驟8: 跳過無標(biāo)注圖像] J -- L{對于每個標(biāo)注行} L -- M[步驟9: 解析8個字段] M -- N[步驟10: 過濾無效標(biāo)注br如忽略區(qū)域、無效框] N -- O[步驟11: 映射類別ID] O -- P[步驟12: 構(gòu)建annotation字典brid, image_id, category_id, bbox, area, iscrowd] P -- Q[步驟13: 添加到annotations列表] Q -- R[步驟14: 將image信息添加到images列表] R -- S[步驟15: 繼續(xù)處理下一張圖片] K -- S S -- D D -- T[步驟16: 所有圖片處理完畢] T -- U[步驟17: 組裝完整COCO JSON字典] U -- V[步驟18: 寫入JSON文件] V -- W[轉(zhuǎn)換完成]這個流程圖清晰地展示了從初始化到最終輸出的完整過程。接下來我們將深入流程中的幾個關(guān)鍵環(huán)節(jié)看看具體的代碼實(shí)現(xiàn)和需要注意的細(xì)節(jié)。3.2 關(guān)鍵環(huán)節(jié)一類別映射與過濾策略VisDrone有10個可識別類別1-10和一個忽略區(qū)域0。COCO的categories列表需要我們自己定義。通常我們會將VisDrone的類別映射到COCO風(fēng)格的名字并建立一個映射字典。# 定義COCO格式的類別列表 # 注意id通常從1開始連續(xù)與VisDrone的原始id不同。 coco_categories [ {id: 1, name: pedestrian, supercategory: person}, {id: 2, name: people, supercategory: person}, {id: 3, name: bicycle, supercategory: vehicle}, {id: 4, name: car, supercategory: vehicle}, {id: 5, name: van, supercategory: vehicle}, {id: 6, name: truck, supercategory: vehicle}, {id: 7, name: tricycle, supercategory: vehicle}, {id: 8, name: awning-tricycle, supercategory: vehicle}, {id: 9, name: bus, supercategory: vehicle}, {id: 10, name: motor, supercategory: vehicle}, ] # 建立VisDrone原始類別id到COCO category_id的映射 # VisDrone的‘ignored regions’(0) 將被過濾掉。 visdrone_to_coco_id { 1: 1, # pedestrian - 1 2: 2, # people - 2 3: 3, # bicycle - 3 4: 4, # car - 4 5: 5, # van - 5 6: 6, # truck - 6 7: 7, # tricycle - 7 8: 8, # awning-tricycle - 8 9: 9, # bus - 9 10: 10, # motor - 10 }過濾策略在解析每一行標(biāo)注時首先要檢查category_id原始第一個字段后的第五個字段。如果它是0代表忽略區(qū)域我們應(yīng)該直接跳過這個標(biāo)注不將其加入COCO的annotations列表。這是保證訓(xùn)練數(shù)據(jù)純凈度的關(guān)鍵一步。3.3 關(guān)鍵環(huán)節(jié)二圖像信息獲取與ID管理COCO格式要求為每張圖像生成一個唯一的image_id并且每個標(biāo)注的image_id要正確關(guān)聯(lián)。一個簡單可靠的方法是使用一個自增的計數(shù)器。import os from PIL import Image image_id 1 # 起始ID for img_file in sorted(os.listdir(images_dir)): # 按文件名排序保證可復(fù)現(xiàn) if not img_file.lower().endswith((.jpg, .jpeg, .png)): continue # 獲取圖像尺寸 img_path os.path.join(images_dir, img_file) try: with Image.open(img_path) as img: width, height img.size except Exception as e: print(fWarning: Could not open image {img_file}: {e}. Skipping.) continue # 構(gòu)建image信息字典 image_info { id: image_id, file_name: img_file, height: height, width: width, # 可以添加更多信息如 license: 1, } coco_images.append(image_info) # 接下來處理這張圖的標(biāo)注... # annotation中的 image_id 要設(shè)置為當(dāng)前的 image_id image_id 1 # ID自增注意事項(xiàng)務(wù)必使用PIL或OpenCV讀取圖像的實(shí)際尺寸而不是假設(shè)一個固定值。因?yàn)閂isDrone數(shù)據(jù)集中圖像的尺寸可能不完全一致。將height和width填錯會導(dǎo)致后續(xù)計算area、評估時計算IoU等全部出錯。3.4 關(guān)鍵環(huán)節(jié)三標(biāo)注解析與邊界框處理這是轉(zhuǎn)換的核心。對于每個圖像對應(yīng)的TXT文件我們需要逐行讀取并解析。annotation_id 1 # 標(biāo)注ID也需要全局唯一 for img_info in coco_images: base_name os.path.splitext(img_info[file_name])[0] txt_path os.path.join(annotations_dir, base_name .txt) if not os.path.exists(txt_path): # 有些圖像可能沒有標(biāo)注文件跳過 continue with open(txt_path, r) as f: lines f.readlines() for line in lines: line line.strip() if not line: continue parts line.split(,) if len(parts) 8: # 確保有足夠字段 continue # 解析字段注意轉(zhuǎn)換為整數(shù) x, y, w, h map(int, parts[:4]) cls_id int(parts[4]) truncation int(parts[5]) occlusion int(parts[6]) # alpha int(parts[7]) # 可能不需要 # 1. 過濾忽略區(qū)域 if cls_id 0: continue # 2. 過濾無效邊界框 (可選但推薦) if w 0 or h 0: print(fWarning: Invalid bbox (w{w}, h{h}) in {txt_path}. Skipping.) continue # 3. 類別映射 if cls_id not in visdrone_to_coco_id: print(fWarning: Unknown category id {cls_id} in {txt_path}. Skipping.) continue coco_cls_id visdrone_to_coco_id[cls_id] # 4. 構(gòu)建COCO annotation # COCO的bbox要求是 [x, y, width, height]且x,y是左上角坐標(biāo)。VisDrone格式一致。 # 但COCO官方評估腳本要求bbox是float類型。 bbox [float(x), float(y), float(w), float(h)] area float(w * h) ann { id: annotation_id, image_id: img_info[id], category_id: coco_cls_id, bbox: bbox, area: area, segmentation: [], # 檢測任務(wù)分割為空 iscrowd: 0, # VisDrone通常不是crowd標(biāo)注 } coco_annotations.append(ann) annotation_id 1重要細(xì)節(jié)數(shù)據(jù)類型bbox和area在COCO JSON中通常是浮點(diǎn)數(shù)float盡管坐標(biāo)和尺寸是整數(shù)。使用float()進(jìn)行轉(zhuǎn)換可以避免一些解析庫的潛在問題。邊界框驗(yàn)證務(wù)必添加對w和h的檢查防止出現(xiàn)負(fù)值或零值框這種無效標(biāo)注會導(dǎo)致訓(xùn)練時損失計算出現(xiàn)NaN。截斷與遮擋信息VisDrone中的truncation和occlusion信息在COCO格式中沒有直接位置存放。如果你希望保留這些信息用于后續(xù)分析或特殊訓(xùn)練策略如對遮擋目標(biāo)賦予不同權(quán)重一個常見的做法是將其作為annotation字典的自定義字段加入例如visdrone_attr: {truncation: truncation, occlusion: occlusion}。但請注意大多數(shù)標(biāo)準(zhǔn)訓(xùn)練代碼會忽略這些額外字段。4. 完整腳本示例與結(jié)果驗(yàn)證4.1 一個完整的轉(zhuǎn)換腳本骨架將上述環(huán)節(jié)組合起來并添加數(shù)據(jù)集信息等形成一個完整的腳本import os import json from PIL import Image from tqdm import tqdm # 用于顯示進(jìn)度條 def convert_visdrone_to_coco(visdrone_img_dir, visdrone_ann_dir, output_json_path): 將VisDrone數(shù)據(jù)集轉(zhuǎn)換為COCO格式的JSON文件。 參數(shù): visdrone_img_dir: VisDrone圖像文件夾路徑 visdrone_ann_dir: VisDrone標(biāo)注TXT文件夾路徑 output_json_path: 輸出的COCO JSON文件路徑 # 1. 初始化COCO數(shù)據(jù)結(jié)構(gòu) coco_data { info: { year: 2023, version: 1.0, description: Converted from VisDrone dataset, contributor: , url: , date_created: 2023-01-01 }, licenses: [{id: 1, name: VisDrone License, url: }], images: [], annotations: [], categories: [] } # 2. 定義類別 (同上此處省略...) coco_categories [...] visdrone_to_coco_id {...} coco_data[categories] coco_categories # 3. 遍歷圖像 image_id 1 annotation_id 1 img_files [f for f in os.listdir(visdrone_img_dir) if f.lower().endswith((.jpg, .jpeg, .png))] for img_file in tqdm(sorted(img_files), descProcessing Images): img_path os.path.join(visdrone_img_dir, img_file) # 獲取圖像尺寸 try: with Image.open(img_path) as img: width, height img.size except Exception as e: print(fSkipping {img_file}: {e}) continue # 添加圖像信息 image_info { id: image_id, file_name: img_file, height: height, width: width, } coco_data[images].append(image_info) # 處理對應(yīng)標(biāo)注 base_name os.path.splitext(img_file)[0] txt_path os.path.join(visdrone_ann_dir, base_name .txt) if os.path.exists(txt_path): with open(txt_path, r) as f: lines f.readlines() for line in lines: line line.strip() if not line: continue parts line.split(,) if len(parts) 8: continue x, y, w, h map(int, parts[:4]) cls_id int(parts[4]) # 過濾忽略區(qū)域和無效框 if cls_id 0 or w 0 or h 0: continue if cls_id not in visdrone_to_coco_id: continue # 或記錄日志 coco_cls_id visdrone_to_coco_id[cls_id] bbox [float(x), float(y), float(w), float(h)] area float(w * h) ann { id: annotation_id, image_id: image_id, category_id: coco_cls_id, bbox: bbox, area: area, segmentation: [], iscrowd: 0, } coco_data[annotations].append(ann) annotation_id 1 # else: 如果沒有標(biāo)注文件這張圖只有image_info沒有annotation image_id 1 # 4. 保存為JSON文件 with open(output_json_path, w) as f: json.dump(coco_data, f, indent2) # indent參數(shù)使JSON文件更易讀 print(fConversion completed!) print(f Total images: {len(coco_data[images])}) print(f Total annotations: {len(coco_data[annotations])}) print(f Saved to: {output_json_path}) if __name__ __main__: # 使用示例 convert_visdrone_to_coco( visdrone_img_dir./VisDrone2019-DET-train/images, visdrone_ann_dir./VisDrone2019-DET-train/annotations, output_json_path./instances_train2017.json )4.2 轉(zhuǎn)換結(jié)果的驗(yàn)證與排查生成JSON文件后絕不能直接用于訓(xùn)練。必須進(jìn)行嚴(yán)格驗(yàn)證。1. 基礎(chǔ)完整性檢查使用Python加載嘗試用json.load()加載文件確保JSON格式正確。檢查關(guān)鍵字段確認(rèn)images、annotations、categories三個列表都存在且非空。檢查ID唯一性編寫簡單腳本檢查所有image_id和annotation_id是否唯一。檢查關(guān)聯(lián)性隨機(jī)抽查幾個annotation確保其image_id能在images列表中找到category_id能在categories列表中找到。2. 可視化驗(yàn)證強(qiáng)烈推薦這是最直觀有效的方法。寫一個簡單的可視化腳本讀取COCO JSON和原圖將邊界框和類別標(biāo)簽畫上去。import json import cv2 import random def visualize_coco_json(json_path, img_dir, num_samples5): with open(json_path, r) as f: data json.load(f) # 建立類別id到名字的映射 cat_id_to_name {cat[id]: cat[name] for cat in data[categories]} # 隨機(jī)選擇幾張圖片查看 sample_images random.sample(data[images], min(num_samples, len(data[images]))) for img_info in sample_images: img_id img_info[id] img_file img_info[file_name] img_path os.path.join(img_dir, img_file) # 讀取圖像 img cv2.imread(img_path) if img is None: print(fCould not read image: {img_path}) continue # 找到該圖的所有標(biāo)注 anns [ann for ann in data[annotations] if ann[image_id] img_id] print(fImage: {img_file}, Annotations: {len(anns)}) for ann in anns: bbox ann[bbox] # [x, y, w, h] cat_id ann[category_id] cat_name cat_id_to_name.get(cat_id, fUnknown({cat_id})) # 將浮點(diǎn)數(shù)bbox轉(zhuǎn)換為整數(shù)像素坐標(biāo) x, y, w, h [int(coord) for coord in bbox] # 畫矩形和標(biāo)簽 color (0, 255, 0) # 綠色 cv2.rectangle(img, (x, y), (xw, yh), color, 2) cv2.putText(img, cat_name, (x, y-5), cv2.FONT_HERSHEY_SIMPLEX, 0.5, color, 2) # 顯示圖像 cv2.imshow(Visualization, img) key cv2.waitKey(0) # 按任意鍵查看下一張 if key ord(q): # 按q鍵退出 break cv2.destroyAllWindows() # 調(diào)用函數(shù) visualize_coco_json(./instances_train2017.json, ./VisDrone2019-DET-train/images)通過可視化你可以立即發(fā)現(xiàn)以下問題邊界框位置是否嚴(yán)重偏移類別標(biāo)簽是否正確是否漏掉了某些標(biāo)注圖像尺寸讀取是否正確框是否與圖像大小匹配3. 使用COCO API進(jìn)行格式驗(yàn)證PyCOCOtools是官方的COCO數(shù)據(jù)集處理工具。安裝后pip install pycocotools可以用它來加載你生成的JSON這是一個非常嚴(yán)格的格式檢查。from pycocotools.coco import COCO coco COCO(./instances_train2017.json) print(coco.dataset[info]) print(fNumber of images: {len(coco.imgs)}) print(fNumber of annotations: {len(coco.anns)}) print(fNumber of categories: {len(coco.cats)})如果能成功加載而不報錯說明你的JSON文件基本符合COCO格式規(guī)范。5. 常見問題與實(shí)戰(zhàn)經(jīng)驗(yàn)總結(jié)在實(shí)際操作中你幾乎一定會遇到下面這些問題。這里是我總結(jié)的“避坑指南”。5.1 坐標(biāo)系統(tǒng)與邊界框溢出問題轉(zhuǎn)換后邊界框的一部分畫在了圖像外面。原因與解決坐標(biāo)原點(diǎn)確認(rèn)VisDrone和COCO都使用圖像左上角(0,0)作為原點(diǎn)這一點(diǎn)通常一致。但有些數(shù)據(jù)集如VOC使用(1,1)。確認(rèn)你的理解無誤。邊界框越界處理VisDrone的標(biāo)注框有時可能部分在圖像外x0或y0或xw img_width。COCO格式允許浮點(diǎn)數(shù)但一個越界的框在訓(xùn)練時可能引發(fā)問題。一個穩(wěn)健的做法是在轉(zhuǎn)換時進(jìn)行“裁剪”clampx max(0, min(x, img_width - 1)) y max(0, min(y, img_height - 1)) w min(w, img_width - x) h min(h, img_height - y) if w 0 or h 0: continue # 如果裁剪后框無效則丟棄但請注意裁剪會改變框的真實(shí)位置。另一種策略是保留原始越界框相信數(shù)據(jù)集的原始標(biāo)注。我建議在轉(zhuǎn)換腳本中記錄下越界框的數(shù)量和位置評估其影響后再決定是否裁剪。5.2 類別映射的歧義與處理問題VisDrone的“pedestrian”1和“people”2在COCO中可能都想映射到“person”。如何處理方案這取決于你的任務(wù)目標(biāo)。方案A細(xì)粒度保留所有原始類別如前面示例所示。這樣模型可以學(xué)習(xí)區(qū)分行人和人群。方案B合并如果你只關(guān)心“人”這個大類可以在映射字典中將1和2都映射到同一個category_id例如1并在categories列表中只定義一個{id: 1, name: person}。務(wù)必同步修改categories列表方案C選擇性使用只使用你關(guān)心的部分類別。例如只檢測車輛汽車、巴士、卡車等則在映射時過濾掉行人和人類類別。關(guān)鍵categories列表必須與annotations中實(shí)際出現(xiàn)的category_id完全對應(yīng)。轉(zhuǎn)換后務(wù)必檢查categories中的每個id是否都在標(biāo)注中被用到以及標(biāo)注中用到的每個id是否都在categories中有定義。5.3 圖像與標(biāo)注文件匹配錯誤問題轉(zhuǎn)換后發(fā)現(xiàn)有些圖像的標(biāo)注數(shù)量為0或者可視化時框不對應(yīng)。原因圖像文件擴(kuò)展名不匹配如.jpg vs .JPG。標(biāo)注TXT文件名與圖像文件名不完全一致如123.jpg對應(yīng)00123.txt。某些圖像可能確實(shí)沒有標(biāo)注對象空標(biāo)注。VisDrone的空標(biāo)注TXT文件可能是空的或者只有一行0,0,0,0,0,0,0,0。解決在腳本中統(tǒng)一處理文件名如使用os.path.splitext去除擴(kuò)展名后再匹配。在處理前打印一下找不到標(biāo)注文件的圖像名手動檢查原因。對于空標(biāo)注確保你的腳本能正確處理空的TXT文件或全零行不產(chǎn)生錯誤即可。5.4 性能與內(nèi)存優(yōu)化問題當(dāng)處理數(shù)萬張圖像時腳本可能運(yùn)行緩慢或內(nèi)存占用高。優(yōu)化技巧使用tqdm顯示進(jìn)度如上例所示直觀了解進(jìn)度。避免在內(nèi)存中累積過大的列表如果數(shù)據(jù)集極大可以考慮流式處理分批寫入JSON或使用ijson等庫增量生成。但對于VisDrone的規(guī)模約萬張一次性處理通常沒問題。圖像尺寸讀取優(yōu)化使用PIL.Image.open然后img.size比用OpenCV的cv2.imread讀取整個圖像矩陣要快得多內(nèi)存占用也小。并行處理對于更大量的數(shù)據(jù)可以考慮用multiprocessing模塊并行處理不同圖像文件夾。但要注意寫入JSON時的線程安全通常建議并行解析最后再合并結(jié)果列表。5.5 與訓(xùn)練框架的對接問題生成的JSON文件在MMDetection或Detectron2中加載失敗。排查步驟首先用COCO API驗(yàn)證如上節(jié)所述能通過COCO()加載是第一步。檢查文件路徑訓(xùn)練配置中指定的ann_file路徑是否正確是絕對路徑還是相對路徑檢查數(shù)據(jù)集注冊在MMDetection中你需要確保自定義數(shù)據(jù)集的classes與JSON中categories的name字段順序一致或通過metainfo指定。一個常見錯誤是classes列表的順序與category_id沒有正確對應(yīng)。最好在數(shù)據(jù)集的配置中通過metainfodict(classes[‘pedestrian‘, ‘people‘, ...])顯式指定類別列表確保萬無一失。檢查標(biāo)注過濾有些框架在加載時可能會自動過濾area過小如area 1的標(biāo)注。如果你的area計算有誤比如用了整數(shù)計算導(dǎo)致為0可能會導(dǎo)致標(biāo)注被全部過濾。確保area是float且大于0。轉(zhuǎn)換一份VisDrone-COCO格式的JSON文件遠(yuǎn)不止是跑通一個腳本。它要求你對兩種數(shù)據(jù)格式的細(xì)節(jié)有深刻理解對可能出現(xiàn)的邊界情況有充分的預(yù)案并且養(yǎng)成用可視化等手段嚴(yán)格驗(yàn)證結(jié)果的習(xí)慣。這份生成的JSON文件將是連接高質(zhì)量無人機(jī)數(shù)據(jù)和強(qiáng)大檢測模型的可靠橋梁。希望這份詳盡的拆解能讓你在搭建這座橋時每一步都走得扎實(shí)、穩(wěn)健。本文還有配套的精品資源點(diǎn)擊獲取