據(jù)集自建指南:跌倒檢測(cè)與站立識(shí)別的完整流程)
簡(jiǎn)介這是一份面向計(jì)算機(jī)視覺與深度學(xué)習(xí)研究者的人體行為數(shù)據(jù)集聚焦跌倒、站立、坐、奔跑、下蹲等日常動(dòng)作其中跌倒樣本占比最大可用于YOLOv5等行為識(shí)別模型的訓(xùn)練與評(píng)估適用于老人監(jiān)護(hù)、安全監(jiān)控、運(yùn)動(dòng)分析等場(chǎng)景。資源共17936個(gè)文件包含7261張jpg圖像、6099個(gè)txt標(biāo)注文件和4576個(gè)xml標(biāo)注文件壓縮包大小453.56MBjpg圖像涵蓋多種分辨率與光照條件有助于提升模型泛化能力txt與xml分別對(duì)應(yīng)YOLO和VOC常用標(biāo)注格式方便接入不同訓(xùn)練框架。除圖像與標(biāo)注外資源還附帶數(shù)據(jù)劃分腳本、預(yù)處理工具、YOLOv5模型配置及訓(xùn)練評(píng)估腳本方便使用者從零開始搭建訓(xùn)練流程并通過精度、召回率等指標(biāo)全面評(píng)估跌倒檢測(cè)效果。目前已有2535人學(xué)習(xí)下載適合正在開展行為識(shí)別研究或希望快速構(gòu)建跌倒檢測(cè)原型系統(tǒng)的開發(fā)者、學(xué)生參考使用。 開頭先說(shuō)明一下人體行為數(shù)據(jù)集這個(gè)方向我一直覺得特別有意思尤其是“跌倒站立”這類動(dòng)作幾乎屬于智能安防和養(yǎng)老場(chǎng)景里的硬需求。但問題在于公開數(shù)據(jù)集大多跟實(shí)際業(yè)務(wù)場(chǎng)景不貼近真正想做一套能落地、能訓(xùn)練出效果的數(shù)據(jù)集通常繞不開自建這條路。這篇文章就把我過去踩過的坑、試過的方法、以及最終跑通的一套流程完整講清楚從行為類別定義、采集方案、標(biāo)注規(guī)范到模型訓(xùn)練和典型問題排查一條龍講完。無(wú)論你是馬上要上手做行為識(shí)別還是正在為當(dāng)前數(shù)據(jù)集效果不佳發(fā)愁這篇都能給你省掉不少試錯(cuò)時(shí)間。1. 人體行為數(shù)據(jù)集的整體設(shè)計(jì)先想清楚要識(shí)別什么再談采集1.1 行為類別體系設(shè)計(jì)不是動(dòng)作越多越好而是別讓模型“犯迷糊”拿到“人體行為、跌倒站立”這類需求時(shí)第一步不是急著找攝像頭而是要把行為類別體系定清楚。很多新手最容易犯的錯(cuò)就是類別定義太粗糙比如只標(biāo)注“跌倒”和“站立”結(jié)果模型上線后把彎腰撿東西、突然蹲下、甚至坐下動(dòng)作都誤報(bào)成跌倒。我建議按實(shí)際場(chǎng)景把行為拆成兩類一類是必須準(zhǔn)確識(shí)別的目標(biāo)動(dòng)作比如跌倒、站立另一類是混淆干擾動(dòng)作比如蹲下、坐下、躺下、彎腰拾物。為什么要加干擾動(dòng)作因?yàn)樾袨樽R(shí)別模型學(xué)的是“動(dòng)作之間的區(qū)分邊界”如果訓(xùn)練集里只有跌倒和站立兩種類別那模型唯一能做的事就是“不像站立的都是跌倒”誤報(bào)率會(huì)高到?jīng)]法用。加上蹲下、坐下、躺下這類干擾類別后模型才真正學(xué)會(huì)“跌倒”和“其他接近跌倒但并不是跌倒”的區(qū)別。類別體系設(shè)計(jì)還有一個(gè)細(xì)節(jié)——?jiǎng)幼鞯钠鹬苟x。比如“跌倒”從哪一幀開始、到哪一幀結(jié)束“站立”是保持某個(gè)姿勢(shì)超過多少幀才算這些定義如果不寫進(jìn)標(biāo)注規(guī)范里不同標(biāo)注員的標(biāo)注口徑就會(huì)不一致數(shù)據(jù)集質(zhì)量直接崩。我之前在項(xiàng)目里定過一套標(biāo)準(zhǔn)舉個(gè)例子跌倒定義為“人體軀干從直立/行走狀態(tài)在1秒內(nèi)發(fā)生明顯下墜且最終軀干與地面夾角小于45度并持續(xù)2秒以上”站立定義為“人體軀干與地面夾角大于75度且保持3秒以上”。這套定義的好處是標(biāo)注員和算法團(tuán)隊(duì)能對(duì)齊口徑后面排查badcase也方便。1.2 公開數(shù)據(jù)集選型與自建數(shù)據(jù)集的取舍組合拳遠(yuǎn)比單一方案靠譜很多人在選數(shù)據(jù)集時(shí)會(huì)糾結(jié)“到底用公開的還是自己采”我的經(jīng)驗(yàn)是除非你的場(chǎng)景極其標(biāo)準(zhǔn)比如學(xué)術(shù)實(shí)驗(yàn)環(huán)境否則別指望純公開數(shù)據(jù)集能直接解決業(yè)務(wù)問題。但公開數(shù)據(jù)集也不能完全放棄它最適合用來(lái)做預(yù)訓(xùn)練和模型熱身。以跌倒檢測(cè)為例目前能直接用的公開資源大致有以下幾類視頻類行為識(shí)別數(shù)據(jù)集像UCF101、HMDB51這些主要覆蓋日常動(dòng)作包含部分近似跌倒的動(dòng)作但缺少真正的跌倒樣本而且拍攝視角多為水平視角跟監(jiān)控俯視視角差別很大。骨骼關(guān)鍵點(diǎn)類數(shù)據(jù)集NTU RGBD有60類日常動(dòng)作包含跌倒、坐下、站立等但它采集自kinect傳感器場(chǎng)景單一且只提供3D骨骼坐標(biāo)沒有原始RGB視頻在真實(shí)監(jiān)控場(chǎng)景下直接遷移效果有限。專項(xiàng)跌倒數(shù)據(jù)集像UR Fall Detection這類公開的跌倒檢測(cè)數(shù)據(jù)集包含俯視攝像頭和穿戴傳感器數(shù)據(jù)質(zhì)量一般但勝在類別聚焦可以用來(lái)做驗(yàn)證集或模型調(diào)優(yōu)參考。我個(gè)人的做法是“公開數(shù)據(jù)預(yù)訓(xùn)練自建數(shù)據(jù)精調(diào)”的組合拳。先用Kinetics-400或UCF101做通用行為特征預(yù)訓(xùn)練再用自建的跌倒站立數(shù)據(jù)集做微調(diào)這樣小樣本場(chǎng)景下也能有比較穩(wěn)的效果。1.3 數(shù)據(jù)規(guī)模與場(chǎng)景覆蓋的平衡寧可場(chǎng)景多樣化也別一味追求幀數(shù)自建數(shù)據(jù)集很常見的一個(gè)誤區(qū)是“采集幾百個(gè)視頻全在同一個(gè)辦公室每個(gè)視頻幾萬(wàn)幀”。這樣得到的數(shù)據(jù)集雖然總幀數(shù)不少但場(chǎng)景單一、人物固定、光照不變模型訓(xùn)練出來(lái)?yè)Q個(gè)環(huán)境就失靈。真正決定行為識(shí)別模型泛化能力的是場(chǎng)景多樣性不是總時(shí)長(zhǎng)。我實(shí)踐下來(lái)比較合理的數(shù)據(jù)規(guī)模大概是目標(biāo)動(dòng)作跌倒至少500段有效樣本干擾動(dòng)作蹲下、坐下、躺下每類300段以上如果實(shí)際場(chǎng)景有老人/小孩/成人多個(gè)群體最好每個(gè)群體都有覆蓋。總數(shù)據(jù)量控制在3~5小時(shí)有效視頻比較合適這既保證了樣本多樣性又能控制標(biāo)注成本。提示采集時(shí)盡量覆蓋多個(gè)時(shí)間段的自然光、不同朝向的攝像頭、不同衣著顏色、不同體型的人。我在項(xiàng)目里吃過虧第一版數(shù)據(jù)全是同一個(gè)瘦高男生穿深色衣服結(jié)果模型對(duì)穿淺色衣服的老年人識(shí)別效果慘不忍睹。2. 數(shù)據(jù)采集與標(biāo)注的實(shí)操要點(diǎn)細(xì)節(jié)決定數(shù)據(jù)集質(zhì)量上限2.1 攝像頭選型與視角布置別只看分辨率幀率和安裝角度更重要很多人采集人體行為數(shù)據(jù)時(shí)第一反應(yīng)是“上4K攝像頭”但實(shí)際踩過坑的都知道行為識(shí)別對(duì)幀率的要求遠(yuǎn)高于分辨率。跌倒動(dòng)作本身非??鞆氖Х€(wěn)到落地往往只有0.5~1秒如果幀率只有15fps甚至更低跌倒過程可能只被捕捉到兩三幀時(shí)序上的運(yùn)動(dòng)特征信息基本丟失。以我的經(jīng)驗(yàn)來(lái)看如果只是做單幀姿態(tài)估計(jì)的目標(biāo)檢測(cè)類任務(wù)25fps以上夠用但如果是做時(shí)序行為識(shí)別建議至少30fps有條件上60fps更好。分辨率方面1080P足夠關(guān)鍵是要保證在目標(biāo)活動(dòng)范圍內(nèi)人體像素高度不低于200px否則后續(xù)做關(guān)鍵點(diǎn)檢測(cè)很容易因?yàn)檩斎胩《д妗R暯欠矫媸覂?nèi)監(jiān)控場(chǎng)景建議攝像頭安裝在墻角高位、斜向下45度左右這樣能看到人體全身也能比較清楚地捕捉到從站立到倒地的身體角度變化。正上方俯視視角雖然能避免遮擋但會(huì)把跌倒和躺下的動(dòng)作搞混因?yàn)橛懈叨炔畹男畔G失了這個(gè)我在實(shí)際測(cè)試中深有體會(huì)。2.2 標(biāo)注體系與工具框、關(guān)鍵點(diǎn)、時(shí)序段三類信息按需選人體行為數(shù)據(jù)集標(biāo)注和普通目標(biāo)檢測(cè)數(shù)據(jù)集標(biāo)注的最大區(qū)別在于行為不是一個(gè)靜態(tài)對(duì)象它有一個(gè)時(shí)間跨度。真實(shí)場(chǎng)景里如果只用靜態(tài)圖片做標(biāo)注等于把行為識(shí)別硬生生做成了動(dòng)作分類數(shù)據(jù)集的效果會(huì)大打折扣。目前主流做法有三種我分別說(shuō)說(shuō)適用場(chǎng)景純靜態(tài)框標(biāo)注每幀標(biāo)人體檢測(cè)框適合“檢測(cè)分類”的短時(shí)動(dòng)作識(shí)別比如站立/跌倒二分類但對(duì)時(shí)序依賴強(qiáng)的動(dòng)作如從站立到跌倒的過渡過程會(huì)有先天不足。骨骼關(guān)鍵點(diǎn)標(biāo)注每幀標(biāo)17個(gè)或25個(gè)人體關(guān)鍵點(diǎn)坐標(biāo)適合骨架行為識(shí)別模型如ST-GCN、PoseC3D優(yōu)點(diǎn)是忽略背景干擾、模型更輕量缺點(diǎn)是需要額外的關(guān)鍵點(diǎn)提取流程標(biāo)注成本高。時(shí)序段級(jí)別標(biāo)注在時(shí)間軸上標(biāo)記動(dòng)作起止時(shí)間動(dòng)作類別適合“視頻級(jí)行為理解”模型。實(shí)際操作中我建議“檢測(cè)框時(shí)序標(biāo)簽”組合每幀檢測(cè)框提供空間位置時(shí)序段提供動(dòng)作類別和時(shí)間范圍兩者配合訓(xùn)練效果最好。標(biāo)注工具方面我試用過不少常用的有LabelMe單幀框標(biāo)注適合小規(guī)模、labelImg最經(jīng)典的目標(biāo)檢測(cè)標(biāo)注界面簡(jiǎn)單但只支持單幀單圖、CVAT支持視頻時(shí)序標(biāo)注多人協(xié)作方便我最推薦、以及VGG Image Annotator輕量級(jí)可用但大項(xiàng)目效率不高。小團(tuán)隊(duì)單人做建議直接用CVAT它可以直接在視頻流上逐幀標(biāo)注并自動(dòng)插值生成中間幀的框能節(jié)省大量重復(fù)勞動(dòng)。2.3 數(shù)據(jù)平衡與增強(qiáng)跌倒樣本永遠(yuǎn)不夠得用策略補(bǔ)行為識(shí)別數(shù)據(jù)集普遍存在類別嚴(yán)重不平衡的問題尤其是“跌倒”這類低頻但關(guān)鍵的動(dòng)作。正常人一天24小時(shí)可能99.9%的時(shí)間都不在跌倒如果按照真實(shí)自然分布采集數(shù)據(jù)跌倒樣本占比極低模型會(huì)完全偏向預(yù)測(cè)“正常站立”。針對(duì)這個(gè)問題我常用的處理策略有三種第一個(gè)是過采樣把跌倒樣本在訓(xùn)練時(shí)反復(fù)參與epoch或者直接把跌倒視頻做切片冗余讓模型看到的跌倒樣本相對(duì)更多。第二個(gè)是數(shù)據(jù)增強(qiáng)對(duì)跌倒樣本做時(shí)序增強(qiáng)回放、慢放、加速、空間增強(qiáng)水平翻轉(zhuǎn)、隨機(jī)裁剪、旋轉(zhuǎn)、色彩抖動(dòng)這能有效擴(kuò)充跌倒樣本的多樣性。第三個(gè)是使用Focal Loss這類損失函數(shù)讓模型在訓(xùn)練時(shí)自動(dòng)加大對(duì)難分類樣本也就是跌倒樣本的關(guān)注這樣即使數(shù)據(jù)集比例不理想模型也不至于完全“躺平”。3. 模型訓(xùn)練與自己的數(shù)據(jù)集適配從mmrotate到y(tǒng)olov8選對(duì)工具鏈3.1 模型選型行為識(shí)別不是只有一種做法按場(chǎng)景和算力選拿到標(biāo)注好的數(shù)據(jù)集后接下來(lái)的核心問題是“用什么模型來(lái)訓(xùn)練”。其實(shí)人體行為識(shí)別有三個(gè)大方向很多人一開始容易混淆我把它們講明白?;跈z測(cè)分類的靜態(tài)幀方案就是先用行人檢測(cè)器框出人體再對(duì)單幀圖像做動(dòng)作分類。這種方案速度最快、實(shí)現(xiàn)最簡(jiǎn)單但缺點(diǎn)是沒有時(shí)序建模遇到“跌倒”這種強(qiáng)依賴運(yùn)動(dòng)趨勢(shì)的動(dòng)作時(shí)效果往往不好。適合的場(chǎng)景是資源受限、只需要區(qū)分“站/坐/躺”等靜態(tài)姿態(tài)的設(shè)備?;诠趋狸P(guān)鍵點(diǎn)的時(shí)序方案先用姿態(tài)估計(jì)算法如MediaPipe、MMPose提取骨骼關(guān)鍵點(diǎn)序列然后用ST-GCN、PoseC3D這類圖卷積或卷積網(wǎng)絡(luò)做時(shí)序分類。好處是模型參數(shù)量小、對(duì)背景和外觀不敏感缺點(diǎn)是比較依賴關(guān)鍵點(diǎn)提取的準(zhǔn)確性在嚴(yán)重遮擋場(chǎng)景下容易失效。基于視頻流的端到端方案就是直接以原始視頻幀序列作為輸入用SlowFast、TSM、TimeSformer這類網(wǎng)絡(luò)同時(shí)建??臻g和時(shí)間特征。這種方案精度最高但對(duì)算力和數(shù)據(jù)量要求也最高。我的建議是如果項(xiàng)目剛起步、算力有限先走“2D目標(biāo)檢測(cè)骨骼關(guān)鍵點(diǎn)輕量時(shí)序分類”的路線如果算力充足、業(yè)務(wù)對(duì)精度要求很高再上SlowFast這類端到端方案。3.2 數(shù)據(jù)集劃分的藝術(shù)別隨機(jī)切要按視頻或人物劃分這里我要專門說(shuō)一個(gè)容易被忽視但影響巨大的問題——數(shù)據(jù)集劃分策略。直接用隨機(jī)方式把視頻幀切分成train/val/test大概率會(huì)造成嚴(yán)重的數(shù)據(jù)泄漏。為什么因?yàn)橥欢我曨l的連續(xù)幀之間高度相似如果訓(xùn)練集和驗(yàn)證集來(lái)自同一段視頻模型相當(dāng)于“看著答案做測(cè)試”驗(yàn)證結(jié)果會(huì)虛高但換到真實(shí)場(chǎng)景后性能馬上露餡。正確的做法是按“視頻片段”或者“人物”劃分。舉個(gè)例子假設(shè)你采了20個(gè)人的跌倒視頻那就讓15個(gè)人的全部視頻進(jìn)訓(xùn)練集2個(gè)人的進(jìn)驗(yàn)證集3個(gè)人的進(jìn)測(cè)試集確保測(cè)試集里的人完全沒參與訓(xùn)練。這樣得到的指標(biāo)才有參考價(jià)值也才能真實(shí)反映模型在面對(duì)陌生人的泛化能力。另外一個(gè)細(xì)節(jié)是負(fù)樣本的劃分也要保證場(chǎng)景獨(dú)立性。比如驗(yàn)證集里面不應(yīng)該包含訓(xùn)練集同一個(gè)場(chǎng)景、同一天、同一時(shí)刻的背景幀否則模型可能不是在學(xué)“人的行為”而是在學(xué)“這個(gè)背景環(huán)境”。3.3 訓(xùn)練參數(shù)與收斂調(diào)優(yōu)幀采樣策略、batch size、學(xué)習(xí)率一個(gè)都不能省行為識(shí)別模型訓(xùn)練有很多瑣碎但關(guān)鍵的參數(shù)我直接給出一個(gè)經(jīng)過驗(yàn)證的配置參考大家根據(jù)實(shí)際算力微調(diào)輸入片段長(zhǎng)度16~32幀SlowFast默認(rèn)32幀輕量級(jí)模型可用16幀幀采樣策略均勻采樣每段視頻先均勻抽出N幀再做隨機(jī)裁剪避免短片段過長(zhǎng)導(dǎo)致有效信息不夠輸入分辨率224x224或256x256如果做骨骼方案關(guān)鍵點(diǎn)序列是17xT或25xT分辨率概念不適用batch size8~16取決于顯存batch太小容易收斂不穩(wěn)優(yōu)化器SGDmomentum(0.9)或AdamW我實(shí)測(cè)行為識(shí)別任務(wù)SGD比AdamW更穩(wěn)不容易過擬合初始學(xué)習(xí)率0.01SGD或0.0001AdamW每10個(gè)epoch衰減一次衰減系數(shù)0.1loss分類用CrossEntropyLoss如果類別不平衡就換成Focal Lossgamma設(shè)2.0訓(xùn)練epoch50~100以驗(yàn)證集F1作為早停依據(jù)我踩過最典型的坑就是學(xué)習(xí)率設(shè)置太高模型前幾個(gè)epoch的loss直接NaN。后來(lái)排查發(fā)現(xiàn)是預(yù)訓(xùn)練模型用的learning rate schedule跟新任務(wù)不匹配。在微調(diào)場(chǎng)景下建議訓(xùn)練骨干部分使用小學(xué)習(xí)率比如0.001新加的分類頭用稍大一些的學(xué)習(xí)率0.01這樣既能保留預(yù)訓(xùn)練特征又能讓分類層快速收斂。4. 常見問題與排查技巧實(shí)錄這些坑我建議你提前避開4.1 跌倒與蹲下、彎腰難區(qū)分別只依賴單幀要把時(shí)間先驗(yàn)用起來(lái)我在項(xiàng)目上線后遇到最多的badcase就是把老人彎腰撿東西誤報(bào)成跌倒。從單幀畫面看彎腰和跌倒的前半段確實(shí)非常相似都是軀干快速前傾、頭部高度明顯下降。但如果我們把時(shí)間維度拉長(zhǎng)看兩者的關(guān)鍵差異其實(shí)在“末態(tài)”彎腰最終會(huì)停住并恢復(fù)直立而跌倒的末態(tài)是長(zhǎng)時(shí)間躺在地上不會(huì)恢復(fù)。解決辦法是在模型結(jié)構(gòu)里加“動(dòng)作末態(tài)判定”跌倒檢測(cè)只觸發(fā)在“人體倒地且短時(shí)間內(nèi)未恢復(fù)直立”的情況下如果人體倒地后2秒內(nèi)重新站起來(lái)那大概率不是跌倒可能是滑倒后的自我爬起。在實(shí)際部署中我還會(huì)結(jié)合持續(xù)時(shí)間閾值做過濾如果檢測(cè)到跌倒姿態(tài)但持續(xù)不到1秒就恢復(fù)直接忽略這能顯著降低誤報(bào)率。4.2 跌倒樣本太少模型死活不收斂先別加數(shù)據(jù)試著用“偽樣本”過渡還有一個(gè)高頻問題是自建數(shù)據(jù)集的跌倒樣本實(shí)在太少幾百個(gè)樣本撐不起模型訓(xùn)練。這種情況下我建議不要盲目追加采集先試試用公開的跌倒數(shù)據(jù)合成“偽樣本”作為預(yù)訓(xùn)練。比如從UR Fall Detection里裁剪跌倒片段通過摳圖、背景替換、畫質(zhì)增強(qiáng)等手段生成一批樣式更豐富的跌倒視頻先用這批數(shù)據(jù)讓模型學(xué)到“跌倒的基本運(yùn)動(dòng)特征”再用真實(shí)自建數(shù)據(jù)精調(diào)效果會(huì)好很多。4.3 標(biāo)注質(zhì)量參差不齊導(dǎo)致模型誤檢抽檢一致性比“標(biāo)注數(shù)量”更重要標(biāo)注質(zhì)量問題更隱蔽也更致命。比如一個(gè)標(biāo)注員認(rèn)為“坐下去”算“坐下”另一個(gè)認(rèn)為“坐一半又站起來(lái)”也算“坐下”兩個(gè)標(biāo)注員對(duì)同一段視頻給出的標(biāo)簽可能不一致模型學(xué)出來(lái)的邊界就混亂。我建議做標(biāo)注質(zhì)量的三步抽檢第一步是同一段視頻安排兩個(gè)標(biāo)注員分別標(biāo)注對(duì)比標(biāo)簽一致性cohens kappa系數(shù)建議在0.8以上第二步是定期抽查已標(biāo)注樣本重點(diǎn)看動(dòng)作起止時(shí)間幀是否準(zhǔn)確這類錯(cuò)誤很難通過算法自動(dòng)發(fā)現(xiàn)第三步是訓(xùn)練前做一個(gè)“類別混淆預(yù)檢”對(duì)驗(yàn)證集里的常見誤報(bào)樣本單獨(dú)復(fù)查通常能發(fā)現(xiàn)一批臟數(shù)據(jù)。4.4 跨場(chǎng)景泛化差模型在A場(chǎng)景好用到B場(chǎng)景就失靈最后的典型問題是模型在自己公司測(cè)試環(huán)境效果很好但換到客戶現(xiàn)場(chǎng)效果明顯下降。原因通常是訓(xùn)練集和真實(shí)場(chǎng)景的光照、背景、攝像頭視角、人物體型差異太大。針對(duì)這個(gè)問題我有幾個(gè)實(shí)用建議第一采集數(shù)據(jù)時(shí)預(yù)留10%~20%的“挑戰(zhàn)性樣本”比如逆光、暗光、穿寬大衣物、背對(duì)攝像頭等情況強(qiáng)制模型學(xué)習(xí)這些不好識(shí)別的樣本。第二訓(xùn)練階段做強(qiáng)背景增強(qiáng)比如用隨機(jī)貼圖、高斯模糊、亮度抖動(dòng)等方式模擬不同場(chǎng)景讓模型不要把注意力放在背景上。第三上線后持續(xù)做“小樣本熱更新”讓客戶現(xiàn)場(chǎng)的前幾天數(shù)據(jù)自動(dòng)進(jìn)入標(biāo)注回流池經(jīng)過標(biāo)注后定期微調(diào)模型這是長(zhǎng)期保證準(zhǔn)確率的有效方法。5. 幾點(diǎn)實(shí)操心得關(guān)于人體行為數(shù)據(jù)集最核心的經(jīng)驗(yàn)總結(jié)起來(lái)就一句話數(shù)據(jù)集的成敗在采集和標(biāo)注環(huán)節(jié)就已經(jīng)決定了模型訓(xùn)練只是把數(shù)據(jù)集的潛力兌現(xiàn)出來(lái)。剛開始做的時(shí)候我光是重新定義類別體系和標(biāo)注規(guī)范就花了兩周當(dāng)時(shí)覺得進(jìn)度慢后面才發(fā)現(xiàn)這恰恰是整個(gè)項(xiàng)目最值得花時(shí)間的地方。最后再分享一個(gè)小技巧訓(xùn)練完第一版模型后可以專門跑一遍訓(xùn)練集的“全量預(yù)測(cè)”找到那些模型預(yù)測(cè)錯(cuò)、但人眼看起來(lái)明顯正確的樣本。這些樣本通常是標(biāo)注錯(cuò)誤的“漏網(wǎng)之魚”把它挑出來(lái)修正一遍往往能讓模型F1提升兩三個(gè)點(diǎn)。這個(gè)操作成本極低但對(duì)數(shù)據(jù)集質(zhì)量檢查非常有效。本文還有配套的精品資源點(diǎn)擊獲取