板線程沖突排查實(shí)戰(zhàn):從原理到修復(fù))
先亮個(gè)觀點(diǎn)單核處理器開發(fā)板上的線程沖突往往比多核系統(tǒng)更難排查。原因在于大多數(shù)人從潛意識(shí)里就認(rèn)定“單核同一個(gè)瞬間只執(zhí)行一條指令哪來(lái)的同時(shí)訪問”我一開始也這么想直到在STM32F407上調(diào)一個(gè)看似不可能出錯(cuò)的標(biāo)志位判斷眼睜睜看著程序在開了O2優(yōu)化后把已經(jīng)置位的if條件當(dāng)成恒假才意識(shí)到這個(gè)問題遠(yuǎn)比想象中復(fù)雜。后來(lái)在ESP32、T113、STM32MP157這些板子上折騰RTOS和裸機(jī)程序一次又一次踩進(jìn)同一個(gè)坑里才慢慢把單核線程沖突這件事想明白。這篇文章我會(huì)從原理講到實(shí)操把“單核上并發(fā)到底怎么發(fā)生”“開發(fā)板上最容易出問題的三類沖突現(xiàn)場(chǎng)”“為什么volatile救不了你”“用什么手段定位和修復(fù)”這幾塊講透最后附上一段真實(shí)排查復(fù)盤。無(wú)論你是在裸機(jī)環(huán)境里被中斷搞到頭大還是在FreeRTOS里被任務(wù)切換折磨到懷疑人生這篇內(nèi)容應(yīng)該都能幫你少走幾個(gè)月的彎路。1. “單核同一時(shí)間只能執(zhí)行一條指令”那沖突從哪來(lái)1.1 單核也能并發(fā)執(zhí)行流之間的交錯(cuò)切換先糾正一個(gè)最常見的誤解并發(fā)concurrent不等于并行parallel。并行是同一時(shí)刻真的有多個(gè)執(zhí)行單元在同時(shí)跑這確實(shí)需要多核。但并發(fā)只需要“任務(wù)交替執(zhí)行”哪怕CPU每一瞬間只干一件事只要它在多個(gè)執(zhí)行流之間來(lái)回切換這些任務(wù)就是并發(fā)的。單核處理器開發(fā)板上有兩類執(zhí)行流天然并存。第一類是裸機(jī)環(huán)境下的主循環(huán)加中斷服務(wù)程序ISR主循環(huán)是一個(gè)執(zhí)行流每個(gè)中斷源是另一條執(zhí)行流中斷可以隨時(shí)打斷主循環(huán)。第二類是RTOS環(huán)境下的多個(gè)任務(wù)task由調(diào)度器決定誰(shuí)占用CPU常見的機(jī)制有時(shí)間片輪轉(zhuǎn)、優(yōu)先級(jí)搶占、以及任務(wù)主動(dòng)延時(shí)或阻塞讓出CPU。一個(gè)RTOS系統(tǒng)里哪怕優(yōu)先級(jí)是1的任務(wù)和優(yōu)先級(jí)是10的任務(wù)跑在同一顆單核上從宏觀時(shí)間尺度看它們確實(shí)都在推進(jìn)。但從指令級(jí)微觀尺度看CPU永遠(yuǎn)是串行地執(zhí)行某一條指令。沖突并不是“兩個(gè)線程真的同時(shí)改了一個(gè)變量”而是“兩個(gè)執(zhí)行流的指令交錯(cuò)在一起把一個(gè)需要不被打斷的操作拆成了兩半”。打個(gè)比方你排隊(duì)在ATM機(jī)上存錢流程是先插卡、再輸密碼、再存錢、再退卡。這時(shí)候一個(gè)保安走過來(lái)在你輸完密碼還沒存錢的時(shí)候把你拉到旁邊讓你填表。等你回來(lái)繼續(xù)操作你或者保安都會(huì)一臉蒙這筆業(yè)務(wù)到底進(jìn)行到哪一步了單核處理器上的線程沖突就是這么發(fā)生的——不是兩個(gè)人同時(shí)按按鈕而是操作步驟被“插隊(duì)”的人從中間截?cái)嗔恕?.2 非原子操作一句a背后其實(shí)是三條指令C語(yǔ)言里一行counter看起來(lái)是一個(gè)不可分割的動(dòng)作。但編譯成ARM或RISC-V指令后它至少包含三條機(jī)器指令從內(nèi)存把counter讀取到寄存器對(duì)寄存器執(zhí)行加1把寄存器寫回內(nèi)存在單核處理器上中斷和任務(wù)切換可以發(fā)生在任意一條指令之后。如果兩個(gè)任務(wù)都在執(zhí)行counter最壞的交錯(cuò)情況是這樣發(fā)生的任務(wù)A先執(zhí)行完load拿到了counter0這個(gè)舊值。此時(shí)調(diào)度器切換任務(wù)B開始跑它完整執(zhí)行了load、add、store把counter從0寫成了1。接著任務(wù)A恢復(fù)執(zhí)行它寄存器里存的還是0執(zhí)行add后變成1再store回內(nèi)存counter從1被覆蓋回1。兩個(gè)任務(wù)各自執(zhí)行了一次自增預(yù)期結(jié)果應(yīng)該是2實(shí)際卻是1。這類問題在單核嵌入式開發(fā)里幾乎無(wú)處不在。它不要求“兩個(gè)執(zhí)行流同時(shí)運(yùn)行”只要它們交錯(cuò)的時(shí)機(jī)恰好在“讀”和“寫”之間沖突就成立。這個(gè)概率通常不是很大但一旦某個(gè)中斷的觸發(fā)頻率高、某個(gè)任務(wù)運(yùn)行頻繁錯(cuò)誤就會(huì)以“偶發(fā)”“看運(yùn)氣”“跑幾小時(shí)崩一次”的形式出現(xiàn)。1.3 切換時(shí)刻不可預(yù)測(cè)中斷和調(diào)度器才是“真正的導(dǎo)演”很多新手寫裸機(jī)程序時(shí)默認(rèn)程序會(huì)“老實(shí)地按順序跑完每一段代碼”。這句話只在沒有中斷、沒有任務(wù)切換的NOP循環(huán)里成立。只要打開任何一個(gè)外設(shè)中斷或者跑起RTOS執(zhí)行流的劇本就再也不由主函數(shù)控制了。中斷可以在任意指令邊界被觸發(fā)。ADC轉(zhuǎn)換完成、定時(shí)器溢出、UART收到一個(gè)字節(jié)、按鍵電平跳變……每一個(gè)事件都可能在不合時(shí)宜的時(shí)刻打斷當(dāng)前執(zhí)行流。RTOS的任務(wù)切換通常來(lái)自SysTick定時(shí)器它有自己的節(jié)拍但任務(wù)之間搶占式調(diào)度意味著低優(yōu)先級(jí)任務(wù)運(yùn)行到一半高優(yōu)先級(jí)任務(wù)就緒后當(dāng)前任務(wù)立刻被掛起。這里有一個(gè)新手特別容易忽略的細(xì)節(jié)任務(wù)切換不只發(fā)生在你主動(dòng)調(diào)用vTaskDelay或等待信號(hào)量的時(shí)候。只要使用了搶占式調(diào)度高優(yōu)先級(jí)任務(wù)一就緒低優(yōu)先級(jí)任務(wù)隨時(shí)隨地會(huì)被切換出去。所以“我這段代碼沒有調(diào)用任何可能阻塞的函數(shù)它一定會(huì)一口氣執(zhí)行完”這個(gè)假設(shè)在搶占式RTOS里是站不住腳的。而中斷搶占RTOS任務(wù)的時(shí)機(jī)更不可控——它只取決于外設(shè)事件何時(shí)發(fā)生跟你代碼執(zhí)行到哪里毫無(wú)關(guān)系。線程沖突的“隨機(jī)性”就來(lái)自這里代碼路徑不同、外設(shè)觸發(fā)時(shí)刻不同、編譯器生成的指令序列不同都會(huì)讓沖突概率呈現(xiàn)完全不同的分布。2. 在開發(fā)板上最容易踩的三類線程沖突現(xiàn)場(chǎng)2.1 中斷置位的主循環(huán)標(biāo)志位為什么被編譯器“吃掉”了裸機(jī)開發(fā)里最經(jīng)典的一幕串口接收中斷里收到一個(gè)字節(jié)把它放進(jìn)全局?jǐn)?shù)組然后置位data_ready標(biāo)志位。主循環(huán)里不斷檢查data_ready為真就處理數(shù)據(jù)、清標(biāo)志。代碼邏輯看起來(lái)無(wú)懈可擊但有兩個(gè)坑在等著你。第一個(gè)坑是編譯器優(yōu)化。如果你沒有把data_ready聲明成volatile在O2優(yōu)化級(jí)別下編譯器可能把主循環(huán)里的while(!data_ready);優(yōu)化成只從內(nèi)存讀取一次data_ready之后每次都直接重用寄存器里的舊值。中斷確實(shí)更新了內(nèi)存里的變量但主循環(huán)還在反復(fù)檢查一個(gè)“過期的緩存”。這是C語(yǔ)言標(biāo)準(zhǔn)里非常明確的未定義行為——在中斷和主循環(huán)之間共享變量卻不加volatile——硬件上電后能不能跑對(duì)全看編譯器心情。第二個(gè)坑更隱蔽就算加了volatile并且單片機(jī)是32位、標(biāo)志位也是32位的單個(gè)標(biāo)志位的讀取和寫入看似“原子”但如果你在主循環(huán)里做的事是“先判斷標(biāo)志再讀數(shù)組里的一批數(shù)據(jù)”中斷又恰好在你讀完第一個(gè)數(shù)據(jù)、還沒讀完后面幾個(gè)時(shí)再次觸發(fā)并寫入了新數(shù)據(jù)那主循環(huán)拿到手里的數(shù)組就是新舊混合的半成品。標(biāo)志位本身沒壞但標(biāo)志位背后保護(hù)的那塊數(shù)據(jù)壞了。在STM32系列上串口中斷配合DMA時(shí)這個(gè)問題最常見。DMA接收完一幀數(shù)據(jù)后由空閑中斷置位標(biāo)志主循環(huán)檢查到標(biāo)志后去解析接收緩沖區(qū)。如果處理得慢下一幀DMA數(shù)據(jù)已經(jīng)覆蓋了緩沖區(qū)前幾百字節(jié)解析結(jié)果自然是一堆亂碼。這種“標(biāo)志位正確但數(shù)據(jù)已被二次寫入”的沖突單靠volatile是解決不了的。2.2 兩個(gè)任務(wù)搶一條I2C總線從設(shè)備直接血壓飆升用ESP32跑FreeRTOS的開發(fā)者基本都遇到過這種鬼打墻的情形任務(wù)A周期性地讀取BME280溫度傳感器任務(wù)B負(fù)責(zé)把傳感器數(shù)據(jù)刷到OLED屏上兩個(gè)任務(wù)共用同一路I2C總線。程序?qū)懲暌慌軠囟葦?shù)據(jù)偶發(fā)變成0xFFOLED上的顯示內(nèi)容偶爾出現(xiàn)雪花點(diǎn)或錯(cuò)位字符。原因在于I2C總線的時(shí)序協(xié)議要求一次完整的傳輸過程不能被打斷。START條件之后主機(jī)要發(fā)送I2C從設(shè)備地址然后等待ACK接著按寄存器地址、數(shù)據(jù)字節(jié)的順序一條一條地收發(fā)。如果任務(wù)A發(fā)送從設(shè)備地址之后剛剛收到ACK任務(wù)B搶占了CPU開始執(zhí)行自己的I2C協(xié)議它也在同一個(gè)SDA和SCL上發(fā)START和地址那么總線上就會(huì)出現(xiàn)兩個(gè)主機(jī)互相打架。從設(shè)備端看到的現(xiàn)象是地址對(duì)不上、ACK不回應(yīng)、數(shù)據(jù)字節(jié)位置錯(cuò)亂、甚至誤以為總線進(jìn)入了異常狀態(tài)。更麻煩的是很多I2C從設(shè)備的內(nèi)部狀態(tài)機(jī)比較脆弱一旦時(shí)序被打斷需要重新初始化或復(fù)位才能恢復(fù)通信。這種問題在SPI外設(shè)上同樣存在表現(xiàn)形式略有不同。SPI本身沒有類似I2C的地址應(yīng)答機(jī)制主機(jī)CS拉低后連續(xù)發(fā)幾個(gè)字節(jié)如果中途被切換CS可能持續(xù)保持低電平另一個(gè)任務(wù)再操作同一個(gè)SPI外設(shè)時(shí)數(shù)據(jù)就混在一起了。芯片級(jí)的說法是“SPI控制器狀態(tài)被兩個(gè)執(zhí)行流輪流污染”。這種沖突不是“邏輯寫錯(cuò)了”而是“共享外設(shè)沒有被互斥保護(hù)”。你在兩個(gè)任務(wù)各自寫的驅(qū)動(dòng)里單獨(dú)看每一句都正確組合在一起后時(shí)序一交錯(cuò)外設(shè)就進(jìn)了非法狀態(tài)。2.3 DMA還在搬數(shù)據(jù)主循環(huán)已經(jīng)開始讀緩沖區(qū)ADC連續(xù)采樣結(jié)合DMA搬運(yùn)是開發(fā)板上最常見的采集架構(gòu)。DMA在后臺(tái)不斷把ADC轉(zhuǎn)換結(jié)果寫入全局?jǐn)?shù)組等緩沖區(qū)存滿后觸發(fā)傳輸完成中斷置一個(gè)dma_done標(biāo)志。主循環(huán)看到標(biāo)志后去處理這一批數(shù)據(jù)??雌饋?lái)設(shè)計(jì)得很合理但有一個(gè)細(xì)節(jié)經(jīng)常被忽略DMA傳輸完成中斷發(fā)出的那一瞬間CPU知道自己該處理數(shù)據(jù)了但下一次DMA傳輸很可能立刻就開始。如果你的主循環(huán)處理緩沖區(qū)花了3毫秒而DMA每隔2毫秒就搬滿一輪那么當(dāng)你讀到緩沖區(qū)中段時(shí)新一輪數(shù)據(jù)已經(jīng)覆蓋了數(shù)組開頭。結(jié)果是你用dma_done標(biāo)志來(lái)“確保”數(shù)據(jù)有效卻拿到的仍然是一組半新半舊的數(shù)據(jù)。這個(gè)問題的典型特征是數(shù)組的前半部分是新數(shù)據(jù)后半部分還是上一輪的舊數(shù)據(jù)整體趨勢(shì)和真實(shí)波形對(duì)不上只有加大緩沖區(qū)或者用環(huán)形緩沖才稍微好一些。還有一種變體DMA在后臺(tái)寫入緩沖區(qū)的同一個(gè)bank而CPU同時(shí)在讀。在帶緩存的高性能MCU比如Cortex-M7內(nèi)核的STM32H7系列上還涉及D-Cache一致性問題。CPU讀到的可能是緩存里的舊值而DMA已經(jīng)把新數(shù)據(jù)寫進(jìn)了內(nèi)存——這兩者之間如果缺少緩存清理和失效操作數(shù)據(jù)對(duì)不上是必然的。解決這類問題的標(biāo)準(zhǔn)思路是雙緩沖DMA寫bank A時(shí)CPU讀bank B下一輪交替。兩個(gè)執(zhí)行流永遠(yuǎn)不觸碰同一塊內(nèi)存沖突自然消失。這個(gè)思路在單核上同樣適用而且實(shí)現(xiàn)成本很低。3. 單核線程沖突的三個(gè)“幫兇”硬件、編譯器和思維定式3.1 volatile不是鎖也不是“安全認(rèn)證”volatile大概是嵌入式C語(yǔ)言里被誤解最深的限定符。它的實(shí)際作用只有兩條告訴編譯器這個(gè)變量可能在當(dāng)前執(zhí)行流之外被修改因此每次訪問都必須從內(nèi)存重新讀取并且編譯器不能對(duì)它的讀寫做重排序。很多人把它當(dāng)成“線程安全”的標(biāo)志認(rèn)為一個(gè)變量加了volatile就萬(wàn)事大吉。用一句話戳破這個(gè)幻覺volatile根本不提供原子性也不提供互斥。它阻止的是編譯器玩花樣但擋不住中斷在兩個(gè)指令之間把系統(tǒng)打斷。舉個(gè)例子。32位MCU上讀寫一個(gè)32位變量通常對(duì)應(yīng)一條LDR或STR指令這種操作本身有原子性加成日常使用問題不大。但如果你在Cortex-M0這種只支持32位數(shù)據(jù)總線的內(nèi)核上讀寫一個(gè)64位的uint64_t變量一次賦值會(huì)編譯成兩條LDR或STR指令低32位和高32位是分兩次完成的。中斷完全可能在兩次寫入之間來(lái)臨于是線程A看到的值是“低32位新的、高32位舊的”這種縫合怪物。volatile解決不了這個(gè)問題它只是讓每一次讀寫都老老實(shí)實(shí)走內(nèi)存但“兩次讀寫之間的窗口”依然存在。真正適合volatile的場(chǎng)景是一個(gè)變量只被單個(gè)中斷處理程序和主循環(huán)共享。比如“中斷置位了一個(gè)標(biāo)志主循環(huán)檢查這個(gè)標(biāo)志”這種單寫單讀的場(chǎng)景volatile是夠用的。一旦有兩個(gè)執(zhí)行流同時(shí)寫一個(gè)變量或者需要保護(hù)一大段數(shù)據(jù)就需要臨界區(qū)、互斥量或者關(guān)中斷來(lái)解決。3.2 中斷嵌套與優(yōu)先級(jí)反轉(zhuǎn)單核也有排隊(duì)問題很多人以為優(yōu)先級(jí)反轉(zhuǎn)是多核系統(tǒng)或者復(fù)雜RTOS專屬的問題其實(shí)單核開發(fā)板上同樣存在而且表現(xiàn)形式很樸素。場(chǎng)景是這樣的低優(yōu)先級(jí)任務(wù)L持有一把互斥鎖正操作一個(gè)共享外設(shè)。高優(yōu)先級(jí)任務(wù)H需要這把鎖但它搶不到只能阻塞等待。如果在等待期間中等優(yōu)先級(jí)任務(wù)M一直就緒搶占式調(diào)度器會(huì)不斷讓M運(yùn)行L得不到CPU時(shí)間也就永遠(yuǎn)無(wú)法釋放鎖。結(jié)果高優(yōu)先級(jí)的H倒像是被中優(yōu)先級(jí)的M“壓制”住了。這就是教科書式的優(yōu)先級(jí)反轉(zhuǎn)。單核RTOS里一旦出現(xiàn)現(xiàn)象是“高優(yōu)先級(jí)任務(wù)偶爾響應(yīng)極慢”。由于它需要鎖才能繼續(xù)而鎖被低優(yōu)先級(jí)任務(wù)持有低優(yōu)先級(jí)又被中等優(yōu)先級(jí)不停搶占整個(gè)系統(tǒng)就像堵車一樣卡住。FreeRTOS的互斥量自帶優(yōu)先級(jí)繼承機(jī)制能有效緩解這個(gè)問題。但裸機(jī)環(huán)境沒有這層保護(hù)全靠中斷優(yōu)先級(jí)設(shè)計(jì)和臨界區(qū)的使用紀(jì)律來(lái)避免。另一個(gè)常見做法是限制中斷嵌套的深度不合理的優(yōu)先級(jí)分組會(huì)讓低優(yōu)先級(jí)中斷難以被響應(yīng)間接造成類似反轉(zhuǎn)的調(diào)度阻塞。3.3 緩存、總線和DMA單核CPU背后的“多主系統(tǒng)”把“單核”理解成“整個(gè)芯片只有一個(gè)主設(shè)備在干活”是另一種思維定式。現(xiàn)代MCU里的DMA控制器、以太網(wǎng)MAC、USB控制器、SDIO控制器都是可以獨(dú)立訪問內(nèi)存和寄存器的“總線主設(shè)備”。CPU雖然是單核但芯片內(nèi)部的訪存系統(tǒng)是一個(gè)不折不扣的多主系統(tǒng)。CPU和DMA同時(shí)訪問同一塊內(nèi)存時(shí)即便CPU是單核也存在內(nèi)存一致性問題。在帶D-Cache的內(nèi)核上DMA從外設(shè)搬數(shù)據(jù)到內(nèi)存CPU的緩存里可能還殘留舊值。CPU讀到的永遠(yuǎn)是緩存里的舊數(shù)據(jù)哪怕DMA已經(jīng)把內(nèi)存更新了。反過來(lái)CPU寫了數(shù)據(jù)到緩存還沒flush回內(nèi)存DMA就去內(nèi)存搬運(yùn)舊數(shù)據(jù)搬出去的也是錯(cuò)的。早期STM32F4這類不帶D-Cache的芯片上這個(gè)問題不明顯因?yàn)镃PU和數(shù)據(jù)總線之間是透?jìng)鞯?。但到了Cortex-M7、Cortex-A7這類高性能內(nèi)核緩存和一致性就成了繞不開的話題。很多人在正點(diǎn)原子RK3588、IMX6ULL這類Linux級(jí)別的板子上調(diào)試驅(qū)動(dòng)時(shí)遇到數(shù)據(jù)錯(cuò)亂一部分原因就在這個(gè)層面。所以“單核處理器開發(fā)板線程沖突”這個(gè)命題準(zhǔn)確地說應(yīng)該是“單核CPU執(zhí)行流沖突與片內(nèi)多主設(shè)備爭(zhēng)用問題的合集”。把所有沖突都?xì)w結(jié)為“線程代碼寫錯(cuò)了”會(huì)漏掉很大一片排查盲區(qū)。4. 定位沖突的實(shí)操手段先把“不可能”排除掉4.1 復(fù)現(xiàn)三件套改時(shí)序、加負(fù)載、調(diào)優(yōu)化級(jí)別線程沖突最磨人的地方在于復(fù)現(xiàn)不穩(wěn)定。很多時(shí)候你盯著代碼看不出任何問題因?yàn)樗_實(shí)“大多數(shù)時(shí)候是好的”。為了快速讓問題現(xiàn)形我調(diào)試時(shí)一般會(huì)依次做三件事。第一改變時(shí)序參數(shù)。把RTOS的SysTick頻率調(diào)高或者把任務(wù)優(yōu)先級(jí)之間差距拉大讓任務(wù)切換更頻繁。中斷觸發(fā)間隔縮短、DMA緩沖區(qū)調(diào)小、I2C速率調(diào)高都是行之有效的“加速器”。同一個(gè)bug在默認(rèn)參數(shù)下可能跑兩個(gè)小時(shí)才出現(xiàn)把定時(shí)器周期縮短十倍后可能兩三分鐘就暴露了。第二加大并發(fā)負(fù)載。讓容易沖突的任務(wù)在被保護(hù)區(qū)域外做更多無(wú)意義計(jì)算或者增加一個(gè)空轉(zhuǎn)的高優(yōu)先級(jí)任務(wù)專門擠壓低優(yōu)先級(jí)任務(wù)的執(zhí)行時(shí)間。這樣做的目的是增加任務(wù)切換的窗口數(shù)量提高交錯(cuò)概率。第三切換編譯器優(yōu)化級(jí)別。在O0下能跑對(duì)的程序開到O2或O3后出現(xiàn)數(shù)據(jù)錯(cuò)亂通常是內(nèi)存可見性或訪問次序被優(yōu)化掉了。反過來(lái)如果O0下都出錯(cuò)那基本可以排除編譯器搗亂問題一定出在運(yùn)行時(shí)的交錯(cuò)邏輯上。4.2 GPIO翻轉(zhuǎn)加邏輯分析儀讓亂序現(xiàn)出原形中斷和任務(wù)切換都是微秒級(jí)別的事件靠肉眼或者printf日志根本看不到。最廉價(jià)有效的手段是在關(guān)鍵代碼段的入口和出口各翻轉(zhuǎn)一根GPIO用邏輯分析儀抓波形直接測(cè)量這段代碼實(shí)際占用多少時(shí)間、在哪個(gè)位置被切走了。比如你懷疑I2C傳輸過程中被打斷就在I2C驅(qū)動(dòng)函數(shù)的開始和結(jié)束分別翻轉(zhuǎn)IO1和IO2。正常情況下一次完整的I2C寫操作對(duì)應(yīng)一個(gè)脈沖寬度固定的方波。當(dāng)兩個(gè)任務(wù)搶總線時(shí)你會(huì)看到脈沖被拉寬、中間出現(xiàn)一個(gè)平臺(tái)期說明某條執(zhí)行流在這個(gè)窗口里被調(diào)度器切走了。這種方法的優(yōu)勢(shì)是零侵入、零開銷。GPIO翻轉(zhuǎn)本身只花幾條指令對(duì)時(shí)序影響極小邏輯分析儀能記錄幾十萬(wàn)條波形足夠捕捉偶發(fā)問題。對(duì)比預(yù)期波形和實(shí)際波形往往一眼就能定位是哪個(gè)執(zhí)行流、在哪一段代碼、被搶占了多長(zhǎng)時(shí)間。4.3 別依賴斷點(diǎn)停下來(lái)的一刻沖突就跑了嵌入式開發(fā)的常規(guī)調(diào)試手段——斷點(diǎn)、單步、暫?!谂挪榫€程沖突時(shí)基本是失效的。原因不復(fù)雜你在斷點(diǎn)處停住CPU整個(gè)執(zhí)行流的推進(jìn)立刻凍結(jié)那個(gè)原本會(huì)被搶占的時(shí)間窗口也就不會(huì)出現(xiàn)。所以調(diào)試線程沖突時(shí)常見的經(jīng)歷是掛上調(diào)試器跑一整天沒事跑release版本不帶調(diào)試幾分鐘就崩了。替代方案是用無(wú)侵入日志。在關(guān)鍵位置寫入一個(gè)帶時(shí)間戳的環(huán)形緩沖區(qū)緩沖區(qū)滿了之后把內(nèi)容一次性dump出來(lái)看最后幾十條記錄。由于寫環(huán)形緩沖區(qū)本身只消耗幾微秒而且不會(huì)停止CPU它可以記錄到真正發(fā)生沖突那一刻前后發(fā)生了什么。Cortex-M系列內(nèi)核的ITMInstrumentation Trace Macrocell和SWO引腳也很好用可以直接把日志以極低的CPU開銷輸出到PC端。配合工具抓trace你甚至能看到任務(wù)切換的完整序列、每個(gè)中斷觸發(fā)的精確時(shí)刻以及每個(gè)變量的讀寫順序。這套工具鏈比斷點(diǎn)調(diào)試更適合線程沖突場(chǎng)景。5. 修復(fù)單核線程沖突的正解從鎖到不共享5.1 臨界區(qū)要短別在中斷里干重活臨界區(qū)critical section是最直接的沖突解決方案在訪問共享資源的代碼段前后關(guān)中斷或加鎖保證這段代碼不被切換打斷。單核處理器上最簡(jiǎn)單的實(shí)現(xiàn)就是關(guān)中斷和恢復(fù)中斷。在裸機(jī)環(huán)境中你可以用類似這種模式保護(hù)一個(gè)短臨界區(qū)uint32_t primask __get_PRIMASK(); __disable_irq(); // 這里訪問共享變量或外設(shè)寄存器整個(gè)過程不會(huì)被中斷打斷 shared_counter; shared_buffer[index] new_data; __set_PRIMASK(primask);但這套操作有嚴(yán)格的成本約束。關(guān)中斷的時(shí)間越長(zhǎng)系統(tǒng)對(duì)外設(shè)事件的響應(yīng)能力就越差。UART輸入緩沖只有幾十字節(jié)你關(guān)中斷超過一個(gè)字節(jié)的到達(dá)間隔就可能丟數(shù)據(jù)看門狗喂狗被打斷太久也可能直接觸發(fā)復(fù)位。所以臨界區(qū)的使用鐵律是只保護(hù)真正的共享操作保護(hù)區(qū)內(nèi)不做耗時(shí)運(yùn)算、不打日志、不調(diào)用任何可能長(zhǎng)時(shí)間阻塞的函數(shù)。典型可接受的臨界區(qū)長(zhǎng)度是幾十條指令以內(nèi)。如果你的臨界區(qū)代碼很長(zhǎng)第一步不是想辦法延長(zhǎng)關(guān)中斷時(shí)間而是重新設(shè)計(jì)數(shù)據(jù)結(jié)構(gòu)讓互斥的粒度變得更小。5.2 RTOS里用對(duì)互斥量和信號(hào)量進(jìn)入RTOS之后很多人會(huì)把互斥量和信號(hào)量混為一談。兩者在FreeRTOS里本質(zhì)都是基于隊(duì)列實(shí)現(xiàn)的但語(yǔ)義和用途完全不同?;コ饬縈utex用于資源互斥保護(hù)同一時(shí)刻只允許一個(gè)任務(wù)持有它持有者才能訪問共享資源訪問完后必須釋放。FreeRTOS的互斥量還帶優(yōu)先級(jí)繼承低優(yōu)先級(jí)任務(wù)持有鎖時(shí)若有高優(yōu)先級(jí)任務(wù)等待同一把鎖低優(yōu)先級(jí)任務(wù)會(huì)被臨時(shí)提升優(yōu)先級(jí)避免被中等優(yōu)先級(jí)任務(wù)餓死。信號(hào)量Semaphore用于任務(wù)同步和事件通知一個(gè)任務(wù)釋放信號(hào)量另一個(gè)任務(wù)獲取信號(hào)量表示“我有一個(gè)事件要通知你”。有的人喜歡用二值信號(hào)量當(dāng)作互斥量來(lái)保護(hù)共享資源這在功能上勉強(qiáng)可行但二值信號(hào)量沒有優(yōu)先級(jí)繼承一旦發(fā)生反轉(zhuǎn)高優(yōu)先級(jí)任務(wù)會(huì)被卡更久而且信號(hào)量能被任意“不知情”的任務(wù)釋放語(yǔ)義上更不安全。在ISR里標(biāo)準(zhǔn)做法是使用xSemaphoreGiveFromISR這類帶FromISR后綴的API來(lái)釋放信號(hào)量而不是直接操作互斥量。所有中斷安全的API都要求在ISR上下文里調(diào)用因?yàn)樗鼈儍?nèi)部會(huì)正確處理中斷嵌套的臨界區(qū)。如果開發(fā)中不小心在ISR里調(diào)用了xSemaphoreTake之類的阻塞APIFreeRTOS會(huì)立刻觸發(fā)configASSERT系統(tǒng)直接卡死在錯(cuò)誤斷言處。這個(gè)報(bào)錯(cuò)看起來(lái)嚇人其實(shí)是調(diào)度器在保護(hù)你——阻塞一個(gè)中斷上下文里的執(zhí)行流整個(gè)系統(tǒng)的中斷響應(yīng)都會(huì)癱瘓。5.3 更高級(jí)的解法數(shù)據(jù)所有權(quán)與消息隊(duì)列鎖能解決沖突但鎖本身也有開銷和風(fēng)險(xiǎn)死鎖、優(yōu)先級(jí)反轉(zhuǎn)、加鎖粒度不合適導(dǎo)致性能下降。在單核嵌入式環(huán)境下更好的思路往往不是“加鎖”而是從設(shè)計(jì)上避免共享。這里的關(guān)鍵方法是數(shù)據(jù)所有權(quán)。約定一個(gè)數(shù)據(jù)塊在同一時(shí)刻只歸一個(gè)執(zhí)行流所有。一個(gè)任務(wù)想用另一任務(wù)的數(shù)據(jù)時(shí)不能直接去讀對(duì)方的全局?jǐn)?shù)組而是通過消息隊(duì)列把數(shù)據(jù)“遞過去”。傳遞完成后發(fā)送方不再持有該數(shù)據(jù)的所有權(quán)接收方獨(dú)占它。這樣整個(gè)系統(tǒng)里不存在“兩個(gè)執(zhí)行流同時(shí)讀寫同一塊內(nèi)存”的情況鎖也就不需要了。FreeRTOS的隊(duì)列本身就是線程安全的它是少數(shù)幾個(gè)可以被任意任務(wù)和ISR安全調(diào)用的組件。利用隊(duì)列做數(shù)據(jù)傳遞比保護(hù)一堆全局變量簡(jiǎn)單可靠得多。唯一要注意的是隊(duì)列會(huì)涉及一次內(nèi)存拷貝對(duì)于大數(shù)據(jù)塊要評(píng)估拷貝開銷必要時(shí)用隊(duì)列傳指向內(nèi)存塊的指針配合內(nèi)存池管理所有權(quán)。在采集系統(tǒng)里雙緩沖和乒乓緩沖就是數(shù)據(jù)所有權(quán)思想的硬件體現(xiàn)。DMA寫完A區(qū)后通知CPU“數(shù)據(jù)在A區(qū)”CPU處理A區(qū)時(shí)DMA寫B(tài)區(qū)下次交替。兩個(gè)執(zhí)行流永遠(yuǎn)只碰各自的區(qū)域沖突和鎖全部消失。5.4 架構(gòu)級(jí)別的避坑習(xí)慣接觸線程沖突問題多了之后我總結(jié)出幾條從源頭上減少?zèng)_突概率的架構(gòu)習(xí)慣。中斷服務(wù)函數(shù)里只做三件事置位標(biāo)志位、讀寫輕量級(jí)緩沖區(qū)、觸發(fā)更高優(yōu)先級(jí)的外設(shè)操作。任何需要長(zhǎng)時(shí)間處理的東西都延后到主循環(huán)或?qū)S萌蝿?wù)里做。那些“順手在中斷里printf一下”、“順手在中斷里調(diào)用delay”的習(xí)慣遲早會(huì)以更隱蔽的線程沖突方式還回來(lái)。再有就是全局變量的治理。新建一個(gè)全局變量時(shí)先問自己誰(shuí)會(huì)寫它誰(shuí)會(huì)讀它寫和讀是否可能發(fā)生在不同的執(zhí)行流如果答案是“中斷和主循環(huán)都有訪問”那么這個(gè)變量必須配合volatile、臨界區(qū)或原子操作一起使用。很多老代碼編譯不報(bào)錯(cuò)、運(yùn)行不崩潰但就是會(huì)“偶爾不正?!备赐驮谟谖词鼙Wo(hù)的全局共享變量太多。最后一條是刻意制造時(shí)序壓力測(cè)試。開發(fā)完成后不要只跑正常邏輯我習(xí)慣把中斷頻率、任務(wù)負(fù)載、協(xié)議速率都往上調(diào)讓系統(tǒng)在高壓力下連續(xù)跑幾個(gè)小時(shí)或幾天。如果高壓力下不崩那正常負(fù)載下系統(tǒng)具備的容錯(cuò)余量就非常可觀了。這個(gè)方法在LTO優(yōu)化、高優(yōu)先級(jí)搶占、外設(shè)并發(fā)滿載等場(chǎng)景下特別管用。6. 一個(gè)完整復(fù)盤ESP32上溫度數(shù)據(jù)錯(cuò)亂的48小時(shí)最后分享一個(gè)我自己在ESP32開發(fā)板上處理的真實(shí)案例完整走一遍從現(xiàn)象到定位到修復(fù)的排查鏈路。項(xiàng)目是一個(gè)環(huán)境監(jiān)測(cè)節(jié)點(diǎn)ESP32跑FreeRTOS兩個(gè)任務(wù)任務(wù)A每500ms讀取一次BME280溫濕度傳感器任務(wù)B每100ms把最新數(shù)據(jù)刷新到SSD1306 OLED屏上。兩個(gè)任務(wù)復(fù)用了同一條I2C總線驅(qū)動(dòng)是兩個(gè)不同庫(kù)各自維護(hù)自己的狀態(tài)變量?,F(xiàn)象是溫度值每隔一段時(shí)間會(huì)跳變到0xFF或者一個(gè)明顯不對(duì)的數(shù)OLED屏幕上偶爾出現(xiàn)亂碼和雪花塊。嚴(yán)重的時(shí)候I2C總線像死掉一樣之后所有傳感器讀取全部失敗只有重啟才能恢復(fù)。第一個(gè)直覺是傳感器壞了。換了一顆全新BME280跑了半天問題依舊。然后把I2C速率從400kHz降到100kHz情況只是稍微好轉(zhuǎn)沒有根除。接著用GPIO翻轉(zhuǎn)加邏輯分析儀的方法在I2C驅(qū)動(dòng)讀寫的入口和出口各抓一根IO。波形出來(lái)后問題一目了然一次原本應(yīng)該在5ms內(nèi)完成的傳感器讀取實(shí)際占用了15ms中間出現(xiàn)了整整10ms的“空窗期”——任務(wù)在讀寫過程中被調(diào)度器切走了。被誰(shuí)切走的呢看任務(wù)優(yōu)先級(jí)發(fā)現(xiàn)任務(wù)BOLED刷新優(yōu)先級(jí)比任務(wù)A傳感器讀取高。把兩個(gè)任務(wù)的實(shí)時(shí)調(diào)度翻出來(lái)看問題鏈條非常清晰任務(wù)A發(fā)起I2C讀操作剛剛發(fā)完從設(shè)備地址、還沒讀完數(shù)據(jù)字節(jié)時(shí)任務(wù)B就緒搶占CPU開始執(zhí)行OLED的I2C寫操作。兩個(gè)執(zhí)行流同時(shí)操作同一套I2C控制器的寄存器數(shù)據(jù)線和時(shí)鐘線的時(shí)序被交錯(cuò)撕裂總線上出現(xiàn)了非法電平組合部分從設(shè)備直接進(jìn)入異常狀態(tài)。修復(fù)方案選了最直接的一種給I2C外設(shè)加互斥量。每個(gè)任務(wù)在發(fā)起I2C傳輸前xSemaphoreTake傳輸結(jié)束后xSemaphoreGive。兩個(gè)庫(kù)各自持有的狀態(tài)變量也被收攏到同一個(gè)模塊里確保I2C控制器的寄存器訪問始終在鎖保護(hù)范圍內(nèi)。FT5316——不對(duì)是BME280和SSD1306——從這一刻開始不會(huì)再被兩個(gè)執(zhí)行流并發(fā)操作了。加了互斥量之后同樣在高負(fù)載下連續(xù)跑了兩天溫度數(shù)據(jù)始終平穩(wěn)OLED顯示正常未再出現(xiàn)總線死鎖。接著我把架構(gòu)順手改成了數(shù)據(jù)所有權(quán)模式傳感器任務(wù)讀到的數(shù)據(jù)放進(jìn)隊(duì)列OLED任務(wù)只從隊(duì)列取數(shù)據(jù)兩個(gè)任務(wù)連共享全局變量都不存在了。I2C總線只在傳感器任務(wù)里被訪問OLED任務(wù)不再碰I2C控制器連互斥量都可以去掉。這48小時(shí)的經(jīng)驗(yàn)值得總結(jié)的其實(shí)就一句話單核開發(fā)板上的線程沖突天然比多核更隱蔽因?yàn)槟惚仨氃凇按a正確”之外還要意識(shí)到執(zhí)行流的交錯(cuò)隨時(shí)可能發(fā)生。學(xué)會(huì)用GPIO翻轉(zhuǎn)和邏輯分析儀把“看不見的切換”變成“看得見的波形”習(xí)慣用鎖保護(hù)臨界區(qū)、用隊(duì)列傳遞所有權(quán)很多讓新手抓狂的偶發(fā)bug都能以非常低的成本定位和修復(fù)。