
大家讀完覺得有幫助記得關(guān)注和點贊摘要無人機UAV圖像中的視覺定位旨在根據(jù)自然語言描述在復雜的鳥瞰場景中定位目標對象。然而大量小尺寸、密集分布且視覺相似的對象造成了高度的視覺冗余而重復的局部配置則帶來了強烈的拓撲模糊性?,F(xiàn)有方法主要側(cè)重于視覺-語言特征對齊或密集上下文交互但它們難以區(qū)分細微的實例間差異也無法有效利用空間拓撲結(jié)構(gòu)導致在高度擁擠的場景中定位不準確。為應對這些挑戰(zhàn)我們提出了GrabVG一種受人類視覺搜索啟發(fā)的全新視覺定位框架。GrabVG將定位明確分解為兩個順序階段預注意假設(shè)搜索和圖注意力特征綁定。具體而言我們首先通過蒸餾引導的候選提議歸納和文本感知的假設(shè)過濾生成一組緊湊可靠的對象假設(shè)大幅減少背景干擾和語義不匹配。然后這些假設(shè)被組織成一個稀疏圖其中語言引導的實例內(nèi)視覺線索和實例間拓撲關(guān)系通過圖注意力被聯(lián)合綁定和傳播實現(xiàn)高效的空間推理和準確的目標定位。在AerialVG和AerialSense上的大量實驗表明GrabVG在準確率和速度之間取得了有利的平衡分別達到67.31%和80.34%的Acc0.5相比相應基線分別提升了10.55和8.76個百分點。圖1視覺定位范式的比較?;€[19]現(xiàn)有方法依賴全局解碼或密集關(guān)系建模往往使視覺上相似的假設(shè)區(qū)分不足。人類視覺搜索[30, 25]預注意引導首先縮小搜索范圍隨后對判別性證據(jù)進行聚焦綁定。我們的方法GrabVG通過假設(shè)歸納、假設(shè)過濾和圖注意力特征綁定遵循這一漸進過程。1 引言無人機UAV圖像中的視覺定位旨在根據(jù)自然語言表達在鳥瞰場景中定位目標對象[19, 9, 4, 15]。與常規(guī)地面級圖像相比無人機場景通常包含大量小尺寸且密集分布的對象其中許多表現(xiàn)出高度相似的外觀[31, 46, 42, 19]。這些實例之間有限的視覺區(qū)分造成了高度的視覺冗余使得僅憑外觀線索不足以區(qū)分所指對象與附近的干擾物[19]。此外高仰角視角削弱了透視和深度線索同時使更多對象同時進入視野。因此對象常被壓縮成密集且重復的二維排列導致不同的目標假設(shè)共享相似的局部鄰域和相對空間配置。這種結(jié)構(gòu)相似的鄰域使得僅靠拓撲線索不足以唯一識別所指對象從而產(chǎn)生強烈的拓撲模糊性。現(xiàn)有視覺定位方法主要通過更強的視覺-語言對齊和上下文關(guān)系建模來應對這些挑戰(zhàn)。視覺-語言對齊方法增強表達條件化的視覺表示[7, 29]而基于關(guān)系的方法則納入實例間的空間配置[19]。然而跨模態(tài)對齊通常在大量中間查詢上進行可能不足以編碼細微的候選級差異。同時密集關(guān)系建模捕獲廣泛的成對交互可能使遙遠或弱相關(guān)的關(guān)系統(tǒng)干擾有用的局部上下文。因此現(xiàn)有方法在擁擠的無人機場景中可能仍難以獲得有區(qū)分力的候選表示和可靠的上下文證據(jù)。這些局限性源于所建模的證據(jù)和定位過程的組織方式。人類視覺搜索為組織這一過程提供了有用的原則。引導搜索表明預注意特征信號將視覺注意力偏向于一組有限的可能目標位置[30]而特征整合理論則認為需要聚焦注意力將分布式視覺特征綁定為連貫的對象表示[25]。受這種漸進過程的啟發(fā)我們將無人機視覺定位表述為預注意假設(shè)搜索后接圖注意力特征綁定前者將搜索空間約束到合理的目標假設(shè)后者則將每個存活的假設(shè)與判別性證據(jù)相關(guān)聯(lián)。如圖1所示我們將此表述實例化為GrabVG它將候選空間構(gòu)建與基于證據(jù)的所指對象選擇分離開來。在預注意假設(shè)搜索階段蒸餾引導的候選提議歸納從外部教師流水線傳遞表達對齊的對象提議而文本感知的假設(shè)過濾則濾除可能的背景查詢保留與指代表達對齊的前景候選。在圖注意力特征綁定階段剩余的假設(shè)被組織成一個稀疏幾何圖。實例內(nèi)外觀綁定用從對應區(qū)域及其緊鄰區(qū)域采樣的語言引導視覺細節(jié)補充每個圖節(jié)點而實例間拓撲綁定則在相鄰節(jié)點間交換邊條件化的空間信息。這種分離使GrabVG能夠保留細微的實例級外觀線索同時將關(guān)系推理限制在幾何上有意義的鄰域內(nèi)從而減少密集全對交互的干擾。在AerialVG和AerialSense上的大量實驗證明了GrabVG的有效性和效率。它在AerialVG上達到67.31%的Acc0.5在AerialSense上達到80.34%的Acc0.5相比相應基線分別提升了10.55和8.76個百分點同時保持有競爭力的推理速度。我們的主要貢獻總結(jié)如下? 我們將擁擠的無人機視覺定位重新表述為一個搜索-然后-綁定的問題將合理對象候選的構(gòu)建與外觀和關(guān)系證據(jù)的比較分離開來。這種表述為直接從密集視覺標記或無限制對象交互中解碼所指對象提供了一種明確的替代方案。? 我們?yōu)榇吮硎鲩_發(fā)了兩種互補機制。蒸餾引導的候選提議歸納和文本感知過濾建立了一個良好約束的、表達對齊的候選空間而語言引導的自適應采樣和邊感知圖注意力分別增強了節(jié)點外觀和建模局部幾何關(guān)系。? 在AerialVG和AerialSense上的綜合實驗證明了GrabVG的有效性和效率。消融研究進一步考察了候選提議監(jiān)督、候選過濾、自適應外觀采樣、圖拓撲以及不同偽標注來源的貢獻。2 相關(guān)工作視覺定位。 視覺定位根據(jù)自然語言表達定位圖像區(qū)域。早期的基于候選提議的方法使用外觀、位置和上下文線索對檢測區(qū)域進行排序[39, 38]而單階段和基于Transformer的方法則從跨模態(tài)表示中直接回歸所指區(qū)域[36, 18, 7, 13, 45]。后續(xù)研究通過語言引導的特征精化[37, 24]、動態(tài)視覺采樣[22]、語言無關(guān)標記移除[23]和解耦多模態(tài)融合[6]改善了視覺-語言對應關(guān)系。接地預訓練進一步將語言條件化定位與開放詞匯檢測統(tǒng)一起來[17, 20]而PropVG重新審視了候選提議驅(qū)動的定位[5]近期工作則探索了小目標REC的漸進精化[8]。然而這些方法大多在密集多模態(tài)特征上操作或?qū)νㄓ脜^(qū)域候選進行排序沒有明確地將候選篩選與實例級關(guān)系推理分開。無人機和遙感視覺定位。 遙感視覺定位面臨尺度變化、雜亂背景、高分辨率圖像和小目標的挑戰(zhàn)?,F(xiàn)有研究改善了跨模態(tài)對齊[40, 14, 29]、關(guān)系推理[19, 44]和語義-幾何建模[41, 3]。ProVG進一步采用漸進式勘測-定位-驗證策略將全局、關(guān)系和屬性線索順序注入密集視覺特征[16]。相比之下GrabVG首先篩選顯式對象候選然后在其局部視覺屬性和幾何鄰域上進行推理。推理中心的遙感定位。 近期方法如RSGround-R1和Geo-R1通過監(jiān)督推理軌跡和強化微調(diào)改善了定位[11, 43]。這些方法提供顯式的文本理據(jù)和改進的低樣本推理但需要額外的推理監(jiān)督或基于展開的優(yōu)化并帶來自回歸推理開銷。GrabVG則在稀疏候選圖上執(zhí)行固定深度的可微推理提供直接可檢查的節(jié)點-邊交互無需生成文本推理軌跡。視覺定位的關(guān)系建模。 關(guān)系上下文常用于區(qū)分視覺上相似的候選。早期方法將目標候選與周圍對象進行比較或?qū)⒈磉_分解為主體、位置和關(guān)系組件[39, 38]。后續(xù)基于圖的方法采用語言引導的節(jié)點和邊注意力[27]、跨模態(tài)關(guān)系圖[33]、動態(tài)多步推理[34]或?qū)R的語言和視覺場景圖[35]。然而這些關(guān)系通常在通用候選或?qū)挿赫Z義結(jié)構(gòu)上建模。AerialVG顯式捕獲了空中對象間的位置關(guān)系[19]但密集交互可能引入來自遙遠或弱相關(guān)實例的上下文。GrabVG則對由局部幾何鄰近性連接的已過濾候選應用語言條件化的圖注意力從而限制來自遙遠或弱相關(guān)實例的消息傳遞。圖2 GrabVG的整體架構(gòu)。(a) 給定無人機圖像和指代表達蒸餾引導的候選提議歸納首先生成初始假設(shè)集??。文本感知的假設(shè)過濾隨后移除背景查詢保留一個表達對齊的候選子集。得到的假設(shè)?_f由實例內(nèi)外觀綁定和實例間拓撲綁定處理隨后通過CRS進行最終目標選擇。(b) 實例內(nèi)外觀綁定從每個假設(shè)區(qū)域及其緊鄰區(qū)域采樣語言引導的視覺特征以獲得外觀感知表示Q?。(c) 實例間拓撲綁定使用語言條件化的邊特征在稀疏幾何圖上交換關(guān)系信息產(chǎn)生圖感知表示Q_g。3 方法3.1 概述給定無人機圖像 I ∈ ?^{H×W×3} 和指代表達 T {w_l}_{l1}^L視覺定位旨在用歸一化邊界框 b* ∈ [0,1]^4 定位 T 所描述的獨特實例。如圖2所示GrabVG通過顯式的候選構(gòu)建和基于圖的比較來解決所指對象而非從無約束的視覺標記集中直接解碼。視覺和語言編碼器首先產(chǎn)生多尺度圖像特征和標記級文本特征一個DETR風格的候選提議生成器 ?_ind [2, 47] 首先將多尺度視覺特征 F_img 映射到 N 個初始假設(shè)?? ?_ind(F_img) {(q_i?, b_i?)}_{i1}^N其中每個假設(shè)由一個解碼器表示及其歸一化邊界框組成。GrabVG隨后通過四個連續(xù)狀態(tài)逐步過濾和綁定這些假設(shè)這里文本感知的假設(shè)過濾 ?_filter 使用 F_txt 對初始假設(shè)進行評分保留 K 個前景候選形成 ?_f。實例內(nèi)外觀綁定 ?_app 用采樣的局部圖像特征更新它們的表示得到 ?_a。實例間拓撲綁定 ?_topo 隨后在鄰近候選間交換語言條件化的消息得到 ?_g。兩個綁定模塊中邊界框保持不變。令 ?_g {(q_j^g, b_j)}_{j1}^K。我們采用PropVG [5]的基于對比的參考評分CRS模塊進行最終所指對象選擇。CRS評估每個圖感知假設(shè)與指代表達的兼容性以產(chǎn)生參考分數(shù)同時保持關(guān)聯(lián)框不變3.2 預注意假設(shè)搜索定位標注僅識別所指實例對表示其他合理前景對象提供的監(jiān)督很少。因此僅以最終指代目標訓練的候選查詢可能接收不足的監(jiān)督無法在擁擠場景中形成良好約束的對象假設(shè)。預注意假設(shè)搜索分兩步解決此問題候選提議歸納從離線偽標注轉(zhuǎn)移表達對齊的監(jiān)督文本感知過濾則在更昂貴的綁定操作之前移除背景查詢。蒸餾引導的候選提議歸納。 為補充這種稀疏監(jiān)督我們遵循教師-學生知識遷移的原則[10]采用外部教師流水線 ?_tea [19, 20] 離線生成表達對齊的偽標注集其中 b?_r 表示一個偽前景框r* 標識對應于所指實例的偽標注。這些標注僅為訓練劃分生成驗證或推理期間不使用。為保證訓練期間的正指代監(jiān)督當沒有保留的教師預測滿足預定義匹配標準時會附加真實所指框。使用 F_img 作為視覺記憶候選提議生成器 ?_ind 采用 N 個可學習查詢和堆疊的查詢自注意力及多尺度可變形交叉注意力層產(chǎn)生概述中定義的初始假設(shè)集 ??。每個解碼器查詢附加一個前景分類頭和一個框回歸頭。它們的預測通過一對一二分匹配分配給 {b?_r}_{r1}^R并使用標準DETR分類、??回歸和廣義IoU損失進行優(yōu)化。這種監(jiān)督鼓勵解碼器查詢覆蓋多個表達對齊的前景假設(shè)并帶有準確框而非僅集中于標注的所指對象。文本感知的假設(shè)過濾。 盡管蒸餾改善了候選覆蓋?? 可能仍包含背景區(qū)域和與指代表達弱對齊的假設(shè)。因此我們在更昂貴的綁定操作之前采用輕量級文本感知過濾器進行粗粒度候選篩選。其目標是保留與指代表達對齊的前景假設(shè)而細粒度屬性和關(guān)系消歧則委托給后續(xù)的綁定和選擇模塊。令 Q? [q_1?, …, q_N?]。一個單交叉注意力塊[26]將語言上下文注入候選特征以進行相關(guān)性估計這里MHA(Q, K, V) 表示一個多頭注意力塊。保留得分最高的 K 個假設(shè)輔助特征 Q? 僅用于估計過濾分數(shù)而選中的原始解碼器特征 {q_{ω_j}?}_{j1}^K 被轉(zhuǎn)發(fā)到綁定階段。這分離了語言引導的假設(shè)選擇與后續(xù)的特征綁定過濾分數(shù)由 ?_filter 監(jiān)督。3.3 圖注意力特征綁定圖注意力特征綁定通過節(jié)點級視覺采樣和邊條件化消息傳遞更新圖。實例內(nèi)外觀綁定使用圍繞關(guān)聯(lián)框采樣的特征豐富每個節(jié)點而實例間拓撲綁定則在幾何上鄰近的候選間交換空間信息。實例內(nèi)外觀綁定。 在假設(shè)圖內(nèi)每個節(jié)點初始包含一個解碼器特征 q_j^f 及其關(guān)聯(lián)框 b_j (c_j, ρ_j)其中 c_j 和 ρ_j 分別表示歸一化框中心和大小。為用候選特定的視覺證據(jù)補充解碼器特征我們將每個假設(shè)與 M 個框相對錨點 {(a_m, p_m^base)}_{m1}^M 相關(guān)聯(lián)其中 a_m 是一個可學習查詢嵌入p_m^base 是其相對于假設(shè)框的預定義基位置。這些查詢嵌入首先以指代表達為條件隨后從假設(shè)表示和結(jié)果的語言感知錨點嵌入聯(lián)合預測候選特定的偏移這里A [a?, …, a_M] 和 A_t [a?^t, …, a_M^t] 分別表示原始和語言感知的錨點嵌入。因此預測位置既適應候選表示也適應語言上下文同時保持相對于候選框的位置。然后我們在這些位置采樣多尺度視覺特征并聚合以更新相應的假設(shè)這里Sample 表示從所有視覺特征層級進行可微雙線性采樣隨后進行跨尺度特征融合。得到的外觀感知假設(shè)集為 ?_a {(q_j^a, b_j)}_{j1}^K。實例間拓撲綁定。 外觀精化后假設(shè)框保持不變而節(jié)點屬性被替換為 {q_j^a}_{j1}^K。為捕獲局部空間配置而不引入干擾性的全對交互我們從分離的歸一化假設(shè)中心構(gòu)建一個對稱 k 近鄰圖并為每個節(jié)點包含一個自環(huán)自環(huán)允許每個節(jié)點在注意力聚合期間直接平衡自身外觀證據(jù)與來自鄰近假設(shè)的消息。圖連通性在所有圖注意力層中共享。對每條有向邊 j ← i我們從兩個框之間的相對中心位移、距離、方向和log尺度差異構(gòu)建一個幾何描述子 r_j^i。一個池化的句子表示 v_txt 然后調(diào)制投影的幾何描述子從 z_j^(0) q_j^a 開始我們在局部鄰域上執(zhí)行邊感知的圖注意力。為清晰起見注意力頭索引被省略邊條件化的鍵和偏置項確定分配給鄰近假設(shè)的注意力而邊條件化的值將關(guān)系信息注入聚合消息 m_j^{?}。圖塊然后通過殘差和前饋更新將該消息與先前節(jié)點狀態(tài)組合。經(jīng)過 L_g 個圖注意力層后一個學習的sigmoid門自適應地將圖傳播狀態(tài) z_j^{(L_g)} 與外觀感知表示 q_j^a 融合以產(chǎn)生 q_j^g。得到的圖感知假設(shè)集為 ?_g {(q_j^g, b_j)}_{j1}^K。3.4 訓練目標GrabVG通過候選提議歸納、假設(shè)過濾、定位和輔助分割目標聯(lián)合優(yōu)化候選提議歸納損失 ?_det 遵循DETR [2]結(jié)合前景分類、??框回歸和廣義IoU損失[21]。定位損失 ?_ref 和輔助分割損失 ?_mask 遵循PropVG [5]。對于假設(shè)過濾令 ? 表示歸納假設(shè)與偽標注之間的二分匹配。如果一個假設(shè)匹配到任何偽框則將其視為正過濾目標。令 i_r 表示匹配到所指偽標注的假設(shè)Ω 為保留的索引集。我們結(jié)合二元相關(guān)性監(jiān)督和一個抑制修剪所指假設(shè)的保留懲罰過濾目標執(zhí)行粗粒度前景篩選而最終所指對象區(qū)分由保留假設(shè)上的 ?_ref 監(jiān)督。4 實驗4.1 設(shè)置數(shù)據(jù)集。 我們在AerialVG [19]和AerialSense [9]的視覺定位子集上評估GrabVG。AerialVG包含5,000張高分辨率圖像、50,000個指代表達和103,000個邊界框我們遵循其官方訓練-測試劃分。AerialSense涵蓋不同的分辨率、光照條件和無人機場景由于沒有官方劃分我們使用前75%的樣本進行訓練剩余25%進行測試。指標。 我們報告Acc0.5Top1、Top-5 Acc0.5Top5和mIoU。Top1和Top5分別衡量最高得分預測或五個最高得分框中是否有IoU超過0.5mIoU是最高得分預測的平均IoU?;€。 我們的比較涵蓋通用視覺定位方法[5]、無人機特定視覺定位方法[19, 29]和零樣本定位方法[12]。實現(xiàn)細節(jié)。 遵循PropVG [5]我們采用BEiT-3 Base [28]骨干和三層可變形候選解碼器。圖像保持寬高比調(diào)整并填充到586×586最大文本長度為64。我們對AerialVG初始化N256個假設(shè)對AerialSense初始化N128個假設(shè)其中得分最高的50%被保留。外觀綁定使用48個自適應錨點而拓撲綁定在對稱6-NN圖上使用四個圖注意力層。模型使用Adam訓練AerialVG上36輪AerialSense上45輪新引入模塊的學習率為1.5×10??骨干為1.5×10??。除非另有說明我們對AerialVG使用AerialVG派生的偽標注對AerialSense使用Grounding-DINO派生的偽標注。過濾層使用八個注意力頭。訓練使用每GPU批量大小3梯度裁剪0.15和兩輪線性預熱。學習率隨后乘以0.1對AerialVG衰減在第24和32輪應用。4.2 與現(xiàn)有技術(shù)的比較AerialVG上的結(jié)果。 如表1所示我們將提出的GrabVG與近期方法進行比較包括零樣本多模態(tài)方法和全監(jiān)督空中特定模型。GrabVG在AerialVG測試集上達到最先進性能Top1為67.31%Top5為89.43%mIoU為53.34%。與最強單階段基線OTA-Det54.90%和密集關(guān)系模型AerialVG50.03%相比GrabVG的Top1分別提升了12.41和17.28個百分點。此外GrabVG在Top1上比超參數(shù)優(yōu)化的兩階段基線PropVG*高出10.55個百分點。這些結(jié)果表明表達對齊的候選提議監(jiān)督、局部視覺采樣和鄰域受限的圖推理在擁擠的無人機場景中提供了互補的收益。方法Top1 (%)Top5 (%)mIoU (%)零樣本方法ReX-Omni [12]28.3730.09-監(jiān)督方法TransVG [7]11.5313.68-D-MDETR [22]19.8729.87-G-DINO [20]29.3678.87-AerialVG [19]50.0387.00-PropVG [5]49.40-49.38PropVG* [5]56.7674.0546.76OTA-Det [29]54.90--GrabVG (Ours)67.3189.4353.34表1在AerialVG測試集上與最先進方法的比較?!?”表示通過超參數(shù)優(yōu)化獲得的結(jié)果。最佳結(jié)果以粗體顯示。Top1和Top5分別表示Acc0.5和Top-5 Acc0.5。AerialSense上的結(jié)果。 為評估GrabVG在多樣化無人機場景中的泛化能力我們在表2中報告了AerialSense上的結(jié)果。GrabVG達到最佳性能Top1為80.34%mIoU為72.00%。它在Top1上分別超過零樣本ReX-Omni和監(jiān)督AerialVG基線8.87和8.76個百分點。這些結(jié)果表明所提出的候選構(gòu)建和圖注意力綁定框架有效地泛化到AerialVG之外。方法類型Top1 (%)mIoU (%)大型多模態(tài)模型零樣本ReX-Omni [12]零樣本71.47-領(lǐng)域特定模型AerialVG [19]監(jiān)督71.58-PropVG* [5]監(jiān)督61.3067.76GrabVG (Ours)監(jiān)督80.3472.00表2在AerialSense基準上的性能。我們將GrabVG與近期零樣本多模態(tài)模型和空中特定監(jiān)督基線進行比較。4.3 綜合消融研究組件貢獻。 表3從優(yōu)化后的PropVG基線逐步評估每個組件該基線在原始真實標注上訓練達到56.76%的Top1。引入帶有表達對齊偽標注的蒸餾引導候選提議歸納將Top1提高到62.84%表明更密集的前景監(jiān)督產(chǎn)生更可靠和覆蓋更好的假設(shè)空間。加入實例內(nèi)外觀綁定進一步將Top1提高2.75個百分點至65.59%展示了恢復候選特定局部線索以區(qū)分視覺相似對象的收益。相比之下單獨使用實例間拓撲綁定獲得2.26個百分點的提升至65.10%表明鄰近假設(shè)間的局部幾何關(guān)系提供了有效的上下文證據(jù)。結(jié)合兩個綁定模塊達到67.01%確認細粒度外觀線索和實例間關(guān)系信息是互補的。最后文本感知假設(shè)過濾通過抑制特征綁定前的弱相關(guān)假設(shè)達到最佳的67.31% Top1。基線GrabVG組件測試驗證_tea?_app?_topo?_filterTop1Top5Top1Top5?56.7674.0555.9672.28??62.8485.5461.8285.04???65.5987.8965.4287.13???65.1088.0264.1587.86????67.0189.5267.1388.96?????67.3189.4367.4188.78表3AerialVG上的組件消融?;€是在原始真實標注上訓練的超參數(shù)優(yōu)化PropVG模型。_tea表示由訓練好的AerialVG教師離線生成的固定表達對齊偽標注?_app、?_topo和?_filter分別表示外觀綁定、拓撲綁定和文本感知過濾。?_topo使用對稱k-NN圖。4.4 進一步實驗分析過濾策略。 表4考察了應在何時以及以何種頻率篩選假設(shè)。所有變體使用相同的AerialVG派生偽標注進行候選提議歸納。用非極大值抑制NMS替換學習到的過濾器產(chǎn)生相似的Top1結(jié)果67.25% vs 67.31%和更高的Top5結(jié)果但NMS不利用指代表達。在外觀綁定前后都應用學習到的過濾器將Top1降低至66.75%。因此重復修剪可能在拓撲證據(jù)可用之前丟棄模糊但正確的假設(shè)。單次早期文本感知過濾器提供最佳的Top1同時使后續(xù)綁定階段聚焦于緊湊的候選集。流水線策略Top1 (%)Top5 (%)?_ind ?_topo無外觀綁定65.1088.02?_ind ?_app ?_topo NMS67.2590.03?_ind ?_filter ?_app ?_filter ?_topo66.7589.46?_ind ?_filter ?_app ?_topo67.3189.43表4AerialVG上的流水線設(shè)計選擇。僅改變歸納后的候選處理策略。外觀綁定設(shè)計。 表5研究了自適應采樣錨點的空間布局。這些實驗通過禁用過濾和拓撲綁定來隔離外觀綁定。單環(huán)和雙環(huán)布局達到64.36%至64.59%的Top1。尺度為[0.5, 1.0, 1.2]的三環(huán)布局將Top1提高到65.59%Top5提高到87.89%。因此覆蓋假設(shè)內(nèi)部、邊界和緊鄰區(qū)域比將所有采樣點集中在一兩個尺度上提供更有區(qū)分力的證據(jù)。錨點拓撲尺度Top1 (%)Top5 (%)單環(huán)[1.0]64.5987.15雙環(huán)[0.5, 1.0]64.5787.51雙環(huán)[1.0, 1.2]64.3687.56三環(huán)我們的[0.5, 1.0, 1.2]65.5987.89表5AerialVG上實例內(nèi)外觀綁定的消融。所有變體使用候選提議歸納后接外觀綁定過濾和拓撲綁定被禁用。拓撲和傳播深度。 表6比較了密集交互、Delaunay三角剖分和默認KNN圖同時保持其余流水線固定。密集全對交互僅達到63.98%的Top1與遙遠或弱相關(guān)候選引入干擾上下文的假設(shè)一致。Delaunay三角剖分將Top1提高到66.21%而6-NN圖達到67.31%。因此稀疏局部連通性在擁擠的無人機場景中比無限制交互更有效。深度比較揭示了一個互補的權(quán)衡。將圖從兩層增加到四層將Top1提高2.97個百分點并產(chǎn)生最高的Top5值。六層獲得最高的Top167.96%但降低Top5而八層則降低兩個指標。我們使用四層因為它們在不過度特征傳播的情況下提供最平衡的定位和候選召回性能。關(guān)系拓撲層數(shù)Top1 (%)Top5 (%)拓撲策略密集AerialVG風格463.9887.07KNN (k6)467.3189.43Delaunay三角剖分466.2188.65KNN (k6)的圖深度KNN264.3488.32KNN467.3189.43KNN667.9688.51KNN863.7987.58表6AerialVG上實例間拓撲綁定的消融。上塊改變圖結(jié)構(gòu)下塊僅改變默認KNN圖的深度。對假設(shè)先驗的魯棒性。 GrabVG可以用不同來源的候選提議監(jiān)督進行訓練。表7比較了原始訓練框、兩個開放詞匯偽標注流水線、AerialVG派生偽標注和一個包含所有真實框的神諭設(shè)置。相對于相應的源基線完整精化棧在所有非神諭來源上將Top1提高了2.18–4.47個百分點。在完美的神諭假設(shè)下即使省略過濾外觀和拓撲綁定仍然產(chǎn)生4.61個百分點的增益。這些一致的改進表明綁定模塊不依賴于單一教師或候選分布它們在次優(yōu)和理想的候選覆蓋下都保持有用。先驗來源源基線使用GrabVG增益(pp)訓練GT框56.7658.942.18LLM Grounding-DINO [20]56.8360.063.23LLM SAM3 [1]56.9760.363.39AerialVG派生 [19]62.8467.314.47神諭所有GT框?69.6274.234.61表7AerialVG測試集上對假設(shè)先驗的魯棒性。所有值為Top1Acc0.5。LLM表示Qwen3 [32]。?神諭設(shè)置提供所有真實框并省略?_filter。推理效率。 表8在相同評估設(shè)置下報告了推理速度。AerialVG以13.65 FPS運行而GrabVG達到28.51 FPS接近OTA-Det的32.00 FPS。沒有假設(shè)過濾時?_app和?_topo以25.09 FPS運行。引入?_filter減少了兩個綁定模塊處理的候選數(shù)量將速度提高到28.51 FPS。這些結(jié)果表明早期候選篩選恢復了圖注意力綁定引入的部分計算開銷。方法FPS (img/s)現(xiàn)有基線AerialVG [19]13.65OTA-Det [29]32.00GrabVG變體?_ind30.32 ?_app內(nèi)綁定30.03 ?_app ?_topo間綁定25.09 ?_filter ?_app ?_topo完整GrabVG28.51表8推理速度比較。GrabVG、其組件變體和現(xiàn)有基線在相同評估設(shè)置下的FPS結(jié)果。所有FPS結(jié)果在單個NVIDIA RTX 4090 GPU上測量。4.5 定性結(jié)果漸進消歧。 圖3說明了兩個綁定模塊如何逐步解決外觀和關(guān)系模糊性。沒有任一模塊時模型選擇一個外觀和相對位置都與表達不一致的藍色車輛。引入實例內(nèi)外觀綁定后預測轉(zhuǎn)移到一輛白色面包車表明語言引導的局部視覺采樣捕獲了所指的外觀屬性然而所選實例仍違反指定的“右下”關(guān)系。進一步加入實例間拓撲綁定后模型從鄰近假設(shè)傳播空間證據(jù)識別出周圍配置滿足表達的那輛白色面包車。圖3漸進特征綁定的定性消融。外觀綁定修正目標屬性而拓撲綁定解決剩余的空間模糊性。綁定機制可視化。 圖4展示了GrabVG如何綁定拓撲和外觀證據(jù)。上半部分中細黃色箭頭表示稀疏圖邊粗紅色箭頭標記最高注意力邊極坐標圖總結(jié)了高權(quán)重邊的方向。對于“左側(cè)的白色SUV”和“右上角的銀色轎車”主導方向分別指向西和東北表明實例間拓撲綁定強調(diào)與所描述空間關(guān)系一致的鄰近假設(shè)。下半部分中實例內(nèi)外觀綁定的前8個采樣點集中在所指對象和判別性區(qū)域如黑色SUV的深色車身和公交車的白色車頂及橙色車身。這些可視化共同表明兩個模塊分別捕獲了與表達相關(guān)的關(guān)系方向和細粒度局部外觀證據(jù)。圖4 圖注意力特征綁定的可視化。上稀疏圖邊和方向注意力分布粗紅箭頭表示最高注意力邊。下前8個自適應采樣點突顯外觀相關(guān)區(qū)域。5 結(jié)論我們提出了用于擁擠無人機圖像視覺定位的GrabVG。核心思想是將候選空間構(gòu)建與基于證據(jù)的所指對象選擇分開表達對齊的偽標注監(jiān)督和文本感知過濾首先建立一個可管理的候選池隨后自適應視覺采樣和稀疏圖注意力比較局部外觀和幾何鄰域信息。這種設(shè)計限制了背景查詢和遙遠候選交互的影響同時保留了區(qū)分鄰近、外觀相似對象所需的線索。GrabVG在AerialVG上達到67.31%的Top1在AerialSense上達到80.34%分別超過相應基線10.55和8.76個百分點。消融結(jié)果進一步表明候選提議監(jiān)督、外觀采樣、局部圖傳播和早期過濾在評估設(shè)置中提供了互補的改進。未來工作將探索場景自適應保留和鄰域設(shè)置。