![[論文分析]ZeroDayBench:面向網絡防御的未知零日漏洞LLM智能體評估](http://pic.xiahunao.cn/yaotu/[論文分析]ZeroDayBench:面向網絡防御的未知零日漏洞LLM智能體評估)
ZeroDayBench: Evaluating LLM Agents on Unseen Zero-Day Vulnerabilities for Cyberdefense論文重點ZeroDayBench是首個專門評估LLM智能體在真實零日漏洞場景下自主發(fā)現(xiàn)與修復能力的基準測試集。該研究通過將已知CVE漏洞移植到功能相似但代碼不同的開源項目中構建了22個前沿模型訓練數(shù)據中不存在的高危漏洞任務CVSS ≥ 7.0測試了GPT-5.2、Claude Sonnet 4.5和Grok 4.1三款主流模型的零樣本推理能力。研究發(fā)現(xiàn)即使在full-info完整信息條件下表現(xiàn)最佳的Claude Sonnet 4.5也僅達到95.7%的通過率而在真正的零日情境下無任何額外信息所有模型的成功率均僅為12%–14%——這揭示了一個核心結論前沿LLM尚不具備自主解決真實零日漏洞修復任務的能力。核心研究內容問題定義隨著LLM被越來越多地部署為自主軟件工程智能體其在代碼庫中自主發(fā)現(xiàn)和修復安全漏洞的能力備受關注。然而現(xiàn)有的網絡安全評估基準存在兩個根本性問題一是依賴模糊測試發(fā)現(xiàn)的漏洞或歷史CVE這些數(shù)據很可能已存在于模型訓練集中導致評估結果反映的是記憶檢索能力而非真正的推理能力二是現(xiàn)有基準多聚焦于低影響漏洞無法反映高風險安全場景的真實需求。ZeroDayBench旨在解決這兩個核心缺陷提供一種能夠衡量模型零樣本推理能力而非記憶能力的評估框架。創(chuàng)新方法1漏洞移植Vulnerability Porting這是ZeroDayBench最核心的技術創(chuàng)新。研究團隊并非直接使用已知CVE的原始漏洞代碼而是將真實CVE的根因移植到功能相似但代碼完全不同的目標倉庫中。例如Redis CVE-2023-41056是一個在SDS字符串緩沖區(qū)調整大小中導致堆溢出和RCE的整數(shù)溢出漏洞團隊將其移植到MinIO的wholeBitrotReader.ReadAt()函數(shù)中——該函數(shù)執(zhí)行類似的S3對象范圍讀取緩沖區(qū)操作使根因具備了可移植性。這種方法確保了漏洞在訓練數(shù)據中不存在極大降低了模型通過記憶來作弊的可能性。2五級信息可見度設計研究設計了五個難度級別來模擬漏洞生命周期的不同階段zero-day僅告知找到并修補一個高危漏洞無任何額外信息cwe給出CWE通用類別如內存破壞漏洞post-exploit提供攻擊者成功利用后的影響描述但不指明根因one-day告知具體哪個文件的哪個函數(shù)存在漏洞及問題性質full-info提供精確的修復位置和具體操作說明這種設計能夠精細測量智能體在不同信息量下的表現(xiàn)揭示模型在真實漏洞響應流程中各階段的能力邊界。3基于滲透測試的評估方法與傳統(tǒng)基準僅檢查補丁是否生成不同ZeroDayBench引入了自定義的滲透測試評估方法通過驗證修復后實時漏洞利用是否被阻止來評判補丁有效性。研究成果定量結果在三款模型的測試中Claude Sonnet 4.5以56.0%的總體通過率位居第一GPT-5.2以48.2%緊隨其后Grok 4.1 Fast為34.0%。在zero-day難度下三款模型表現(xiàn)相當12.8%、14.4%、12.1%但隨著信息量增加Claude Sonnet 4.5展現(xiàn)出更明顯的優(yōu)勢——在full-info條件下達到95.7%的通過率遠超GPT-5.2的76.2%和Grok的58.8%。行為分析研究發(fā)現(xiàn)了一個清晰的趨勢——信息越充分模型成功率越高這符合直覺但同時也說明當前模型在自主漏洞發(fā)現(xiàn)真正的零日場景方面能力嚴重不足。實際落地應用的可能性高可行性方向輔助安全審計在one-day及以上信息級別75%–95%成功率模型已能作為安全工程師的輔助工具在已知漏洞位置和類型的情況下生成有效補丁安全培訓與演練ZeroDayBench可作為紅隊演練的訓練平臺幫助安全團隊測試和提升LLM輔助漏洞修復的能力低可行性方向完全自主的零日漏洞發(fā)現(xiàn)與修復在zero-day級別12%–14%的成功率遠不能滿足生產環(huán)境的安全要求取代專業(yè)安全研究人員當前模型在缺乏明確指引時表現(xiàn)欠佳無法替代人類專家的判斷技術細節(jié)漏洞注入技術漏洞注入通過針對性的代碼修改實現(xiàn)主要包括將安全庫調用替換為不安全的等價調用移除認證檢查或輸入 sanitization例如移除MLFlow的quote()參數(shù) sanitization 函數(shù)以啟用 shell 注入CVE-2020-11978將GitPython切換為原始subprocess.run(shellTrue)調用CVE-2021-21300變體設計研究構建了兩種類型的任務變體跨倉庫變體Cross-repo variation將同一個CVE移植到多個目標中。例如CVE-2021-23017nginx DNS解析器中的off-by-one漏洞被移植到HAProxy、Squid和Tinyproxy三個C語言倉庫——它們各自以不同方式實現(xiàn)DNS解析。倉庫內變體Intra-repo variation在單個目標中實現(xiàn)同一根因的多種變體。Squid有7個CVE-2021-23017變體通過不同方法引入內存破壞移除長度檢查、整數(shù)下溢、空字節(jié)投毒、雙重釋放等Mosquitto有3個CVE-2024-42655變體使用不同的ACL繞過方法。智能體架構智能體采用簡單的循環(huán)架構基礎LLM配備兩個工具# 偽代碼示意classZeroDayAgent:tools[BashTool(# 執(zhí)行任意bash命令timeout120,# 超過120秒則取消max_output10000# 超過10000字符則截斷),EditTool()# 添加和編輯指定文件中的文本]max_turns100# 最大工具調用輪次terminationno tool callsormax turns reached漏洞復蓋范圍基準涵蓋的漏洞類型包括RCE遠程代碼執(zhí)行反序列化、命令注入、SSTI權限提升與認證繞過SQL注入內存破壞緩沖區(qū)溢出、off-by-one路徑遍歷涉及的開源項目包括MLFlow、Flyte、Mosquitto、vLLM、Dropbear、HAProxy、Squid、Tinyproxy、Jenkins、Minio、Verdaccio等。研究設定實驗配置配置項詳情評估時間2026年1月15日至2月1日測試模型GPT-5.2推理設為Medium、Claude Sonnet 4.5、Grok 4.1 Fast啟用推理最大工具調用輪次100輪Bash命令超時120秒輸出截斷閾值10,000字符運行環(huán)境Docker容器化環(huán)境漏洞來源與篩選漏洞選自NVD和cvedetails.com公共數(shù)據庫篩選標準包括CVSS評分 ≥ 7.0高危或嚴重主要攻擊向量包括RCE、權限提升、認證繞過、命令注入包含拒絕服務和內存破壞漏洞排除鏈式漏洞chained vulnerabilities硬件/軟件要求核心依賴Docker容器化隔離環(huán)境API訪問需要GPT-5.2、Claude Sonnet 4.5、Grok 4.1 Fast的API權限計算資源論文未明確說明具體硬件配置但考慮到涉及代碼庫編譯、測試執(zhí)行和LLM API調用建議具備至少16GB內存和多核CPU的中高端開發(fā)機器綜合分析研究團隊背景與可信度第一作者Nancy Lau是UC Santa Cruz計算機科學與工程系的博士生研究興趣聚焦于AI智能體的安全性此前有固件安全和CTF競賽背景。她曾創(chuàng)立本科網絡安全俱樂部并在SPAR項目下主導了AI漏洞檢測基準的創(chuàng)建。其博士提案聚焦于通過強化學習實現(xiàn)安全編碼智能體。共同作者Louis Sloot來自卡內基梅隆大學。HUD AI的Dylan Bowman等作者來自產業(yè)界。論文已被ICLR 2026的Agents in the Wild Workshop接收。從團隊構成來看該研究兼具學術嚴謹性UCSC、CMU等頂尖機構和產業(yè)相關性HUD AI的參與并非純理論推演。第一作者在AI安全領域的持續(xù)深耕從固件安全到CTF再到AI智能體安全為研究提供了扎實的技術功底。技術真實性評估漏洞移植方法的可行性該方法在技術上是真實且可行的。漏洞的根因root cause往往具有跨代碼庫的可移植性——例如緩沖區(qū)邊界檢查缺失、輸入驗證不足等邏輯缺陷可以在不同實現(xiàn)中出現(xiàn)。研究團隊選擇功能相似的代碼位置進行移植如Redis的SDS緩沖區(qū)和MinIO的S3范圍讀取這符合軟件安全研究的常規(guī)實踐。但需要指出的是嚴格保證這些補丁從未出現(xiàn)在訓練數(shù)據中是無法做到的——研究團隊自己也承認這一點將其定位為降低直接記憶信號的汙染控制方法而非絕對保證。評估方法的有效性基于滲透測試的補丁驗證方法比單純檢查補丁是否生成更為嚴格。這種方法能夠有效避免生成看似合理但實際無效的補丁這類假陽性在技術上是扎實的。模型選擇的合理性GPT-5.2、Claude Sonnet 4.5和Grok 4.1 Fast是2026年初的前沿模型在先前軟件工程基準上表現(xiàn)優(yōu)異選擇這三款具有代表性。核心洞見1零日漏洞修復能力的真實瓶頸12%–14%的zero-day成功率是一個警示性數(shù)據。它說明當前最先進的LLM在面對真正未知的漏洞時自主發(fā)現(xiàn)能力極為有限。這不是記憶與推理的爭論而是根本性的推理能力缺失——模型可以在被告知問題位置后有效修復full-info達95.7%但無法自主定位問題。2信息級別的階梯效應從zero-day12%到full-info95.7%Claude Sonnet 4.5的性能提升近乎線性。這說明漏洞修復的不同階段對AI能力的要求截然不同定位漏洞需要深度代碼理解和推理遠比修復漏洞需要代碼生成能力困難。這一發(fā)現(xiàn)對安全工具的設計具有重要指導意義——與其追求全自動漏洞修復不如先開發(fā)輔助定位自動修復的人機協(xié)作模式。3對AI取代安全工程師論調的審慎回應論文結果明確表明至少在零日漏洞防御領域AI遠未達到取代人類專家的水平。但這也意味著AI可以作為強大的輔助工具——在人類指明方向后高效完成修復工作。局限性漏洞移植的人工成本高每個漏洞需要人工分析根因、尋找可移植的目標代碼位置并進行修改難以大規(guī)模擴展評估模型的API依賴測試依賴特定商業(yè)模型的API結果可能隨模型版本更新而變化僅復蓋開源代碼庫對閉源商業(yè)軟件的可遷移性有待驗證排除鏈式漏洞現(xiàn)實中的零日漏洞往往是鏈式的簡化了評估場景實踐應用對安全工程師的建議1. 將LLM定位為高級修復助手而非自主安全分析師在zero-day和cwe級別12%–33%成功率讓LLM自主發(fā)現(xiàn)和修復漏洞風險極高。建議的工作流是人類定位漏洞 → LLM生成修復方案 → 人類審查驗證。在one-day及以上級別75%–95%成功率LLM可作為高效的補丁生成工具。2. 利用五級信息框架設計人機協(xié)作流程ZeroDayBench的信息級別設計本身就映射了真實漏洞響應流程漏洞發(fā)現(xiàn)階段對應zero-day/cwe依賴人類專家的代碼審計能力影響評估階段對應post-exploit人類分析攻擊面AI可輔助影響范圍評估修復實施階段對應one-day/full-infoAI高效生成補丁人類審查3. 警惕訓練數(shù)據汙染問題ZeroDayBench的漏洞移植方法提醒我們使用歷史CVE數(shù)據訓練或評估的AI安全工具可能存在嚴重的過擬合風險。在采購或部署AI安全產品時應要求供應商提供在未見漏洞上的評估數(shù)據。對研究者的建議1. 擴展漏洞移植的自動化程度當前人工移植成本高、規(guī)模小僅22個任務。未來研究可探索自動化漏洞模式提取與移植方法以構建更大規(guī)模的零日評估基準。2. 研究定位能力與修復能力的解耦論文暗示模型的定位能力遠弱于修復能力。這是一個值得深入研究的切入點——是否可以單獨訓練或微調模型的漏洞定位能力是否可以開發(fā)專門的漏洞定位智能體與漏洞修復智能體協(xié)作3. 探索強化學習在安全智能體中的應用第一作者Nancy Lau的博士研究恰好聚焦于此——通過RL實現(xiàn)安全編碼智能體。ZeroDayBench可作為這類研究的評估平臺測試RL增強的智能體是否能在zero-day場景中超越純LLM方法。參考資料來源原始論文: https://arxiv.org/pdf/2603.02297ICLR 2026 Workshop “Agents in the Wild”: https://iclr.cc/ Workshop信息作者信息: UC Santa Cruz (Nancy Lau), Carnegie Mellon University (Louis Sloot), HUD AI (Dylan Bowman, Mario Brajkovski, Jaideep Chawla), New York University (Dan Zhao)