景與AI代碼安全審查)
最近清理硬盤空間時(shí)陸陸續(xù)續(xù)看到不少“硬盤清理工具”尤其是一些分享帖子里連載了三四個(gè)腳本功能看起來(lái)挺全。點(diǎn)進(jìn)去仔細(xì)一看代碼風(fēng)格、變量命名、注釋節(jié)奏都很接近基本可以斷定這些工具并不是人手一字敲出來(lái)的而是用 AI 輔助生成后簡(jiǎn)單整理發(fā)出來(lái)的。這其實(shí)沒(méi)什么問(wèn)題。AI 生成工具腳本這件事本身不新鮮關(guān)鍵不在于“誰(shuí)寫的”而在于“代碼能不能用、安不安全、會(huì)不會(huì)誤刪文件”。硬盤清理本質(zhì)上是刪除操作一旦路徑寫錯(cuò)、條件判斷失誤、缺少回收機(jī)制輕則清理失敗重則把不該刪的東西刪了。所以這篇文章不打算只丟三個(gè)腳本給你就完事而是把三個(gè)常見(jiàn)場(chǎng)景下的“硬盤清理工具”完整拆開(kāi)逐個(gè)分析實(shí)現(xiàn)思路、運(yùn)行方式、代碼里的隱患以及拿到 AI 生成的清理腳本后應(yīng)該重點(diǎn)審查哪些地方。先交代一下適用讀者和前提。本文面向 Windows 環(huán)境下有一定 Python 基礎(chǔ)、但還沒(méi)有系統(tǒng)寫過(guò)系統(tǒng)清理類腳本的開(kāi)發(fā)者。三個(gè)工具都圍繞磁盤空間分析、臨時(shí)文件清理、重復(fù)文件處理這些高頻需求展開(kāi)代碼以 Python 實(shí)現(xiàn)使用標(biāo)準(zhǔn)庫(kù)為主盡量做到復(fù)制就能跑。第三個(gè)示例涉及少量可視化輸出其他兩個(gè)保持純命令行風(fēng)格便于理解邏輯和二次改造。先說(shuō)清楚一件事文章中展示的清理工具屬于常規(guī)的本地文件維護(hù)腳本應(yīng)用場(chǎng)景是清理自己電腦上可安全回收的臨時(shí)文件、分析磁盤占用、查找重復(fù)文件。文中所有刪除操作都會(huì)先預(yù)覽、后執(zhí)行或者默認(rèn)移入回收站而不是永久抹掉。任何寫入、刪除、移動(dòng)文件的操作都應(yīng)該先在測(cè)試目錄中驗(yàn)證生產(chǎn)環(huán)境或單位電腦上更要遵守最小權(quán)限原則。1. 背景為什么“硬盤清理工具”突然多起來(lái)了硬盤空間不足是幾乎每臺(tái)電腦都會(huì)遇到的問(wèn)題。Windows 的 C 盤尤其明顯用著用著就飄紅又不敢隨便刪文件怕把系統(tǒng)組件或軟件配置刪壞。常規(guī)做法是打開(kāi)“設(shè)置 - 系統(tǒng) - 存儲(chǔ)”看占用或者用系統(tǒng)自帶的磁盤清理工具清理 Windows 更新緩存但這兩個(gè)入口都比較粗糙看不到“哪個(gè)文件最占地方”也解決不了重復(fù)文件、軟件殘留這類問(wèn)題。近一兩年生成式 AI 在代碼生成上的能力提升很快用自然語(yǔ)言描述需求AI 可以輸出幾十行到幾百行的 Python 腳本。于是網(wǎng)上出現(xiàn)了大量“推薦三個(gè)工具”“親測(cè)有效的清理腳本”等帖子。這些帖子里的工具大多有一個(gè)共同特征批量產(chǎn)出、結(jié)構(gòu)雷同、代碼可用但沒(méi)有經(jīng)過(guò)充分邊界測(cè)試。作為開(kāi)發(fā)者直接運(yùn)行不熟悉的清理代碼風(fēng)險(xiǎn)不小更好的做法是自己理解腳本邏輯審查關(guān)鍵路徑再執(zhí)行。這正好對(duì)應(yīng)了三種最常見(jiàn)、也最適合用腳本解決的硬盤清理場(chǎng)景臨時(shí)文件清理系統(tǒng) Temp 目錄、軟件運(yùn)行緩存隨著時(shí)間累積可能占據(jù)幾個(gè) GB 到幾十個(gè) GB。重復(fù)文件查找下載目錄、照片備份、文檔復(fù)制粘貼過(guò)程中經(jīng)常產(chǎn)生內(nèi)容完全一樣但文件名不同的副本。磁盤空間分析硬盤“莫名其妙”滿了需要按目錄大小排序找出真正的大頭。下面三個(gè)“工具”就圍繞這三個(gè)場(chǎng)景展開(kāi)每個(gè)部分都會(huì)給出需求拆解、完整代碼、AI 生成代碼中常見(jiàn)的典型缺陷分析、運(yùn)行驗(yàn)證方式。2. 環(huán)境準(zhǔn)備與版本說(shuō)明本文示例以 Windows 10/11 Python 3.8 以上版本為基礎(chǔ)。多數(shù)代碼只使用標(biāo)準(zhǔn)庫(kù)不需要額外安裝第三方依賴其中send2trash屬于可選增強(qiáng)項(xiàng)不安裝也能運(yùn)行。2.1 開(kāi)發(fā)與運(yùn)行環(huán)境操作系統(tǒng)Windows 10 或 Windows 11部分代碼在 macOS/Linux 上也能運(yùn)行但路徑寫法需要調(diào)整。Python3.8 及以上版本代碼中使用了pathlib、typing、hashlib等常用標(biāo)準(zhǔn)庫(kù)模塊。命令行工具Windows Terminal 或 CMD、PowerShell。解釋器直接使用系統(tǒng) Python 環(huán)境即可不需要虛擬環(huán)境。如果你還沒(méi)裝 Python可以到 Python 官網(wǎng)下載安裝包安裝時(shí)注意勾選 “Add Python to PATH”。2.2 驗(yàn)證 Python 環(huán)境打開(kāi)命令行執(zhí)行python --version預(yù)期輸出類似Python 3.10.11如果提示python不是內(nèi)部或外部命令可以嘗試py --version或者重新安裝并勾選環(huán)境變量選項(xiàng)。2.3 項(xiàng)目文件組織本文不會(huì)創(chuàng)建復(fù)雜項(xiàng)目工程建議找一個(gè)干凈目錄存放腳本例如D:\cleanup_tools\ ├── 01_clean_temp.py ├── 02_find_duplicates.py └── 03_analyze_space.py三個(gè)腳本相互獨(dú)立不存在模塊依賴可以單獨(dú)運(yùn)行。后面每個(gè)腳本都會(huì)說(shuō)明建議的執(zhí)行權(quán)限和安全級(jí)別。3. 工具一系統(tǒng)臨時(shí)文件清理腳本3.1 場(chǎng)景分析Windows 系統(tǒng)使用過(guò)程中會(huì)產(chǎn)生大量臨時(shí)文件主要位置包括%TEMP%當(dāng)前登錄用戶的臨時(shí)目錄路徑類似C:\Users\用戶名\AppData\Local\Temp。C:\Windows\Temp系統(tǒng)級(jí)臨時(shí)目錄普通權(quán)限下部分文件可能無(wú)法刪除。這些目錄中的文件大多數(shù)是程序運(yùn)行時(shí)生成的中間產(chǎn)物。正常情況下程序退出時(shí)會(huì)自行清理但崩潰、異常關(guān)機(jī)、強(qiáng)制結(jié)束進(jìn)程都會(huì)留下殘骸時(shí)間一長(zhǎng)可能積累數(shù) GB 垃圾文件。3.2 使用 AI 生成時(shí)常見(jiàn)的提示詞先看一個(gè)可能最直接的需求描述用 Python 寫一個(gè)清理 Windows 臨時(shí)文件的腳本刪除路徑為用戶 TEMP 下的所有文件和文件夾刪除前先輸出統(tǒng)計(jì)信息。這類提示詞生成的版本往往能跑但有一個(gè)很大問(wèn)題默認(rèn)“刪除所有文件”沒(méi)有年齡限制也沒(méi)有預(yù)覽確認(rèn)運(yùn)行后可能直接刪掉某些程序仍在使用的臨時(shí)文件。3.3 經(jīng)過(guò)安全加固后的完整代碼下面這份代碼在原始“AI 生成版”基礎(chǔ)上做了幾處關(guān)鍵優(yōu)化默認(rèn)進(jìn)入--dry-run預(yù)覽模式只統(tǒng)計(jì)不刪除只有顯式傳入--delete參數(shù)才真正執(zhí)行刪除只刪除最后修改時(shí)間超過(guò) 7 天的文件降低誤刪概率遇到被占用文件時(shí)記錄到日志而不是中斷整個(gè)清理過(guò)程統(tǒng)計(jì)清理前后釋放的空間。# 文件路徑D:\cleanup_tools\01_clean_temp.py 系統(tǒng)臨時(shí)文件清理腳本 默認(rèn)預(yù)覽清理內(nèi)容傳入 --delete 參數(shù)后才會(huì)真正刪除。 只刪除最后修改時(shí)間超過(guò) expire_days 天的文件。 import argparse import logging import shutil import tempfile from datetime import datetime, timedelta from pathlib import Path def scan_temp_files(temp_dir: Path, expire_days: int 7): 掃描臨時(shí)目錄中超過(guò)指定天數(shù)的文件 file_list [] total_size 0 cutoff_time datetime.now() - timedelta(daysexpire_days) try: for item in temp_dir.rglob(*): try: if item.is_file(): mtime datetime.fromtimestamp(item.stat().st_mtime) if mtime cutoff_time: file_size item.stat().st_size file_list.append((item, file_size)) total_size file_size elif item.is_dir(): # 如果整個(gè)目錄的修改時(shí)間已經(jīng)很久可以標(biāo)記但不遞歸統(tǒng)計(jì) pass except PermissionError: logging.warning(f無(wú)權(quán)訪問(wèn): {item}) except FileNotFoundError: pass except Exception as e: logging.error(f掃描 {temp_dir} 時(shí)出錯(cuò): {e}) return file_list, total_size def preview_cleanup(file_list): 預(yù)覽模式只打印將被清理的文件 print(f發(fā)現(xiàn) {len(file_list)} 個(gè)可清理文件總大小: {format_size(total_size)}) print(預(yù)覽模式未刪除任何文件。如確認(rèn)清理請(qǐng)?zhí)砑?--delete 參數(shù)。) for path, size in file_list[:30]: print(f {format_size(size):10} {path}) if len(file_list) 30: print(f ... 其余 {len(file_list) - 30} 個(gè)文件未顯示) def do_cleanup(file_list): 真正執(zhí)行清理 freed_size 0 for path, _ in file_list: try: file_size path.stat().st_size path.unlink() freed_size file_size except PermissionError: logging.warning(f文件被占用或無(wú)權(quán)刪除: {path}) except FileNotFoundError: pass except Exception as e: logging.error(f刪除失敗: {path}, 錯(cuò)誤: {e}) return freed_size def format_size(size_bytes: int) - str: 將字節(jié)數(shù)格式化為人類可讀的字符串 if size_bytes 1024: return f{size_bytes} B elif size_bytes 1024 * 1024: return f{size_bytes / 1024:.1f} KB elif size_bytes 1024 * 1024 * 1024: return f{size_bytes / (1024 * 1024):.1f} MB else: return f{size_bytes / (1024 * 1024 * 1024):.2f} GB def main(): parser argparse.ArgumentParser(descriptionWindows 臨時(shí)文件清理工具) parser.add_argument(--delete, actionstore_true, help真正執(zhí)行刪除不加則只預(yù)覽) parser.add_argument(--days, typeint, default7, help只清理修改時(shí)間超過(guò) N 天的文件默認(rèn) 7 天) parser.add_argument(--system-temp, actionstore_true, help是否同時(shí)掃描系統(tǒng) Temp 目錄) args parser.parse_args() logging.basicConfig(levellogging.INFO, format%(levelname)s: %(message)s) targets [Path(tempfile.gettempdir())] if args.system_temp: targets.append(Path(C:/Windows/Temp)) total_free 0 for temp_dir in targets: if not temp_dir.exists(): print(f目錄不存在跳過(guò): {temp_dir}) continue print(f\n掃描目錄: {temp_dir}) file_list, total_size scan_temp_files(temp_dir, args.days) print(f發(fā)現(xiàn) {len(file_list)} 個(gè)可清理文件總大小: {format_size(total_size)}) if args.delete: freed do_cleanup(file_list) total_free freed print(f已清理釋放空間: {format_size(freed)}) else: print(預(yù)覽模式未刪除任何文件。如確認(rèn)清理請(qǐng)?zhí)砑?--delete 參數(shù)。) if args.delete: print(f\n所有目錄清理完成共釋放空間: {format_size(total_free)}) if __name__ __main__: main()3.4 運(yùn)行方式與預(yù)期輸出先以預(yù)覽模式運(yùn)行python 01_clean_temp.py如果某個(gè)臨時(shí)目錄中有超過(guò) 7 天未修改的文件會(huì)輸出類似掃描目錄: C:\Users\testuser\AppData\Local\Temp 發(fā)現(xiàn) 1268 個(gè)可清理文件總大小: 856.3 MB 預(yù)覽模式未刪除任何文件。如確認(rèn)清理請(qǐng)?zhí)砑?--delete 參數(shù)。確認(rèn)文件列表沒(méi)有問(wèn)題后再真正刪除python 01_clean_temp.py --delete此時(shí)被占用的文件會(huì)記錄為 warning其余正常刪除。如果還想連同系統(tǒng) Temp 一起掃描需要以管理員身份運(yùn)行命令行python 01_clean_temp.py --delete --system-temp3.5 這一類腳本的重點(diǎn)審查項(xiàng)AI 生成的臨時(shí)文件清理腳本最容易出現(xiàn)三個(gè)問(wèn)題問(wèn)題 1用shutil.rmtree直接刪除整個(gè) Temp 目錄某些版本會(huì)找出所有文件夾后直接shutil.rmtree(folder)。Temp 目錄中如果存在被其他進(jìn)程占用的文件會(huì)觸發(fā) PermissionError更危險(xiǎn)的是如果路徑變量沒(méi)拼對(duì)可能誤刪到別的目錄。比較好的方式是用精確匹配的unlink()刪具體文件目錄留給系統(tǒng)后續(xù)處理。問(wèn)題 2沒(méi)有預(yù)覽機(jī)制真正的清理工具應(yīng)該默認(rèn)“干跑”dry run只有用戶顯式確認(rèn)后才執(zhí)行。上面代碼用--delete參數(shù)區(qū)分第一次運(yùn)行永遠(yuǎn)只輸出統(tǒng)計(jì)信息是一個(gè)穩(wěn)妥的習(xí)慣。問(wèn)題 3忽略了文件占用很多程序會(huì)把臨時(shí)文件打開(kāi)后一直持有句柄刪不掉很正常。正確做法是一邊刪一邊捕獲PermissionError把刪不掉的文件列出來(lái)而不是中斷整個(gè)任務(wù)。4. 工具二重復(fù)文件查找工具4.1 場(chǎng)景分析重復(fù)文件是硬盤空間的隱性殺手尤其是圖片備份、視頻素材、文檔存檔和下載目錄。有些文件內(nèi)容完全相同只是文件名不同甚至同一個(gè)文件在不同目錄各存了一份手動(dòng)查找很難。常用方案有兩種按文件名和大小索引先排除不可能是重復(fù)的候選對(duì)候選文件計(jì)算哈希值如 MD5內(nèi)容相同則哈希一致確定為重復(fù)文件。4.2 算法思路完整實(shí)現(xiàn)思路分三步遍歷目標(biāo)目錄按文件大小分組。文件大小不同的兩個(gè)文件不可能重復(fù)可以提前過(guò)濾大部分文件避免對(duì)全盤所有文件做哈希計(jì)算。對(duì)同一大小分組中的文件計(jì)算 MD5。MD5 存在理論上的碰撞可能但在硬盤清理場(chǎng)景中用于普通重復(fù)文件識(shí)別已經(jīng)足夠。把哈希值相同的文件歸為一組輸出重復(fù)組列表并匯總可釋放的空間。4.3 完整代碼# 文件路徑D:\cleanup_tools\02_find_duplicates.py 重復(fù)文件查找工具 通過(guò)文件大小 MD5 哈希雙層篩選找出目標(biāo)目錄中的重復(fù)文件。 默認(rèn)只打印結(jié)果并統(tǒng)計(jì)可釋放空間不執(zhí)行刪除。 如果需要清理建議先人工確認(rèn)重復(fù)組列表再使用其他工具或手動(dòng)移入回收站。 import argparse import hashlib import os from collections import defaultdict from pathlib import Path from typing import Dict, List def format_size(size_bytes: int) - str: if size_bytes 1024: return f{size_bytes} B elif size_bytes 1024 * 1024: return f{size_bytes / 1024:.1f} KB elif size_bytes 1024 * 1024 * 1024: return f{size_bytes / (1024 * 1024):.1f} MB else: return f{size_bytes / (1024 * 1024 * 1024):.2f} GB def file_md5(file_path: Path, chunk_size: int 1024 * 1024) - str: 計(jì)算文件 MD5 值分塊讀取避免占用大量?jī)?nèi)存 md5 hashlib.md5() with open(file_path, rb) as f: while chunk : f.read(chunk_size): md5.update(chunk) return md5.hexdigest() def group_files_by_size(root_dir: Path) - Dict[int, List[Path]]: 第一輪篩選按文件大小分組 size_groups defaultdict(list) total_files 0 for root, _, files in os.walk(root_dir): for name in files: file_path Path(root) / name try: size file_path.stat().st_size if size 0: # 空文件不參與比較它們本來(lái)就是重復(fù)的 size_groups[size].append(file_path) total_files 1 except (PermissionError, FileNotFoundError): continue # 只保留同一大小下出現(xiàn)多個(gè)文件的組 return {size: paths for size, paths in size_groups.items() if len(paths) 1} def find_duplicate_groups(size_groups: Dict[int, List[Path]]) - List[List[Path]]: 第二輪篩選對(duì)同大小文件計(jì)算哈希找出重復(fù)組 hash_groups defaultdict(list) checked_count 0 total_groups len(size_groups) for size, paths in size_groups.items(): checked_count 1 print(f處理中: {checked_count}/{total_groups} 組當(dāng)前文件數(shù) {len(paths)}) for file_path in paths: try: digest file_md5(file_path) hash_groups[(size, digest)].append(file_path) except (PermissionError, FileNotFoundError): continue duplicate_groups [] for (size, digest), paths in hash_groups.items(): if len(paths) 1: duplicate_groups.append(paths) return duplicate_groups def main(): parser argparse.ArgumentParser(description重復(fù)文件查找工具) parser.add_argument(directory, help要掃描的目錄) args parser.parse_args() target_dir Path(args.directory) if not target_dir.exists() or not target_dir.is_dir(): print(f目錄不存在: {args.directory}) return print(f正在掃描目錄: {target_dir}) size_groups group_files_by_size(target_dir) print(f按大小分組完成發(fā)現(xiàn) {len(size_groups)} 組可能重復(fù)的文件) duplicate_groups find_duplicate_groups(size_groups) if not duplicate_groups: print(未發(fā)現(xiàn)重復(fù)文件。) return total_wasted 0 print(f\n發(fā)現(xiàn) {len(duplicate_groups)} 組重復(fù)文件) for idx, group in enumerate(duplicate_groups, start1): size group[0].stat().st_size # 保留一個(gè)文件其余算作可釋放空間 wasted size * (len(group) - 1) total_wasted wasted print(f\n[重復(fù)組 {idx}] 文件大小: {format_size(size)}) print(f 可釋放空間: {format_size(wasted)}) for path in group: print(f {path}) print(f\n共可釋放空間: {format_size(total_wasted)}) print(提示以上重復(fù)文件未執(zhí)行刪除請(qǐng)人工確認(rèn)后在文件管理器中自行處理。) if __name__ __main__: main()4.4 運(yùn)行方式與預(yù)期輸出python 02_find_duplicates.py D:\photo掃描過(guò)程中會(huì)顯示分組處理進(jìn)度正在掃描目錄: D:\photo 按大小分組完成發(fā)現(xiàn) 35 組可能重復(fù)的文件 處理中: 1/35 組當(dāng)前文件數(shù) 2 ... 發(fā)現(xiàn) 6 組重復(fù)文件 [重復(fù)組 1] 文件大小: 12.3 MB 可釋放空間: 12.3 MB D:\photo\beijing\IMG_20230101_1.jpg D:\photo\backup\IMG_20230101_1_copy.jpg4.5 這一類腳本的重點(diǎn)審查項(xiàng)問(wèn)題 1一上來(lái)就給全盤文件計(jì)算 MD5如果不做第一輪大小分組幾萬(wàn)個(gè)文件全部算一遍哈希耗時(shí)會(huì)非常長(zhǎng)。上面的腳本先用os.path.getsize分組只在同大小文件之間做哈希對(duì)比這是文件去重工具最基本的優(yōu)化思路。問(wèn)題 2直接把重復(fù)文件刪除只保留一個(gè)“重復(fù)文件”和“該刪哪個(gè)”之間不能直接畫(huà)等號(hào)。兩個(gè)同內(nèi)容的文件分布在不同項(xiàng)目目錄下可能各自有引用路徑刪掉一個(gè)會(huì)導(dǎo)致某個(gè)項(xiàng)目文件缺失。上面的腳本刻意沒(méi)有提供刪除功能只輸出重復(fù)組和可釋放空間具體如何處理留給使用者判斷。這一點(diǎn)非常重要也是 AI 生成代碼經(jīng)常忽略的。問(wèn)題 3沒(méi)有處理掃描大目錄時(shí)的內(nèi)存壓力os.walk會(huì)把目錄樹(shù)逐層展開(kāi)如果目標(biāo)目錄有幾十萬(wàn)個(gè)文件size_groups會(huì)占用大量?jī)?nèi)存。上面代碼只是一個(gè)基礎(chǔ)版本對(duì)超大目錄還可以引入先按目錄分塊掃描、再合并結(jié)果的方案不過(guò)對(duì)于日常幾百 GB 的資料目錄已經(jīng)夠用。5. 工具三磁盤空間分析工具5.1 場(chǎng)景分析前兩個(gè)工具解決的是“已知垃圾往哪里清理”的問(wèn)題第三個(gè)工具解決的是“硬盤滿了但不知道什么最占地方”的定位問(wèn)題。Windows 自帶的存儲(chǔ)設(shè)置在顯示大文件時(shí)體驗(yàn)一般。用 Python 做磁盤空間分析核心是遍歷指定目錄統(tǒng)計(jì)每個(gè)子目錄的總大小將結(jié)果排序輸出篩選出占用最多的文件。還可以把目錄大小和文件大小分開(kāi)展示目錄層面找“大樹(shù)”文件層面找“大魚(yú)”。如果目標(biāo)目錄是整塊硬盤遍歷一遍可能耗時(shí)較長(zhǎng)建議先指定某個(gè)大分區(qū)例如D:\再看前 20 個(gè)子目錄的占用情況。5.2 完整代碼# 文件路徑D:\cleanup_tools\03_analyze_space.py 磁盤空間分析工具 分析指定目錄下哪些子目錄和單個(gè)文件占用空間最大。 允許設(shè)置最小文件大小過(guò)濾掉小文件聚焦空間大頭。 import argparse import os from pathlib import Path from typing import Dict, List, Tuple def format_size(size_bytes: int) - str: if size_bytes 1024: return f{size_bytes} B elif size_bytes 1024 * 1024: return f{size_bytes / 1024:.1f} KB elif size_bytes 1024 * 1024 * 1024: return f{size_bytes / (1024 * 1024):.1f} MB else: return f{size_bytes / (1024 * 1024 * 1024):.2f} GB def get_dir_size(path: Path, min_size: int 0) - Tuple[int, List[Dict]]: 統(tǒng)計(jì)目錄總大小同時(shí)記錄超過(guò) min_size 的大文件 total_size 0 big_files [] try: for item in path.rglob(*): try: if item.is_file(): size item.stat().st_size total_size size if size min_size: big_files.append({path: item, size: size}) except (PermissionError, FileNotFoundError, OSError): continue except (PermissionError, FileNotFoundError): pass return total_size, big_files def analyze_subdirs(root_dir: Path, top_n: int 20): 分析根目錄下的第一層子目錄 subdirs [] try: for child in root_dir.iterdir(): if child.is_dir(): size, _ get_dir_size(child) subdirs.append((child, size)) except PermissionError: print(f無(wú)權(quán)訪問(wèn)根目錄: {root_dir}) subdirs.sort(keylambda x: x[1], reverseTrue) return subdirs[:top_n] def main(): parser argparse.ArgumentParser(description磁盤空間分析工具) parser.add_argument(directory, help要分析的目錄) parser.add_argument(--top, typeint, default20, help顯示子目錄數(shù)量默認(rèn) 20) parser.add_argument(--min-size, typeint, default100 * 1024 * 1024, help只列出超過(guò)該大小字節(jié)的文件默認(rèn) 100MB) args parser.parse_args() root_dir Path(args.directory) if not root_dir.exists() or not root_dir.is_dir(): print(f目錄不存在: {args.directory}) return print(f正在分析目錄: {root_dir}) print(此過(guò)程可能需要一定時(shí)間請(qǐng)耐心等待...\n) # 分析子目錄 subdirs analyze_subdirs(root_dir, args.top) print(占用空間最大的子目錄) print(f{序號(hào):4}{大小:12} {路徑}) for idx, (path, size) in enumerate(subdirs, start1): print(f{idx:4}{format_size(size):12} {path}) # 分析根目錄下的大文件 total_size, big_files get_dir_size(root_dir, min_sizeargs.min_size) big_files.sort(keylambda x: x[size], reverseTrue) print(f\n分析完成目標(biāo)目錄總大小: {format_size(total_size)}) print(f空間占用最大的文件超過(guò) {format_size(args.min_size)}) for idx, file_info in enumerate(big_files[:20], start1): print(f{idx:4}{format_size(file_info[size]):12} {file_info[path]}) if not big_files: print(未找到超過(guò)閾值的大文件。) if __name__ __main__: main()5.3 運(yùn)行方式與預(yù)期輸出分析某個(gè)磁盤或目錄python 03_analyze_space.py D:\如果只想掃描指定目錄比如D:\data可以執(zhí)行python 03_analyze_space.py D:\data輸出類似占用空間最大的子目錄 序號(hào) 大小 路徑 1 65.2 GB D:\data\videos 2 30.1 GB D:\data\datasets 3 12.8 GB D:\data\backup 分析完成目標(biāo)目錄總大小: 150.3 GB 空間占用最大的文件超過(guò) 100.0 MB 1 4.2 GB D:\data\videos\movie.mp4 2 2.1 GB D:\data\datasets\train.zip有一點(diǎn)需要注意分析一個(gè)大型目錄時(shí)腳本會(huì)對(duì)每個(gè)子目錄做一次完整遞歸遍歷隨后還會(huì)對(duì)根目錄再遍歷一遍所以時(shí)間開(kāi)銷大約是兩次全量掃描。對(duì)于日常分析已經(jīng)夠用但如果你想做更高效的單次遍歷版本可以合并邏輯在一遍遍歷中同時(shí)累計(jì)各子目錄大小并記錄大文件。這里保留兩遍遍歷是為了讓代碼邏輯更清晰方便二次修改。5.4 這一類腳本的重點(diǎn)審查項(xiàng)問(wèn)題 1遍歷超大型目錄時(shí)速度不理想磁盤分析腳本最容易讓人等得不耐煩。如果只想快速定位是哪幾個(gè)大目錄占了空間第一層子目錄掃描本身就可以橫向?qū)Ρ?。?shí)際使用中建議先用系統(tǒng)自帶存儲(chǔ)分析工具粗篩再用這個(gè)腳本做細(xì)粒度確認(rèn)。問(wèn)題 2過(guò)濾閾值過(guò)大或過(guò)小上面把默認(rèn)--min-size設(shè)成了 100MB是因?yàn)榍謇泶疟P空間時(shí)真正影響大局的是 GB 級(jí)文件100MB 以下文件數(shù)量太多反而干擾判斷。你可以根據(jù)目標(biāo)磁盤情況調(diào)整這個(gè)參數(shù)。問(wèn)題 3遇到系統(tǒng)目錄時(shí)權(quán)限不足有些目錄如System Volume Information普通權(quán)限根本無(wú)法訪問(wèn)因此代碼中大量使用了PermissionError捕獲。分析 C 盤時(shí)建議以管理員身份運(yùn)行 PowerShell 或終端會(huì)減少這類不可讀目錄的影響。6. 拿到 AI 生成的清理腳本后重點(diǎn)審查什么回到標(biāo)題里的那句話“都是不是人寫的?!盇I 生成工具已經(jīng)是現(xiàn)實(shí)很多你從網(wǎng)上下載到的清理腳本甚至部分付費(fèi)工具的內(nèi)核邏輯都可能是 AI 生成的。代碼能不能用已經(jīng)不是最大的問(wèn)題真正需要保證的是生成的代碼是否安全是否適合你當(dāng)前的運(yùn)行環(huán)境。6.1 先把“刪除”換成“打印”審查任何清理類腳本時(shí)第一時(shí)間找到所有包含remove、unlink、rmtree、delete、os.remove的代碼行看附近是否有注釋或保護(hù)條件。穩(wěn)妥的第一步是把刪除函數(shù)改成打印路徑先跑一遍看看腳本到底會(huì)動(dòng)哪些文件。確認(rèn)無(wú)誤后再恢復(fù)刪除效果。6.2 路徑不要硬編碼AI 模型在生成 Windows 清理腳本時(shí)很容易寫出類似C:\Users\UserName\AppData這樣的固定路徑但這個(gè)路徑在讀者電腦上往往并不存在。更好的做法是用Path.home()獲取當(dāng)前用戶目錄或用tempfile.gettempdir()獲取系統(tǒng)臨時(shí)目錄避免因?yàn)橛脩裘煌瑢?dǎo)致腳本失效也避免誤刪別人的用戶名目錄。6.3 刪除前先嘗試移入回收站永久刪除的文件恢復(fù)成本很高回收站機(jī)制相當(dāng)于給了自己一次后悔的機(jī)會(huì)。Python 的send2trash庫(kù)支持把文件移到回收站# 需要先安裝pip install send2trash from send2trash import send2trash send2trash(D:\\temp\\test.txt)如果不想引入額外依賴最簡(jiǎn)單的替代方案是把“要?jiǎng)h除的文件”移動(dòng)到一個(gè)臨時(shí)備份目錄中確認(rèn)程序無(wú)異常后再手動(dòng)清空。這種方案對(duì)清理工具來(lái)說(shuō)尤其重要因?yàn)槟阌肋h(yuǎn)無(wú)法保證自己的判斷是 100% 正確的。6.4 關(guān)注異常捕獲范圍AI 生成的腳本往往只對(duì)主流程做 try-except忽略了很多邊界條件。清理腳本運(yùn)行中可能出現(xiàn)的異常不僅限于 PermissionError還包括FileNotFoundError文件可能在掃描后被其他程序刪除OSError目錄被占用或路徑含有非法字符KeyboardInterrupt用戶中途 CtrlC 退出需要保證部分刪除記錄可查。一個(gè)穩(wěn)健的做法是每個(gè)文件的刪除都單獨(dú) try-except并且把失敗原因?qū)懭肴罩疚募皇?console 一閃而過(guò)。6.5 最小權(quán)限原則無(wú)論腳本本身如何設(shè)計(jì)運(yùn)行者都應(yīng)該遵守最小權(quán)限原則。不是所有清理操作都必須“以管理員身份運(yùn)行”。如果只是清理當(dāng)前用戶 Temp 目錄、分析 D 盤占用普通權(quán)限就夠只有涉及系統(tǒng)目錄、其他用戶目錄時(shí)才需要管理員權(quán)限。權(quán)限越高誤刪的破壞范圍越大。7. 常見(jiàn)問(wèn)題與排查思路實(shí)際操作中這三個(gè)腳本可能遇到不少問(wèn)題。下面整理成表格方便你在遇到報(bào)錯(cuò)時(shí)按圖索驥問(wèn)題現(xiàn)象常見(jiàn)原因解決思路python不是內(nèi)部或外部命令Python 未安裝或未加入 PATH重新安裝 Python 并勾選 Add to PATH或使用py命令腳本掃描到一半報(bào)PermissionError遇到系統(tǒng)保護(hù)目錄或無(wú)權(quán)限訪問(wèn)的文件夾檢查是否需要管理員權(quán)限跳過(guò)即可不影響其他文件掃描清理時(shí)提示“文件被占用”文件正被其他程序打開(kāi)關(guān)閉對(duì)應(yīng)程序后重試提示為 warning 屬正常現(xiàn)象FileNotFoundError中斷程序掃描后文件被安全軟件或其他進(jìn)程刪除對(duì)單個(gè)文件刪除操作做 try-except腳本運(yùn)行很慢目錄中有海量小文件先用分析工具定位大目錄或提高--min-size閾值刪除大量文件后回收站沒(méi)有文件使用unlink()是永久刪除若需回收站保護(hù)改用send2trash庫(kù)分析 C 盤時(shí)部分目錄統(tǒng)計(jì)為 0普通權(quán)限無(wú)法讀取目錄內(nèi)容以管理員身份運(yùn)行終端ModuleNotFoundError: No module named send2trash未安裝第三方庫(kù)執(zhí)行pip install send2trash重復(fù)文件掃描耗時(shí)極長(zhǎng)大文件多且哈希計(jì)算成本高檢查是否真的需要全盤掃描考慮先只掃描某一類擴(kuò)展名清理后系統(tǒng)出現(xiàn)異??赡苷`刪了仍在使用中的臨時(shí)文件這不是腳本 bug而是執(zhí)行前預(yù)覽不夠充分重新運(yùn)行相關(guān)軟件讓其重建緩存即可很多問(wèn)題的根源其實(shí)不在于代碼邏輯本身而在于使用者對(duì)目標(biāo)目錄的認(rèn)知不足。比如你第一次掃描某目錄時(shí)應(yīng)該先使用分析工具的“子目錄大小排序”功能了解目錄里最大的幾項(xiàng)分別是什么再針對(duì)性清理。直接跑刪除腳本是最不推薦的做法。8. 實(shí)戰(zhàn)落地建議與工程習(xí)慣到這里三個(gè)“硬盤清理工具”已經(jīng)全部給出。它們本身并不復(fù)雜單獨(dú)任何一個(gè)都算不上高深項(xiàng)目但組合起來(lái)恰好覆蓋硬盤清理的完整鏈路先分析空間占用找出大頭再定位重復(fù)文件評(píng)估可釋放空間最后針對(duì)臨時(shí)目錄做清理。整個(gè)過(guò)程是“先看后動(dòng)再清”的遞進(jìn)關(guān)系而不是一上來(lái)就悶頭刪除。在把這些腳本納入自己的日常維護(hù)清單之前有幾個(gè)工程習(xí)慣值得養(yǎng)成將腳本統(tǒng)一放到獨(dú)立目錄中維護(hù)。不要散落在桌面或下載目錄避免誤執(zhí)行或找不到。文章中的示例都放在D:\cleanup_tools\你完全可以根據(jù)自己的習(xí)慣調(diào)整但腳本的路徑命名最好能表達(dá)用途。先跑預(yù)覽再跑刪除。這是最重要的原則。三個(gè)腳本中臨時(shí)文件清理腳本默認(rèn)是 dry-run重復(fù)文件查找腳本根本不提供刪除能力磁盤空間分析腳本只做統(tǒng)計(jì)。這種“安全優(yōu)先”的設(shè)計(jì)比腳本本身的功能更重要。給掃描日志留檔。你可以把腳本的輸出重定向到文件python 01_clean_temp.py --delete D:\cleanup_logs\clean_$(date %Y%m%d).log 21在 Windows 的 CMD 中可以把日期格式調(diào)整后重定向核心思路是讓每次清理都有日志可追溯而不是事后靠回憶。用測(cè)試目錄驗(yàn)證。如果你要對(duì)腳本做二次開(kāi)發(fā)比如調(diào)整刪除策略最穩(wěn)妥的方式是在測(cè)試目錄里放幾層嵌套空目錄和假文件模擬真實(shí)場(chǎng)景跑一遍。確認(rèn)行為符合預(yù)期后再對(duì)真實(shí)磁盤執(zhí)行。生產(chǎn)環(huán)境里刪除數(shù)據(jù)后想反悔通常只剩從備份恢復(fù)一條路所以測(cè)試工作永遠(yuǎn)值得做。慎用 AI 生成的代碼尤其在刪除類腳本上。AI 可以幫助你快速搭出框架但它并不了解你機(jī)器的目錄結(jié)構(gòu)、權(quán)限設(shè)置和業(yè)務(wù)背景。把 AI 當(dāng)作“初稿是生成器”而非“權(quán)威答案”每次引入清理腳本時(shí)都按照第 6 節(jié)的五點(diǎn)思路做安全審查才能既享受效率又控制風(fēng)險(xiǎn)。這三個(gè)工具其實(shí)還有一個(gè)可以繼續(xù)擴(kuò)展的方向把三個(gè)獨(dú)立腳本整合為一個(gè)帶菜單的交互式工具通過(guò)參數(shù)選擇執(zhí)行分析、查重或清理任何場(chǎng)景下涉及刪除邏輯時(shí)都別忘了先備份重要數(shù)據(jù)然后在測(cè)試環(huán)境中驗(yàn)證。如果這篇文章能幫你理清硬盤空間管理的基本思路那是它最大的價(jià)值。清理到這一步剩下的就是把腳本放進(jìn)你的日常維護(hù)計(jì)劃定期運(yùn)行一次讓硬盤保持清爽狀態(tài)。如果你在復(fù)制運(yùn)行過(guò)程中遇到其他問(wèn)題可以對(duì)照第 7 節(jié)的排查表逐項(xiàng)檢查也歡迎在動(dòng)手實(shí)踐后再來(lái)按自己的需求改造它們。真正屬于自己的工具往往是運(yùn)行過(guò)、踩過(guò)坑、改過(guò)代碼之后才會(huì)慢慢成型。