戰(zhàn)與Prompt設(shè)計(jì))
上周幫一位做家居百貨的賣(mài)家朋友處理店鋪申訴他的天貓店因?yàn)橹鲌D上印了“全網(wǎng)銷(xiāo)量第一”被系統(tǒng)抽檢下架。這個(gè)違規(guī)表述其實(shí)在商品資料包里躺了半個(gè)多月前后經(jīng)過(guò)運(yùn)營(yíng)、美工、店長(zhǎng)三個(gè)人之手愣是沒(méi)人察覺(jué)。也就是在那一周我用 Qwen3.8-Max 搭了一個(gè)商品資料包體檢助手把包含 6 份文檔資料和 1 張商品主圖的完整資料包一次性丟進(jìn)去不到十分鐘就拿到一份 27 個(gè)問(wèn)題的體檢報(bào)告。其中至少有 5 個(gè)問(wèn)題是人工審查幾乎必然遺漏的——包括那個(gè)“全網(wǎng)第一”。這篇文章不聊概念直接把我搭建這套助手的過(guò)程、體檢維度設(shè)計(jì)、Prompt 寫(xiě)法、實(shí)測(cè)踩坑全部攤開(kāi)。做電商運(yùn)營(yíng)、商品管理、內(nèi)容審核的朋友或者正在研究大模型落地應(yīng)用的同學(xué)都可以照著這套思路改造出適合自己業(yè)務(wù)場(chǎng)景的版本。不需要復(fù)雜的算法基礎(chǔ)核心就是一個(gè)大模型 API 加一段可靠的數(shù)據(jù)解析腳本。1. 電商資料包的“隱形體檢需求”為什么非做不可1.1 一份商品資料包里到底藏了多少雷先還原一下我處理的那套商品資料包。它是一個(gè)廚房收納置物架產(chǎn)品共包含 6 份資料和 1 張主圖文件格式典型內(nèi)容商品標(biāo)題文案Word標(biāo)題、副標(biāo)題、賣(mài)點(diǎn)關(guān)鍵詞詳情頁(yè)文案Markdown五張?jiān)斍閳D對(duì)應(yīng)文案、產(chǎn)品故事、場(chǎng)景描述規(guī)格參數(shù)表Excel材質(zhì)、尺寸、承重、容量、顏色等結(jié)構(gòu)化參數(shù)客服話(huà)術(shù)文本售前問(wèn)答、售后話(huà)術(shù)、價(jià)格解釋、物流說(shuō)明活動(dòng)利益點(diǎn)Word大促利益點(diǎn)、優(yōu)惠券規(guī)則、贈(zèng)品信息合規(guī)自查表Excel平臺(tái)審核要求、禁用詞清單、素材要求商品主圖PNG電商平臺(tái)首圖含產(chǎn)品圖、促銷(xiāo)文案、標(biāo)識(shí)多平臺(tái)運(yùn)營(yíng)的團(tuán)隊(duì)這套資料還會(huì)衍生出天貓版、京東版、拼多多版、抖音版每個(gè)平臺(tái)對(duì)違禁詞、宣傳規(guī)范的要求不完全一致。這些文件分散在不同人手里運(yùn)營(yíng)改一版標(biāo)題客服話(huà)術(shù)里還是舊價(jià)格美工更新了主圖詳情頁(yè)文案里還在用舊賣(mài)點(diǎn)——這種不一致在團(tuán)隊(duì)協(xié)作中幾乎每天都在發(fā)生。1.2 人工體檢的天然盲區(qū)有人會(huì)說(shuō)這些東西讓有經(jīng)驗(yàn)的人過(guò)一遍不就行了問(wèn)題在于“有經(jīng)驗(yàn)的人”看一份資料包需要多久。我之前專(zhuān)門(mén)測(cè)算過(guò)一個(gè)熟手把 6 份資料完整過(guò)一遍至少需要 40 到 60 分鐘。這還是在只做快速瀏覽的情況下。如果要做到真正的交叉一致性檢查——比如把規(guī)格參數(shù)表里的“承重 30kg”和詳情頁(yè)里的“承重 60 斤”做單位換算核對(duì)把客服話(huà)術(shù)里的價(jià)格和活動(dòng)利益點(diǎn)里的到手價(jià)做比對(duì)——時(shí)間還要翻倍。而人眼的疲勞曲線(xiàn)決定了連續(xù)排查到第 30 分鐘之后漏檢率會(huì)直線(xiàn)上升。更重要的是人工檢查存在一個(gè)幾乎無(wú)法克服的問(wèn)題人是按文件去讀的不是按“字段關(guān)系”去讀的。讀詳情頁(yè)的時(shí)候你不會(huì)時(shí)刻想著去對(duì)照規(guī)格參數(shù)表里的每一個(gè)數(shù)值打字回復(fù)客服話(huà)術(shù)草稿的時(shí)候也不會(huì)每寫(xiě)一句就去翻一遍活動(dòng)利益點(diǎn)??缥臋n校驗(yàn)這件事天然違背人的閱讀習(xí)慣卻恰恰是機(jī)器和大模型的強(qiáng)項(xiàng)。1.3 為什么選 Qwen3.8-Max 而不是規(guī)則腳本你可能想問(wèn)這些字段比對(duì)用 Excel 函數(shù)或者寫(xiě) Python 腳本不也能做嗎能但只能做最表層的那部分。規(guī)格參數(shù)表里的“304 不銹鋼”和詳情頁(yè)里的“食品級(jí)不銹鋼”一個(gè)是材質(zhì)標(biāo)準(zhǔn)一個(gè)是安全等級(jí)規(guī)則腳本判斷不了它們是否指向同一信息??头?huà)術(shù)里寫(xiě)“七天無(wú)理由退換”活動(dòng)頁(yè)里寫(xiě)“支持 15 天無(wú)理由”這種語(yǔ)義級(jí)別的差異傳統(tǒng)的精確匹配完全無(wú)能為力。我當(dāng)時(shí)選 Qwen3.8-Max 的核心原因有三個(gè)。第一它的長(zhǎng)文本理解能力足夠一次處理完整的多文件資料包不需要把文檔拆得七零八落再分別喂給模型這樣反而會(huì)丟失跨文檔上下文。第二它對(duì)中文電商語(yǔ)境的理解比較到位平臺(tái)禁用詞、廣告法相關(guān)表述、電商黑話(huà)它基本都能識(shí)別不太需要額外維護(hù)一份龐大的詞庫(kù)。第三它在結(jié)構(gòu)化輸出方面表現(xiàn)穩(wěn)定配合 JSON 輸出模式可以直接把檢查結(jié)果變成可編程處理的報(bào)告數(shù)據(jù)。當(dāng)然我不是說(shuō)規(guī)則腳本沒(méi)用實(shí)際上后面你會(huì)發(fā)現(xiàn)規(guī)則腳本在大模型跑完之后還有非常重要的“兜底”角色——這個(gè)我們留到第三章細(xì)說(shuō)。2. 體檢維度設(shè)計(jì)讓大模型查什么、怎么查、按什么標(biāo)準(zhǔn)查2.1 五維檢查框架完整性、一致性、合規(guī)性、表達(dá)力、圖片一致性拿到一套資料包先別急著寫(xiě) Prompt。我踩過(guò)最大的坑之一就是一上來(lái)就讓大模型“檢查一下有沒(méi)有問(wèn)題”——這種開(kāi)放式的指令得到的回答往往大而空什么“建議加強(qiáng)品牌調(diào)性”“可以?xún)?yōu)化賣(mài)點(diǎn)表達(dá)”一點(diǎn)實(shí)際價(jià)值都沒(méi)有。正確的做法是先把體檢維度定義清楚。我在這個(gè)項(xiàng)目里把檢查項(xiàng)拆成了五個(gè)維度完整性必填字段是否缺失。比如規(guī)格參數(shù)表里有沒(méi)有材質(zhì)、尺寸、承重這些基礎(chǔ)參數(shù)詳情頁(yè)有沒(méi)有售后說(shuō)明合規(guī)自查表是否完整。一致性多份資料之間的交叉信息是否統(tǒng)一。這個(gè)維度信息量最大問(wèn)題也最多。包括價(jià)格、規(guī)格、賣(mài)點(diǎn)、活動(dòng)規(guī)則、材質(zhì)表述等。合規(guī)性是否違反平臺(tái)規(guī)則和廣告法。極限詞、絕對(duì)化用語(yǔ)、無(wú)法證明的數(shù)據(jù)宣稱(chēng)、侵權(quán)風(fēng)險(xiǎn)表述等。表達(dá)力文案層面的質(zhì)量問(wèn)題。錯(cuò)別字、標(biāo)點(diǎn)全半角混亂、長(zhǎng)句晦澀、賣(mài)點(diǎn)堆砌沒(méi)有邏輯等。圖片一致性主圖上的文字信息與文檔資料是否匹配。這是純文本大模型需要借助 OCR 才能完成的部分。2.2 跨文檔一致性檢查的“字段關(guān)系表”五維框架里最容易設(shè)計(jì)、也最容易出問(wèn)題的是“一致性”。你需要提前列出哪些字段之間存在對(duì)應(yīng)關(guān)系這些關(guān)系叫“字段關(guān)系表”。舉幾個(gè)實(shí)際例子。價(jià)格這個(gè)字段可能同時(shí)出現(xiàn)在客服話(huà)術(shù)、活動(dòng)利益點(diǎn)、詳情頁(yè)文案三份文件中三處必須一致。容量/凈含量這個(gè)字段可能同時(shí)出現(xiàn)在規(guī)格參數(shù)表、詳情頁(yè)文案、主圖三處而且可能存在單位換算毫升和升、克和千克。賣(mài)點(diǎn)關(guān)鍵詞會(huì)在標(biāo)題、詳情頁(yè)、主圖文案中重復(fù)出現(xiàn)不能互相矛盾。材質(zhì)表述在參數(shù)表里是“201 不銹鋼”在詳情頁(yè)里寫(xiě)“不銹鋼”在產(chǎn)品圖里寫(xiě)“高級(jí)不銹鋼”這三者之間的邏輯關(guān)系需要判斷。構(gòu)建字段關(guān)系表的過(guò)程實(shí)際上就是盤(pán)清你的資料包有哪些“關(guān)鍵信息節(jié)點(diǎn)”。我建議用 Excel 先把這些字段關(guān)系列出來(lái)再把它寫(xiě)進(jìn) Prompt 里讓大模型嚴(yán)格按表執(zhí)行。這樣檢查結(jié)果的可復(fù)用性會(huì)大幅提升——換一套資料包只需要微調(diào)字段名稱(chēng)檢查邏輯完全不用重寫(xiě)。2.3 商品圖這條鏈路OCR 先行語(yǔ)義比對(duì)在后主圖的檢查比較特殊。Qwen3.8-Max 是文本模型不能直接“看”圖片所以需要先把圖片上的文字提取出來(lái)。我用的方案是 PaddleOCR 本地跑一遍把主圖上的中文、英文、數(shù)字全部抽成文本再連同 OCR 坐標(biāo)信息一起交給大模型做后續(xù)判斷。主圖上的文字通常不多十幾秒就能跑完。這里有一個(gè)非常關(guān)鍵的細(xì)節(jié)OCR 輸出的文本一定要保留坐標(biāo)信息。為什么因?yàn)榕袛嘀鲌D合規(guī)性時(shí)排版位置很重要。比如“全場(chǎng)五折”和“滿(mǎn) 99 減 50”如果放在主圖的同一個(gè)位置可能導(dǎo)致視覺(jué)沖突再比如主圖上如果有小字備注“活動(dòng)最終解釋權(quán)歸本店所有”這種字體過(guò)小、容易誤導(dǎo)消費(fèi)者的表述平臺(tái)往往是重點(diǎn)監(jiān)管對(duì)象。有坐標(biāo)信息Prompt 里的檢查規(guī)則才有落地的抓手。3. 系統(tǒng)搭建實(shí)錄數(shù)據(jù)解析、Prompt 工程與代碼兜底3.1 整體架構(gòu)與數(shù)據(jù)預(yù)處理整個(gè)系統(tǒng)的代碼不大核心流程分四步文件解析、OCR 提取、大模型體檢、報(bào)告生成。我用 Python 搭的主流程文件解析部分用了幾個(gè)成熟庫(kù)Word 和 Markdown 直接讀文本Excel 用 openpyxl 讀取并保留單元格結(jié)構(gòu)圖片用 PaddleOCR 識(shí)別。核心代碼骨架如下import json import openpyxl import docx from paddleocr import PaddleOCR import dashscope from dashscope import Generation def extract_text_from_docx(path): doc docx.Document(path) return \n.join([p.text for p in doc.paragraphs]) def extract_from_excel(path): wb openpyxl.load_workbook(path, data_onlyTrue) rows [] for ws in wb.worksheets: for row in ws.iter_rows(values_onlyTrue): rows.append( | .join([str(c) for c in row if c is not None])) return \n.join(rows) def ocr_image(path): ocr PaddleOCR(use_angle_clsTrue, langch, show_logFalse) result ocr.ocr(path, clsTrue) items [] for line in result: for box, text in line: items.append({ text: text[0], position: box }) return items def check_with_llm(context: dict): prompt build_prompt(context) # 核心 Prompt 構(gòu)造 resp Generation.call( modelqwen3.8-max, messages[{role: user, content: prompt}], result_formatmessage ) return json.loads(resp.output.choices[0].message.content)提示這里用了 dashscope SDK 調(diào)用 Qwen3.8-Max 模型接口實(shí)際使用時(shí)替換為自己的 API Key 和模型可用名稱(chēng)即可。為了演示完整流程我保留了最簡(jiǎn)調(diào)用方式生產(chǎn)環(huán)境建議加上重試和超時(shí)處理。3.2 Prompt 工程三個(gè)決定成敗的設(shè)計(jì)Prompt 是這套系統(tǒng)的靈魂。我前后迭代了三個(gè)版本才穩(wěn)定下來(lái)最終版有三個(gè)關(guān)鍵設(shè)計(jì)。設(shè)計(jì)一給模型一個(gè)明確的“檢查專(zhuān)家”角色并定義輸出約束。一開(kāi)始我的 Prompt 只寫(xiě)了檢查要求沒(méi)有定義輸出結(jié)構(gòu)結(jié)果每次返回的格式都不一樣有的用列表有的用段落后處理非常痛苦。后來(lái)改成角色設(shè)定 固定 JSON 輸出結(jié)構(gòu)一次就穩(wěn)定了。角色設(shè)定讓模型以“平臺(tái)資深審核員”的視角去做判斷輸出約束強(qiáng)制它按 [{file: 詳情頁(yè), issue: ..., severity: high, suggestion: ...}] 這樣的結(jié)構(gòu)逐條返回。設(shè)計(jì)二把檢查維度和字段關(guān)系表寫(xiě)進(jìn) Prompt而不是讓模型自由發(fā)揮。第二章說(shuō)的五個(gè)維度和字段關(guān)系表這一步真正發(fā)揮作用。Prompt 里明確列出每個(gè)維度要檢查什么哪些字段之間需要做交叉比對(duì)模型輸出的結(jié)果就非常聚焦。比如我明確寫(xiě)了“請(qǐng)重點(diǎn)核對(duì)規(guī)格參數(shù)表中的承重、容量、尺寸與詳情頁(yè)文案及主圖文字信息的一致性”模型就會(huì)把精力集中在這類(lèi)跨文檔比對(duì)而不是泛泛而談“優(yōu)化文案”。設(shè)計(jì)三引入“先推理再作答”的兩階段輸出。這是效果提升最大的一步。我在 Prompt 里要求模型先輸出一個(gè)“檢查過(guò)程摘要”說(shuō)明它發(fā)現(xiàn)了哪些可疑點(diǎn)、做過(guò)哪些交叉比對(duì)再輸出最終 JSON 報(bào)告。這個(gè)設(shè)計(jì)有點(diǎn)類(lèi)似讓模型先展示思考過(guò)程再給結(jié)論實(shí)際跑下來(lái)漏檢率比直接輸出答案要低不少。也不需要單獨(dú)發(fā)兩次請(qǐng)求在同一個(gè) Prompt 里讓它先寫(xiě)推理再輸出 JSON 就行。3.3 數(shù)值歸一化與規(guī)則兜底大模型不擅長(zhǎng)精確比對(duì)大模型在語(yǔ)義判斷上很強(qiáng)但在精確數(shù)字比對(duì)上有明顯短板。我的實(shí)測(cè)里模型遇到“500ml”和“0.5L”這種單位換算能反應(yīng)過(guò)來(lái)但遇到“358×246×84mm”和“35.8cm×24.6cm×8.4cm”這種規(guī)格表達(dá)時(shí)偶爾會(huì)給出錯(cuò)誤判斷甚至出現(xiàn)把 358 和 35.8 直接當(dāng)成兩個(gè)不同數(shù)值的低級(jí)錯(cuò)誤。解決方案是在把文本喂給大模型之前先用代碼做一次數(shù)值歸一化。我寫(xiě)了一個(gè)預(yù)處理函數(shù)把所有常見(jiàn)的單位換算統(tǒng)一成標(biāo)準(zhǔn)單位尺寸統(tǒng)一換算成 mm容量統(tǒng)一換算成 ml重量統(tǒng)一換算成 g。歸一化后的文本再喂給模型數(shù)字比對(duì)的準(zhǔn)確率明顯提升。同理規(guī)則腳本在大模型跑完之后還承擔(dān)“硬性攔截”的角色。像“第一”“絕對(duì)”“最”這些極限詞我另外維護(hù)了一個(gè)小型敏感詞庫(kù)用正則在大模型輸出結(jié)果之外做一次全量掃描。這樣做不是為了替代大模型而是給合規(guī)性檢查加一道保險(xiǎn)——規(guī)則永遠(yuǎn)比模型更可靠也更容易向平臺(tái)審核人員解釋。4. 實(shí)測(cè)結(jié)果27 個(gè)問(wèn)題是怎么分布的哪類(lèi)最致命4.1 問(wèn)題清單總覽整套資料包跑完Qwen3.8-Max 一共返回了 27 個(gè)問(wèn)題。我按五個(gè)維度做了分類(lèi)統(tǒng)計(jì)檢查維度問(wèn)題數(shù)嚴(yán)重級(jí)別典型問(wèn)題舉例一致性9高 6 / 中 3標(biāo)題“免打孔”與參數(shù)表“需鉆孔安裝”沖突主圖“承重 30kg”與參數(shù)表“承重 15kg”不一致客服話(huà)術(shù)價(jià)格與活動(dòng)利益點(diǎn)到手價(jià)相差 10 元合規(guī)性6高 4 / 中 2主圖含“全網(wǎng)銷(xiāo)量第一”詳情頁(yè)“頂級(jí)工藝”未標(biāo)注專(zhuān)利號(hào)卻宣稱(chēng)“專(zhuān)利設(shè)計(jì)”完整性5中 4 / 低 1規(guī)格參數(shù)表缺少材質(zhì)字段詳情頁(yè)無(wú)售后說(shuō)明合規(guī)自查表質(zhì)檢報(bào)告編號(hào)為空?qǐng)D片一致性4高 2 / 中 2主圖促銷(xiāo)文案“滿(mǎn) 99 減 20”在活動(dòng)利益點(diǎn)中未出現(xiàn)主圖容量標(biāo)注與規(guī)格參數(shù)不一致表達(dá)力3低 3“不占空間”重復(fù) 4 次詳情頁(yè)第三段全角標(biāo)點(diǎn)混亂客服話(huà)術(shù)“哦哦”等語(yǔ)氣詞過(guò)多27 個(gè)問(wèn)題里嚴(yán)重級(jí)別為高的有 12 個(gè)。這個(gè)比例比我預(yù)想的高得多也間接說(shuō)明這套資料包在發(fā)布前的人工審核環(huán)節(jié)幾乎是形同虛設(shè)的。4.2 三個(gè)典型問(wèn)題的深度復(fù)盤(pán)問(wèn)題一標(biāo)題“免打孔安裝”與參數(shù)表“需鉆孔安裝”直接沖突。這是整套報(bào)告里最觸目驚心的一條。標(biāo)題文案寫(xiě)的是“免打孔安裝”而規(guī)格參數(shù)表里明確標(biāo)注“安裝方式需鉆孔”。運(yùn)營(yíng)、美工、店長(zhǎng)三個(gè)人分別看過(guò)材料卻沒(méi)人把標(biāo)題和參數(shù)表放在一起對(duì)照過(guò)。如果這套資料包直接上新買(mǎi)家收到貨發(fā)現(xiàn)需要鉆孔退貨退款和差評(píng)幾乎是必然的。問(wèn)題二主圖“承重 30kg”與參數(shù)表“承重 15kg”不一致。主圖為了突出賣(mài)點(diǎn)把承重標(biāo)到了 30kg參數(shù)表里寫(xiě)的卻是 15kg。這個(gè)差異我推測(cè)不是惡意夸大而是運(yùn)營(yíng)在寫(xiě)主圖文案時(shí)憑印象填的。但平臺(tái)規(guī)則里主圖宣傳參數(shù)和詳情參數(shù)不一致屬于誤導(dǎo)消費(fèi)者被舉報(bào)或抽檢到就是違規(guī)。這類(lèi)問(wèn)題典型的產(chǎn)生原因就是信息源多、更新不同步人工極難發(fā)現(xiàn)而大模型只要把主圖文案和參數(shù)表放在一起做一次交叉比對(duì)立刻現(xiàn)形。問(wèn)題三客服話(huà)術(shù)的價(jià)格與活動(dòng)利益點(diǎn)的到手價(jià)相差 10 元?;顒?dòng)利益點(diǎn)寫(xiě)的是“前 100 名到手價(jià) 89 元”客服話(huà)術(shù)里卻還保留著“日常售價(jià) 99 元活動(dòng)到手價(jià) 99 元”的舊版本。買(mǎi)家咨詢(xún)時(shí)按客服的說(shuō)法下單實(shí)際支付卻是 89 元用戶(hù)不會(huì)覺(jué)得自己賺了只會(huì)覺(jué)得店鋪價(jià)格體系混亂。這類(lèi)問(wèn)題在電商里特別常見(jiàn)因?yàn)榭头?huà)術(shù)的更新滯后于運(yùn)營(yíng)活動(dòng)節(jié)奏往往是一個(gè)月前的話(huà)術(shù)還在沿用到新活動(dòng)里。4.3 誤報(bào)與漏報(bào)大模型實(shí)測(cè)的邊界在哪27 個(gè)問(wèn)題里也有兩條誤報(bào)。一條是模型把“加厚不銹鋼”里的“加厚”判斷為疑似絕對(duì)化用語(yǔ)實(shí)際上“加厚”是描述性詞匯只要不寫(xiě)“最厚”“超厚第一”這類(lèi)表述平臺(tái)一般不會(huì)判定違規(guī)。另一條是模型認(rèn)為詳情頁(yè)缺少“生產(chǎn)日期”信息——但這是一個(gè)收納置物架屬于非食品類(lèi)目根本不需要標(biāo)注生產(chǎn)日期。誤報(bào)不算嚴(yán)重說(shuō)明模型的判斷在合理范圍內(nèi)但提醒我兩點(diǎn)第一合規(guī)檢查規(guī)則需要結(jié)合具體類(lèi)目食品、美妝、電器、家居的合規(guī)要求差異很大Prompt 里的檢查清單得按類(lèi)目定制不能一套規(guī)則打天下。第二大模型的判斷結(jié)果適合做“候選清單”不適合直接當(dāng)“最終結(jié)論”。我現(xiàn)在的流程是模型輸出結(jié)果后由人工對(duì)高嚴(yán)重級(jí)別的問(wèn)題做二次確認(rèn)中低嚴(yán)重級(jí)別的問(wèn)題直接走修改流程。這個(gè)分層審閱機(jī)制既保留了 AI 的效率也保留了人的最終判斷權(quán)。5. 踩坑復(fù)盤(pán)系統(tǒng)從能跑到好用關(guān)鍵在三個(gè)細(xì)節(jié)5.1 OCR 識(shí)別誤差圖片文字質(zhì)量的隱形陷阱PaddleOCR 中文識(shí)別準(zhǔn)確率已經(jīng)很高但在主圖這種字體多變、有背景干擾的場(chǎng)景下仍然會(huì)出錯(cuò)。我第一次跑的時(shí)候“ml”被識(shí)別成“m1”“304 不銹鋼”被識(shí)別成“3O4 不銹鋼”。如果不做處理這些錯(cuò)誤文本直接喂給大模型模型會(huì)在錯(cuò)誤信息的基礎(chǔ)上做判斷結(jié)果自然不可靠。后來(lái)我加了兩個(gè)處理。一是針對(duì)數(shù)字和單位做了 OCR 后處理結(jié)合商品類(lèi)目常見(jiàn)的單位詞庫(kù)對(duì)疑似識(shí)別錯(cuò)誤做自動(dòng)糾正二是在 Prompt 里明確要求模型“注意 OCR 文本可能存在的識(shí)別誤差如遇無(wú)法確認(rèn)的字符請(qǐng)單獨(dú)標(biāo)注可疑程度”讓它不至于在錯(cuò)誤信息上得出過(guò)度自信的結(jié)論。5.2 模型輸出偶爾“胡編”結(jié)構(gòu)化校驗(yàn)必須有大模型偶爾會(huì)輸出一些資料包里不存在的“問(wèn)題”。比如它在一份資料里憑空生成了一個(gè)不存在的型號(hào)“BX-20”還說(shuō)這個(gè)型號(hào)和標(biāo)題中的“BX-10”不一致。我追蹤了一下猜測(cè)是模型在上下文里看到了“型號(hào)”這個(gè)字段后自由發(fā)揮編造了一個(gè)。應(yīng)對(duì)方案是在代碼里加一道結(jié)構(gòu)化校驗(yàn)?zāi)P头祷氐拿織l問(wèn)題記錄必須能從原文中找到對(duì)應(yīng)的證據(jù)文本并記錄證據(jù)所在的文件名和原始句子。如果程序在原文中檢索不到對(duì)應(yīng)證據(jù)這條問(wèn)題直接降級(jí)為“疑似”不進(jìn)入正式報(bào)告。這個(gè)機(jī)制在程序上不復(fù)雜但對(duì)報(bào)告的可信度提升非常大。5.3 Prompt 從第一版到終版的三個(gè)關(guān)鍵改動(dòng)第一版 Prompt 太“放養(yǎng)”只給了角色和任務(wù)模型輸出一堆正確的廢話(huà)。第二版加入了五維框架和字段關(guān)系表輸出開(kāi)始聚焦但格式不穩(wěn)定。第三版加了 JSON 結(jié)構(gòu)約束和“先推理再輸出”的兩階段要求這才達(dá)到我想象中的可用狀態(tài)。除開(kāi)發(fā)送前的 Prompt 設(shè)計(jì)生成后的報(bào)告整理同樣重要。我把模型返回的 JSON 報(bào)告直接轉(zhuǎn)成了帶嚴(yán)重級(jí)別標(biāo)簽的 Excel 表格按“高-中-低”排序后發(fā)給業(yè)務(wù)同事。表格里每條問(wèn)題都帶“證據(jù)文件-證據(jù)原文-修改建議”業(yè)務(wù)同事不需要再翻原始資料包就能定位問(wèn)題整個(gè)推動(dòng)整改的流程順暢了很多。注意如果要把這個(gè)流程做得更完整還可以在報(bào)告生成后加一層“整改閉環(huán)”——每條問(wèn)題記錄指派負(fù)責(zé)人和截止日期整改完成后再次用體檢助手復(fù)檢確認(rèn)問(wèn)題清零。這一步不涉及技術(shù)但能把體檢的價(jià)值落到業(yè)務(wù)結(jié)果上。5.4 成本與耗時(shí)大家最關(guān)心的數(shù)字這套體檢跑一套資料包耗時(shí)主要取決于文件數(shù)量。我的實(shí)測(cè)數(shù)據(jù)是6 份文檔加 1 張主圖OCR 約 10 秒大模型推理約 1 到 2 分鐘全程不超過(guò) 3 分鐘。費(fèi)用方面OCR 本地跑不花錢(qián)Qwen3.8-Max 按 token 計(jì)費(fèi)一份資料包入?yún)⒓映鰠⒖偣?1 萬(wàn) token 左右成本可以忽略不計(jì)。對(duì)需要批量檢查幾十上百個(gè) SKU 的團(tuán)隊(duì)來(lái)說(shuō)這個(gè)成本和效率都相當(dāng)有競(jìng)爭(zhēng)力。6. 適用邊界與進(jìn)一步擴(kuò)展思考這套方案目前最適合的是 SKU 數(shù)量多、資料包結(jié)構(gòu)相對(duì)固定的電商團(tuán)隊(duì)。SKU 越多人工檢查的邊際成本越高AI 體檢的收益越明顯。相反如果團(tuán)隊(duì)只有兩三個(gè)商品人工檢查也就一兩個(gè)小時(shí)的事搭建這套系統(tǒng)的投入產(chǎn)出比就不劃算了。我在實(shí)際使用中還有一個(gè)體會(huì)這套系統(tǒng)的價(jià)值不止在于查出問(wèn)題更在于把檢查標(biāo)準(zhǔn)固化了下來(lái)。以前團(tuán)隊(duì)對(duì)“什么樣的資料包算合格”沒(méi)有統(tǒng)一認(rèn)知每個(gè)人的標(biāo)準(zhǔn)都不一樣?,F(xiàn)在五維檢查框架寫(xiě)進(jìn) Prompt 里等于把團(tuán)隊(duì)內(nèi)部的品控標(biāo)準(zhǔn)變成了可執(zhí)行、可復(fù)現(xiàn)的流程新來(lái)的運(yùn)營(yíng)照著報(bào)告改就行不需要再靠口口相傳去理解老員工的經(jīng)驗(yàn)。后續(xù)如果要擴(kuò)展我建議優(yōu)先考慮兩個(gè)方向。一是把檢查結(jié)果接入內(nèi)部通知跑完自動(dòng)推送到工作群時(shí)效性會(huì)更好二是沉淀每個(gè)商品的歷史檢查報(bào)告形成一個(gè)質(zhì)量問(wèn)題數(shù)據(jù)庫(kù)用數(shù)據(jù)反向優(yōu)化團(tuán)隊(duì)的工作流程——比如如果一段時(shí)間內(nèi)一致性類(lèi)問(wèn)題頻發(fā)說(shuō)明協(xié)同流程里有環(huán)節(jié)需要調(diào)整這比單次檢查的意義大得多。