簽評估與正則化:從顯示偏好理論到模型理性一致性約束)
在模型對齊和評估這個(gè)方向上最貴的往往不是算力而是人工標(biāo)注。人類偏好數(shù)據(jù)既要花錢采集又要花時(shí)間清洗標(biāo)注一致性還經(jīng)常不穩(wěn)定。為了讓模型“更符合預(yù)期”團(tuán)隊(duì)往往要反復(fù)標(biāo)注、反復(fù)微調(diào)成本一路走高。這次我們來看一種更偏理論基礎(chǔ)的方法Revealed Rationality: Label-Free Evaluation and Regularization from Representation Theorems。它想解決的問題很直接能不能不依賴人工標(biāo)簽直接從模型自己的行為中推斷它的“判斷傾向”再把這種推斷用于評估和訓(xùn)練正則化。這個(gè)方向的關(guān)鍵詞是Label-Free Evaluation無標(biāo)簽評估和Regularization正則化。核心思路來自決策理論里的“顯示偏好”和“表示定理”如果一個(gè)人或一個(gè)模型在成對選項(xiàng)之間表現(xiàn)出穩(wěn)定的選擇行為那么這些行為可以用一個(gè)潛在的效用函數(shù)來表示反過來通過行為反推效用函數(shù)就可以在沒有外部標(biāo)簽的情況下評估模型“理不理性”并把這個(gè)“理性差距”變成訓(xùn)練時(shí)可以優(yōu)化的正則項(xiàng)。這篇文章屬于理論方法拆解不是一鍵啟動(dòng)的本地工具包所以不會(huì)出現(xiàn)“下載即用”的安裝步驟。我會(huì)把標(biāo)題里的幾個(gè)理論概念翻譯成工程語言給出一套可參考的實(shí)現(xiàn)思路和代碼骨架再說清楚這類方法真正落地時(shí)容易踩的坑以及評估和訓(xùn)練階段分別怎么接入。1. 核心能力速覽能力項(xiàng)說明核心問題在沒有人工標(biāo)簽的情況下評估模型行為并用評估結(jié)果約束訓(xùn)練過程理論來源顯示偏好理論Revealed Preference 表示定理Representation Theorems評估形式通過模型對成對選項(xiàng)的行為選擇推斷潛在效用函數(shù)計(jì)算“理性一致性”分?jǐn)?shù)正則化形式將行為偏離理性公理的程度轉(zhuǎn)化為可微損失項(xiàng)疊加到訓(xùn)練目標(biāo)中適用階段模型評估、偏好對齊、微調(diào)正則化、RLHF 之外的替代約束所需數(shù)據(jù)模型自身的成對輸出對比或行為選擇記錄不需要人工標(biāo)注工程現(xiàn)狀以研究原型為主沒有公開一鍵包需要按論文思路自行實(shí)現(xiàn)落地難點(diǎn)如何定義“一致性”、如何建模行為空間、如何避免效用函數(shù)退化與 RLHF 的關(guān)系可以作為偏好優(yōu)化目標(biāo)之外的一種約束信號(hào)不是完全替代關(guān)系2. 無標(biāo)簽評估為什么值得關(guān)注先看現(xiàn)在的典型流程。常見做法是先收集人工標(biāo)注的偏好數(shù)據(jù)例如給定同一個(gè) prompt 的多個(gè)回答讓標(biāo)注員排序然后用這些排序訓(xùn)練一個(gè)獎(jiǎng)勵(lì)模型再用獎(jiǎng)勵(lì)模型引導(dǎo)生成策略。這個(gè)流程能用但有三個(gè)明顯問題。第一標(biāo)注成本高。要讓獎(jiǎng)勵(lì)模型穩(wěn)定通常需要大量高質(zhì)量標(biāo)注而且不同標(biāo)注員的判斷標(biāo)準(zhǔn)不一致清洗成本非常高。第二標(biāo)注噪聲大。同樣一段回答不同人可能給出相反的排序。噪聲一旦進(jìn)入獎(jiǎng)勵(lì)模型模型學(xué)到的偏好信號(hào)就會(huì)“漂移”。第三評估和訓(xùn)練目標(biāo)脫節(jié)。我們希望模型輸出“有用、安全、符合預(yù)期”但實(shí)際優(yōu)化的只是“獎(jiǎng)勵(lì)模型認(rèn)為好的回答”兩者之間可能存在系統(tǒng)性偏差。無標(biāo)簽評估的思路就是繞過人工標(biāo)注這一環(huán)從模型行為本身提取結(jié)構(gòu)信息。這里的理論支撐是如果模型在多個(gè)成對比較中保持一致那么這些選擇行為背后大概率存在一個(gè)較為穩(wěn)定的評分函數(shù)。我們可以利用這種結(jié)構(gòu)性來建立評估指標(biāo)并把背離一致性的部分作為懲罰項(xiàng)在訓(xùn)練時(shí)約束模型不要“前后矛盾”。這種思路的最大價(jià)值不是替代人工評估而是給評估和訓(xùn)練增加一個(gè)可解釋的、低成本目標(biāo)。對于小團(tuán)隊(duì)來說尤其有意義沒有預(yù)算攢大量人工偏好可以先跑無標(biāo)簽評估篩選出性能不穩(wěn)定的輸出再針對性地做標(biāo)注和調(diào)優(yōu)。3. 理論基石顯示偏好與表示定理這個(gè)方向的兩個(gè)核心概念都來自經(jīng)濟(jì)學(xué)和決策理論理解它們就能看懂整個(gè)方法框架。3.1 顯示偏好理論顯示偏好理論的核心命題是人的偏好不需要通過自述獲得可以通過觀察其選擇行為來推斷。在買東西的場景里如果消費(fèi)者在商品 A 與商品 B 都買得起的情況下選擇了 A就“顯示”他更偏好 A。反復(fù)觀察不同預(yù)算條件下的選擇就能還原出一個(gè)較為完整的偏好結(jié)構(gòu)。把這個(gè)邏輯遷移到模型上就是與其去問“你更喜歡哪種回答風(fēng)格”不如讓模型在多種回答之間做選擇。給定若干成對比較數(shù)據(jù)可以通過模型的選擇行為反推其內(nèi)在偏好。這種偏好不是模型嘴上說出來的而是行為上暴露出來的因此叫“顯示偏好”。3.2 表示定理表示定理說明在滿足完備性和傳遞性偏好的前提下一定存在一個(gè)實(shí)值效用函數(shù)使得選擇順序與效用函數(shù)的高低順序一致。簡單來說如果模型是“理性”的那么它的所有行為選擇都可以被看成在比較一個(gè)隱式分?jǐn)?shù)。分?jǐn)?shù)高的一方被選中分?jǐn)?shù)低的一方被忽略。這就是之后所有操作的理論基礎(chǔ)先假設(shè)模型存在一個(gè)潛在評分函數(shù)然后用行為數(shù)據(jù)去擬合這個(gè)函數(shù)擬合得越好說明模型選擇越一致擬合不上的部分就是“不理性”的殘差。這個(gè)殘差既是評估指標(biāo)的一部分也是正則化項(xiàng)的核心。3.3 “理性”在這里不等于“正確”需要特別說明一點(diǎn)這里的“理性”描述的是選擇行為在邏輯結(jié)構(gòu)上的一致性不意味著模型輸出的內(nèi)容更符合人類價(jià)值觀。一個(gè)模型可以前后一致地說“不該拒絕惡意請求”這樣的行為高度理性但對齊結(jié)果完全不合格。所以無標(biāo)簽評估更適合作為“行為質(zhì)量約束”不能單獨(dú)作為“價(jià)值觀對齊目標(biāo)”。4. 方法拆解從行為到分?jǐn)?shù)再到正則化把兩個(gè)理論概念落到實(shí)際方法里大致可以拆成四步構(gòu)造行為數(shù)據(jù)、學(xué)習(xí)潛在效用、計(jì)算理性差距、把差距變成訓(xùn)練損失。4.1 構(gòu)造行為數(shù)據(jù)不需要人工標(biāo)簽只需要讓模型對若干選項(xiàng)做選擇。具體操作方式是給定一組輸入文本讓模型通過解碼概率、內(nèi)部隱狀態(tài)對比或者生成式比較輸出對兩個(gè)候選回答的偏好判斷。行為數(shù)據(jù)的形態(tài)不限于最終生成的文本也可以是 logprob 對比結(jié)果。行為樣本的形式可以抽象成(上下文, 選項(xiàng)A, 選項(xiàng)B, 模型選擇)。其中“模型選擇”表示模型更傾向于 A 還是 B或者兩者無差異。4.2 學(xué)習(xí)潛在效用函數(shù)用行為數(shù)據(jù)訓(xùn)練一個(gè)潛在的效用網(wǎng)絡(luò)目標(biāo)是讓這個(gè)函數(shù)盡量還原模型的全部選擇行為。如果模型選擇 A 而不選 B那學(xué)習(xí)目標(biāo)就是讓f(A) f(B)。這一步非常像訓(xùn)練獎(jiǎng)勵(lì)模型但區(qū)別在于數(shù)據(jù)不來自人類標(biāo)注而來自模型自身的行為。效用網(wǎng)絡(luò)可以用簡單的 MLP也可以基于模型隱層輸出構(gòu)建。如果是大模型場景可以直接把最后一層隱藏狀態(tài)接入一個(gè)線性打分頭而不是單獨(dú)訓(xùn)練一個(gè)完整編碼器。4.3 計(jì)算理性差距所謂的“理性差距”通常用行為數(shù)據(jù)對“傳遞性公理”的違反程度來衡量。假設(shè)模型在第一次比較中說 A 優(yōu)于 B第二次說 B 優(yōu)于 C那么按照理性人的公理第三次比較中它應(yīng)該認(rèn)為 A 優(yōu)于 C。如果第三次結(jié)果相反就產(chǎn)生了“偏好循環(huán)”這說明模型內(nèi)部沒有一個(gè)穩(wěn)定的全局評分函數(shù)。在實(shí)現(xiàn)上可以用排序損失或者對比損失來評估這種不一致程度。差值越大說明模型行為越不穩(wěn)定理性程度越低。4.4 把差距變成正則化項(xiàng)無標(biāo)簽評估可以直接當(dāng)“評分指標(biāo)”使用但更有吸引力的用途是變成訓(xùn)練時(shí)的正則化項(xiàng)。做法是在常規(guī)損失之外額外加入一個(gè)“傳遞性損失”迫使模型的輸出空間更接近一個(gè)全局一致的評分函數(shù)。也就是說模型不僅要學(xué)會(huì)回答任務(wù)本身還要在相互比較時(shí)保持一致。這等于在訓(xùn)練目標(biāo)里加了一個(gè)“自我一致性”約束。如果模型在訓(xùn)練過程中開始出現(xiàn)前后矛盾的偏好這個(gè)約束就會(huì)產(chǎn)生梯度把模型拉回更穩(wěn)定的方向。5. 一個(gè)可參考的實(shí)現(xiàn)思路下面給出一套用于驗(yàn)證思路的 PyTorch 風(fēng)格代碼骨架。說明一下這是基于“顯示偏好 傳遞性約束”的通用實(shí)現(xiàn)思路不保證與原始論文逐行對應(yīng)。實(shí)際使用時(shí)需要根據(jù)模型結(jié)構(gòu)和行為數(shù)據(jù)格式調(diào)整。5.1 定義效用評估器假設(shè)我們已經(jīng)拿到了模型的輸出向量例如對 A、B、C 三個(gè)候選回答各自編碼得到 768 維向量。先用 MLP 把這些向量映射成一個(gè)標(biāo)量分?jǐn)?shù)。import torch import torch.nn as nn import torch.nn.functional as F class ScalarEvaluator(nn.Module): 把候選回答的向量表示映射為標(biāo)量效用分?jǐn)?shù)。 def __init__(self, input_dim: int 768, hidden_dim: int 128): super().__init__() self.net nn.Sequential( nn.Linear(input_dim, hidden_dim), nn.ReLU(), nn.Linear(hidden_dim, hidden_dim), nn.ReLU(), nn.Linear(hidden_dim, 1), ) def forward(self, x: torch.Tensor) - torch.Tensor: # x: [batch, input_dim] # 返回: [batch] return self.net(x).squeeze(-1)5.2 定義傳遞性正則化損失這里的核心是構(gòu)造一個(gè)可微的“非理性”指標(biāo)。假設(shè)樣本中包含三元組(A, B, C)且模型的已知偏好關(guān)系是A B、B C。那么理想情況下分?jǐn)?shù)的順序應(yīng)該是f(A) f(B) f(C)特別是f(A) f(C)。我們用邊緣損失來度量違反程度如果f(A) - f(C)小于某個(gè) margin就產(chǎn)生損失。同時(shí)附加一個(gè)輕微的分?jǐn)?shù) L2 正則避免分?jǐn)?shù)無限發(fā)散。class TransitivityRegularizer(nn.Module): 根據(jù)三元組行為數(shù)據(jù)計(jì)算傳遞性損失。 def __init__(self, evaluator: ScalarEvaluator, margin: float 0.1): super().__init__() self.evaluator evaluator self.margin margin def forward(self, A: torch.Tensor, B: torch.Tensor, C: torch.Tensor) - torch.Tensor: A, B, C: [batch, input_dim] 已有行為信息: A B, B C 理想情況下應(yīng)滿足: A C score_a self.evaluator(A) score_b self.evaluator(B) score_c self.evaluator(C) # 成對比較損失讓 A 高于 BB 高于 C pairwise_loss ( F.relu(self.margin - (score_a - score_b)) F.relu(self.margin - (score_b - score_c)) ) # 傳遞性損失讓 A 高于 C trans_loss F.relu(self.margin - (score_a - score_c)) # 輕微 L2 防止打分漂移 reg (score_a**2 score_b**2 score_c**2).mean() * 0.01 return (pairwise_loss trans_loss).mean() reg5.3 接入訓(xùn)練循環(huán)使用時(shí)可以把傳遞性正則化損失和模型的主任務(wù)損失相加。如果主任務(wù)是語言建模損失可以寫成evaluator ScalarEvaluator(input_dim768) regularizer TransitivityRegularizer(evaluatormargin0.1) # 從模型隱層獲取候選回答向量 A model_hidden_states_for_candidate(...) B model_hidden_states_for_candidate(...) C model_hidden_states_for_candidate(...) train_loss main_loss lambda_reg * regularizer(A, B, C) train_loss.backward()這里最需要關(guān)注的是lambda_reg的取值。太小正則約束無效太大模型會(huì)為了滿足一致性而犧牲原有生成能力。建議從0.01或0.001起步在驗(yàn)證集上觀察主任務(wù)指標(biāo)和一致性指標(biāo)的變化。5.4 無標(biāo)簽評估指標(biāo)的計(jì)算在評估階段可以簡單統(tǒng)計(jì)測試行為數(shù)據(jù)中滿足傳遞性的比例或者計(jì)算平均違反 margin。例如def consistency_score(model, triplets): total 0 consistent 0 for A, B, C in triplets: scores model([A, B, C]) if scores[0] scores[2]: consistent 1 total 1 return consistent / max(total, 1)數(shù)值越高說明模型行為越穩(wěn)定潛在的評分函數(shù)結(jié)構(gòu)越清晰。這個(gè)分?jǐn)?shù)可以當(dāng)作無標(biāo)簽評估的一維參考。6. 如何在訓(xùn)練和評估流程中實(shí)際使用這類方法要產(chǎn)生實(shí)際價(jià)值需要明確它在現(xiàn)有流程中的位置。6.1 作為評估階段的補(bǔ)充信號(hào)當(dāng)前評估體系主要依賴指標(biāo)計(jì)算、人工評測和模型評測。無標(biāo)簽評估可以作為一種低成本篩查手段先跑一批 prompt用解碼概率或模型選擇行為構(gòu)造成對比較數(shù)據(jù)然后計(jì)算一致性分?jǐn)?shù)。分?jǐn)?shù)偏低的 prompt 類型大概率是模型行為不穩(wěn)定的區(qū)域值得優(yōu)先做人工標(biāo)注和定向調(diào)優(yōu)。6.2 作為微調(diào)階段的正則化目標(biāo)在監(jiān)督微調(diào)或偏好微調(diào)階段把傳遞性損失加到主損失后面可以理解為“額外請一個(gè)行為一致性監(jiān)督員”。它在訓(xùn)練時(shí)盯著模型參數(shù)的更新方向一旦發(fā)現(xiàn)模型在傳遞性約束上產(chǎn)生較大偏差就用梯度把它拉回來。6.3 與 RLHF 的對比對比項(xiàng)RLHF無標(biāo)簽評估 正則化數(shù)據(jù)來源人工標(biāo)注偏好模型自身行為訓(xùn)練目標(biāo)優(yōu)化獎(jiǎng)勵(lì)模型分?jǐn)?shù)主任務(wù)損失 行為一致性損失成本高中低邏輯假設(shè)獎(jiǎng)勵(lì)模型能準(zhǔn)確代表人類偏好模型行為應(yīng)該具備內(nèi)部一致性單獨(dú)使用可以不建議必須搭配主任務(wù)無標(biāo)簽評估和正則化更適合作為 RLHF 或偏好優(yōu)化的輔助約束而不是完全替代。因?yàn)椤袄硇砸恢隆焙汀胺先祟愵A(yù)期”是兩個(gè)維度不能混為一談。7. 資源占用與性能觀察這個(gè)方向沒有現(xiàn)成的本地一鍵包所以沒有固定顯存數(shù)字可寫。但從實(shí)現(xiàn)路徑來看資源占用有三個(gè)層級(jí)需要關(guān)注。7.1 行為數(shù)據(jù)生成階段的瓶頸構(gòu)造行為數(shù)據(jù)需要大量調(diào)用基礎(chǔ)模型。如果使用 7B 級(jí)別模型在不做量化的情況下單卡推理一批樣本的顯存占用通常在 15GB 到 20GB 之間。這個(gè)數(shù)值會(huì)隨上下文長度、批量大小和量化方式變化實(shí)際以本機(jī)測試為準(zhǔn)。如果顯存不足最常見的方法是降低批量大小、減少最大序列長度或者使用 4bit 量化加載模型。7.2 效用網(wǎng)絡(luò)訓(xùn)練的顯存開銷效用網(wǎng)絡(luò)本身的參數(shù)量很小主要是 MLP 或線性頭顯存占用遠(yuǎn)小于基礎(chǔ)模型。但如果需要對模型隱層狀態(tài)做反向傳播就必須保留隱層計(jì)算圖顯存成本會(huì)增加。實(shí)際操作時(shí)可以先把模型隱層向量離線抽取出來再單獨(dú)訓(xùn)練效用網(wǎng)絡(luò)這樣可以把顯存占用降得很低。7.3 如何觀察性能訓(xùn)練過程和生成階段可以用nvidia-smi觀察顯存占用nvidia-smi -l 2更新頻率設(shè)置為 2 秒一次重點(diǎn)看每個(gè)進(jìn)程的顯存占用和 GPU 利用率。如果顯存占用很高優(yōu)先降低 batch size如果 GPU 利用率很低大概率是數(shù)據(jù)加載或預(yù)處理階段出現(xiàn)了瓶頸。8. 常見問題與邊界問題現(xiàn)象可能原因排查方式解決方案傳遞性損失很小但生成質(zhì)量下降正則化權(quán)重過大模型過度追求一致性對比不同lambda_reg下的主任務(wù)指標(biāo)調(diào)低正則權(quán)重優(yōu)先保證主任務(wù)不退化一致性分?jǐn)?shù)很高但人工評估不認(rèn)可“理性”不完全等于“對齊”檢查模型在安全、有用性等維度的表現(xiàn)把無標(biāo)簽評估作為輔助指標(biāo)結(jié)合人工評估使用行為數(shù)據(jù)量不足效用網(wǎng)絡(luò)擬合不穩(wěn)定構(gòu)造的成對樣本太少統(tǒng)計(jì)行為樣本規(guī)模觀察效用網(wǎng)絡(luò)驗(yàn)證損失增加 prompt 覆蓋范圍和候選回答數(shù)量模型輸出出現(xiàn)循環(huán)偏好采樣溫度過高或模型本身偏好不穩(wěn)定記錄多次采樣結(jié)果分析偏好關(guān)系圖降低采樣溫度或?qū)Χ啻尾蓸咏Y(jié)果取平均無法復(fù)現(xiàn)論文效果關(guān)鍵細(xì)節(jié)缺失例如效用網(wǎng)絡(luò)的初始化、訓(xùn)練步數(shù)仔細(xì)閱讀論文正文和附錄小規(guī)模復(fù)現(xiàn)實(shí)驗(yàn)逐步調(diào)整超參數(shù)8.1 數(shù)據(jù)規(guī)模的下限無標(biāo)簽評估依賴成對比較數(shù)據(jù)如果行為樣本太少效用函數(shù)可能無法穩(wěn)定擬合。更穩(wěn)妥的做法是先用批量生成構(gòu)造一個(gè)覆蓋多種 prompt 風(fēng)格和回答長度的行為庫再開始訓(xùn)練效用網(wǎng)絡(luò)。8.2 失敗模式效用函數(shù)退化如果沒有梯度約束效用網(wǎng)絡(luò)可能把所有候選回答都打同一個(gè)分這樣傳遞性損失雖然很小卻沒有任何信息量。解決方法是加入 margin 約束并監(jiān)控效用分?jǐn)?shù)的分布。如果所有分?jǐn)?shù)都擠在零點(diǎn)附近說明模型沒有學(xué)到有效區(qū)分度。9. 最佳實(shí)踐與合規(guī)建議這套方法還處于研究階段想在生產(chǎn)環(huán)境使用建議按下面的順序推進(jìn)。9.1 先做小規(guī)模驗(yàn)證不要直接在大模型完整訓(xùn)練流程中引入新的正則項(xiàng)。先用一個(gè)小型模型或者少量數(shù)據(jù)驗(yàn)證“無標(biāo)簽評估分?jǐn)?shù)是否能反映模型行為差異”。如果一致性分?jǐn)?shù)無法區(qū)分不同模型或不同訓(xùn)練階段那就說明數(shù)據(jù)構(gòu)造或效用網(wǎng)絡(luò)設(shè)計(jì)有問題后面的大規(guī)模實(shí)驗(yàn)也沒有意義。9.2 保留最小可運(yùn)行實(shí)驗(yàn)配置任何實(shí)驗(yàn)項(xiàng)目都應(yīng)該有一份可以隨時(shí)復(fù)跑的 baseline 配置。數(shù)據(jù)集、prompt 生成策略、行為采樣參數(shù)、效用網(wǎng)絡(luò)超參、lambda_reg取值都要記錄在實(shí)驗(yàn)表中。否則一旦效果不好很難判斷是數(shù)據(jù)問題、模型問題還是正則化參數(shù)問題。9.3 合規(guī)與授權(quán)提醒如果行為數(shù)據(jù)來自公開模型或 API 服務(wù)需要注意服務(wù)條款和使用場景限制。如果涉及用戶數(shù)據(jù)、內(nèi)部業(yè)務(wù)數(shù)據(jù)必須在授權(quán)范圍內(nèi)使用。涉及人臉、聲音、人物肖像或版權(quán)素材的內(nèi)容需要先確認(rèn)是否有合法授權(quán)否則只能用于內(nèi)部技術(shù)驗(yàn)證不能發(fā)布或商用。9.4 學(xué)術(shù)引用與傳播如果是用來寫論文或技術(shù)博客應(yīng)該標(biāo)注該方法來源引用原始論文和理論出處。在技術(shù)分享中要區(qū)分“論文原意”和“自己的實(shí)現(xiàn)思路”避免讓讀者誤以為某個(gè)代碼骨架是官方實(shí)現(xiàn)。10. 總結(jié)與下一步這個(gè)方向最值得嘗試的點(diǎn)在于它把“模型行為是否一致”變成了一個(gè)可計(jì)算的、可微分的信號(hào)。相比依賴人工標(biāo)注的傳統(tǒng)評估方式無標(biāo)簽評估的成本更低可以和主訓(xùn)練目標(biāo)并行使用尤其適合模型行為差異排查和偏好微調(diào)輔助約束。如果動(dòng)手驗(yàn)證建議最先做一件事用一個(gè)小模型構(gòu)造一批成對比較數(shù)據(jù)訓(xùn)練一個(gè)簡單的效用打分函數(shù)然后檢查“一致性分?jǐn)?shù)是否能區(qū)分不同訓(xùn)練步數(shù)的模型”。如果能再繼續(xù)嘗試把傳遞性損失加到訓(xùn)練目標(biāo)中。最容易踩的坑有兩個(gè)。一是把“理性一致”等同于“符合人類預(yù)期”導(dǎo)致評估結(jié)果與人工評估嚴(yán)重脫節(jié)二是正則化權(quán)重設(shè)置過大模型為了保持偏好一致而犧牲了原本的生成能力出現(xiàn)明顯的質(zhì)量退化。后續(xù)可以繼續(xù)擴(kuò)展的方向包括把無標(biāo)簽評估分?jǐn)?shù)接入自動(dòng)數(shù)據(jù)篩選流程、構(gòu)造更復(fù)雜的多候選行為數(shù)據(jù)、把一致性約束擴(kuò)展到組合多個(gè)模型輸出上以及在 RLHF 訓(xùn)練管線中把它作為一個(gè)額外的獎(jiǎng)勵(lì)分支。這套思路不會(huì)取代人工標(biāo)注但可以在標(biāo)注成本上真正省下一部分預(yù)算讓模型調(diào)優(yōu)過程更可控。