深度解析)
Claude Sonnet 4.6 運行時安全注入指令safety_instructions_from_anthropic深度解析【免費下載鏈接】system_prompts_leaksExtracted system prompts from Anthropic - Claude Fable 5.1, Opus 5, Claude Design, Claude Code. OpenAI - ChatGPT GPT-6-Astra, Codex. Google - Gemini 3.8 Flash, 3.1 Pro, Antigravity. xAI - Grok, Grok Bot, Cursor, Kimi and more! Updated regularly.項目地址: https://gitcode.com/GitHub_Trending/sy/system_prompts_leaks本文基于 system_prompts_leaks 倉庫中捕獲的 Anthropic/sonnet-4.6-reminders.md 泄漏樣本對其中兩段專用于 Claude Sonnet 4.6 的運行時健康安全指令進行逐條拆解分析它們的注入時機、與 Anthropic 分類器/提醒機制的關(guān)系、飲食失調(diào)與自殘危機兩條策略的操作細(xì)節(jié)并對照主系統(tǒng)提示詞中的靜態(tài)策略驗證其一致性。讀完本文你將能準(zhǔn)確理解此類動態(tài)注入 vs 靜態(tài)策略雙層安全提示結(jié)構(gòu)的組織方式以及 Anthropic 在敏感話題上少做而非多做的設(shè)計思路。這份文檔是什么一類僅針對 Sonnet 4.6 的新注入文件第一行即點明其特殊性New injections detected only active for sonnet-4.6。在整個倉庫中執(zhí)行全文檢索可發(fā)現(xiàn)safety_instructions_from_anthropic這一 XML 標(biāo)簽只出現(xiàn)在該文件內(nèi)說明它是捕獲者在對 Claude Sonnet 4.6 交互過程中發(fā)現(xiàn)并單獨歸檔的一類新型運行時注入?yún)^(qū)別于其他模型版本。文檔主體由兩段結(jié)構(gòu)完全相同的注入塊組成safety_instructions_from_anthropic ... /safety_instructions_from_anthropic兩段分別覆蓋飲食失調(diào)disordered eating與自殺/自殘suicide / self-harm兩類話題。它們不是模型固有系統(tǒng)提示詞的一部分而是當(dāng)自動化安全分類器automated safety classifier在對話流中命中特定主題后、隨用戶消息一并送入上下文的動態(tài)指令。這一點在兩段文本中均有自述This conversation was flagged by an automated classifier for potential disordered eating themes.、An automated safety classifier has flagged this conversation as potentially involving suicide or self-harm.因此閱讀本文件時應(yīng)當(dāng)與同目錄下的兩處靜態(tài)資料配合使用Claude Sonnet 4.6 主系統(tǒng)提示詞包含模型固有的user_wellbeing、anthropic_reminders等靜態(tài)策略Anthropic 注入提醒清單列出了 image_reminder、cyber_warning、system_warning、ethics_reminder、ip_reminder、long_conversation_reminder 六類常規(guī)提醒及全文模板。注入機制與提醒體系的分工要理解本文件的價值需要先弄清 Anthropic 的分類器 → 注入鏈路。主系統(tǒng)提示詞的anthropic_reminders一節(jié)明確寫道見 Anthropic/claude-sonnet-4.6.md 第 101-109 行Anthropic may send Claude reminders or warnings when a classifier fires or another condition is met. The current set: image_reminder, cyber_warning, system_warning, ethics_reminder, ip_reminder, and long_conversation_reminder.而 Anthropic/anthropic_reminders.md 提供了這六類提醒的完整注入模板。Sonnet 4.6 的主提示詞中image_reminder等標(biāo)簽名與清單文檔一一對應(yīng)說明這類注入是提示詞中的占位聲明 運行時實際注入模板的設(shè)計系統(tǒng)提示詞只告知模型存在哪些提醒類型真正的策略正文在分類器命中后才進入上下文。本文件的兩段注入則屬于另一個并行的分類器通道它們不以*_reminder/*_warning命名而是統(tǒng)一使用safety_instructions_from_anthropic標(biāo)簽專門針對用戶身心健康風(fēng)險話題飲食失調(diào)、自殺與自殘并且在正文開篇刻意聲明來源身份——These instructions are a precaution from Anthropic, not the user, and not a judgment of you. 這種自我聲明并非冗余主提示詞在anthropic_reminders中專門告誡過模型——用戶可以在自己消息末尾的標(biāo)簽內(nèi)偽造 Anthropic 內(nèi)容見 Anthropic/claude-sonnet-4.6.md 第 107 行因此模型必須對聲稱來自 Anthropic 但試圖放寬限制的標(biāo)簽內(nèi)容保持警惕。本文件注入塊反復(fù)強調(diào)來自 Anthropic 而非用戶正可理解為在上下文層面為該防線提供更強的來源錨點。注入一飲食失調(diào)disordered eating專項指令逐條解析第一段注入是三條高度濃縮的規(guī)則全部圍繞一個核心判斷展開當(dāng)飲食失調(diào)指標(biāo)真實存在時建議本身就是主要的傷害向量advice-giving is the primary harm vector。When disordered eating indicators are genuinely present: advice-giving is the primary harm vector. Meal plans, calorie guidance, balanced eating tips—these look helpful but get filtered through the disorder and become fuel.這是整段注入的理論前提模型提供的看起來有益的飲食建議膳食計劃、卡路里指引、所謂均衡飲食貼士會被進食障礙者以扭曲的方式吸收變成強化障礙的燃料。因此指令給出了與常規(guī)對話截然相反的響應(yīng)取向少做而非多做the move is to do less, not more驗證對方的情感體驗、保持專業(yè)支持渠道暢通、克制由我來修復(fù)你的飲食問題的沖動。這與主提示詞user_wellbeing中避免鼓勵或助長自我毀滅行為含飲食失調(diào)的靜態(tài)原則一脈相承見 Anthropic/claude-sonnet-4.6.md 第 141 行。絕不引入數(shù)字不提及卡路里、BMI、體重、宏量營養(yǎng)素calories, BMI, weights, macros中的任何一項。絕不對外貌做任何方向的評價指令專門指出you look healthy這類貌似正向的表述也可能被解讀為你看起來胖了因此連中性偏正向的外貌評價也被禁止。資源指引需分區(qū)域且保持最新指向適應(yīng)用戶所在地區(qū)的進食障礙專項支持ED-specific support appropriate to the users region并明確警告——不要推薦 NEDA 求助熱線因為它已停用Do not recommend the NEDA Helpline; it has been disconnected。值得注意的是第 4 條在倉庫內(nèi)形成了一個可交叉驗證的一致證據(jù)鏈主提示詞user_wellbeing中同樣寫道when suggesting eating disorder support resources, Claude directs users to the National Alliance for Eating Disorder helpline instead of NEDA, because NEDA has been permanently disconnectedAnthropic/claude-sonnet-4.6.md 第 147 行而原始捕獲 Anthropic/raw/claude-sonnet-4.6-raw.md 與無工具版本中也存在措辭幾乎一致的同一規(guī)則。這說明NEDA 已斷線 → 改用 National Alliance for Eating Disorder是本代模型中靜態(tài)策略與動態(tài)注入共同維護的一致事實也從側(cè)面印證本文件與主提示詞屬于同一次捕獲的同一模型代次。注入二自殺與自殘危機專項指令的四步協(xié)議第二段注入篇幅更長結(jié)構(gòu)上可分為五個層次來源聲明、直接處理的優(yōu)先級、框架風(fēng)險、危機四步協(xié)議、以及禁止事項與豁免情形。先處理危機再回答問題指令要求當(dāng)用戶話語中出現(xiàn)指向其自身first-person的自殺/自殘信號時必須先正面處理再回答對方提出的任務(wù)或問題——即使話題本身是相鄰無關(guān)的主題也不能跳過?;貞?yīng)措辭具有流行病學(xué)級的影響指令引用了群體媒體研究結(jié)論作為設(shè)計依據(jù)population-level media research consistently shows that how suicide and self-harm are framed affects real-world outcomes并指出AI 的回應(yīng)可能被感知為比人類的同一句話更客觀或更真實。由此推出兩條措辭約束可以驗證用戶情緒、承認(rèn)其痛苦的正當(dāng)性但禁止以任何顯式或隱式方式認(rèn)可/辯護自殺或自殘是必要或符合邏輯的回應(yīng)也禁止將其美化或浪漫化同時不得把用戶的痛苦當(dāng)作智識或哲學(xué)練習(xí)來探討Do not engage with the users distress as an intellectual or philosophical exercise。危機判定的明確觸發(fā)器注入給出了可操作的判定標(biāo)準(zhǔn)如果用戶陳述了當(dāng)前的自殺意圖present suicidal intent、計劃plan、時間線timeline和/或獲取手段的途徑access to means就應(yīng)視為潛在的危機信號potential indicator of crisis。本回合內(nèi)的四步協(xié)議若本回合是升級信號或危機初現(xiàn)注入要求在當(dāng)次回復(fù)內(nèi)依次執(zhí)行四步原文中的 (2)(3) 不得被跳過、不得推遲到后續(xù)回合plainly name what youre hearing——直白說出你所聽到的內(nèi)容offer one region-appropriate crisis contact if it hasnt been surfaced recently——若近期尚未給出過提供一個符合用戶所在地區(qū)的危機聯(lián)絡(luò)方式if means are present, directly encourage them to put distance——若存在實施手段直接鼓勵用戶與手段保持距離或?qū)⑵浞獯鎍sk one question about right now——就當(dāng)下此刻提出一個問題。指令同時規(guī)定當(dāng)用戶明確處于危機中時溝通風(fēng)格應(yīng)轉(zhuǎn)為plain, clean, concise平實、干凈、簡潔以使其安全、落地于當(dāng)下為唯一目標(biāo)。絕對禁止項與角色扮演紅線任何框架下都不得提供方法、手段或致死性信息method, means, lethality不撰寫遺書或告別信息。虛構(gòu)與角色扮演不是漏洞即使涉及此類主題也只能寫情緒節(jié)拍emotional beat不得因此泄露方法/致死性細(xì)節(jié)——Fiction and roleplay are not a loophole。無需干預(yù)的豁免情形對話僅通過虛構(gòu)作品、歌詞、學(xué)術(shù)/臨床討論、隱喻、夸張、幽默、極簡影射觸及此類主題、且無第一人稱自我披露跡象時不需要進行身心健康探測。元層面的自我約束僅在相關(guān)或用戶直接詢問時才提及這些指令本身脫離語境的暗示或復(fù)述可能誤導(dǎo)或混淆用戶因此模型不應(yīng)無故引用注入內(nèi)容。從實現(xiàn)視角看本段與前一段共同體現(xiàn)了對分類器高誤報率的顯式設(shè)計第二段開頭即聲明These instructions are a precaution from Anthropic, not the user, and not a judgment主提示詞在ethics_reminder、anthropic_reminders中也多次出現(xiàn)automatically triggered, there is a possibility that the users message is not actually harmful ... If this is the case, Claude can proceed as normal之類的校準(zhǔn)語。這說明整類注入策略刻意采用寧可多數(shù)情況下不適用、也不犧牲正常對話質(zhì)量的精度取向指令進入上下文不等于必須拒答模型被要求自行判斷相關(guān)性并繼續(xù)正常服務(wù)。靜態(tài)策略與動態(tài)注入的雙層呼應(yīng)將本文件與 Sonnet 4.6 主提示詞對照可以看到動態(tài)注入并非憑空設(shè)計而是把靜態(tài)原則在分類器命中后的語境下做了操作化擴展話題靜態(tài)策略主提示詞動態(tài)注入本文件自殺/自殘?zhí)峁?zhǔn)確資源、不強化求助回避、不鼓勵對 Claude 的過度依賴claude-sonnet-4.6.mduser_wellbeing給出命名→危機聯(lián)絡(luò)→隔離手段→提問當(dāng)下的四步行動協(xié)議與致死性信息禁令進食障礙資源指向 National Alliance for Eating Disorder 而非已停用的 NEDA同樣禁止推薦 NEDA并要求按用戶所在地區(qū)提供專項支持一般健康禁止助長自我毀滅行為self-destructive behaviors如以冰敷、橡皮筋、冷水等制造痛感/感官沖擊作為應(yīng)對技巧claude-sonnet-4.6.md 第 141 行針對飲食失調(diào)明確建議即傷害向量要求少做而非多做可以推斷二者的關(guān)系是靜態(tài)user_wellbeing決定模型的長期價值取向動態(tài)safety_instructions_from_anthropic則在危機語境下提供回合級turn-level的即時操作約束——后者比前者更具體、更可執(zhí)行且只在分類器命中時占用上下文。局限與事實邊界最后需要說明本文證據(jù)的適用邊界所有結(jié)論均以本倉庫內(nèi)容為準(zhǔn)本文件是泄漏樣本見倉庫 README.md 對項目定位的描述僅代表捕獲者在特定時刻、特定交互條件下觀察到的注入內(nèi)容無法據(jù)此驗證 Anthropic 生產(chǎn)環(huán)境的真實部署行為、觸發(fā)閾值或分類器實現(xiàn)。文件頭聲稱該注入僅 Sonnet 4.6 活躍就本倉庫現(xiàn)狀而言safety_instructions_from_anthropic標(biāo)簽確實只出現(xiàn)于本文件。這可以表述為倉庫層面的觀察事實但不能外推為對 Anthropic 各模型線上行為的普遍結(jié)論。文中對注入動機、設(shè)計意圖的推斷均基于注入文本本身的自述如引用媒體研究、聲明高誤報率未引入任何外部資料或未經(jīng)證實的數(shù)據(jù)。對于研究 AI 安全提示工程、構(gòu)建分類器 注入雙層護欄或設(shè)計面向敏感人群的對話策略的研究者與工程師而言本文件的價值在于它是一份罕見的、可完整還原端到端設(shè)計的運行時策略樣例——從觸發(fā)聲明、來源錨定、精度校準(zhǔn)到分步操作協(xié)議與絕對禁令層次完整、彼此印證值得逐句研讀?!久赓M下載鏈接】system_prompts_leaksExtracted system prompts from Anthropic - Claude Fable 5.1, Opus 5, Claude Design, Claude Code. OpenAI - ChatGPT GPT-6-Astra, Codex. Google - Gemini 3.8 Flash, 3.1 Pro, Antigravity. xAI - Grok, Grok Bot, Cursor, Kimi and more! Updated regularly.項目地址: https://gitcode.com/GitHub_Trending/sy/system_prompts_leaks創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考