計嚴謹性驅(qū)動 A/B 測試「Ship / Extend / Stop」決策的完整工作流)
PM Skills 的 /analyze-test以統(tǒng)計嚴謹性驅(qū)動 A/B 測試「Ship / Extend / Stop」決策的完整工作流【免費下載鏈接】pm-skillsPM Skills Marketplace: 100 agentic skills, commands, and plugins — from discovery to strategy, execution, launch, and growth.項目地址: https://gitcode.com/GitHub_Trending/pm/pm-skills導(dǎo)讀/analyze-test是 pm-data-analytics 插件中面向產(chǎn)品經(jīng)理的 A/B 測試分析命令從匯總統(tǒng)計、原始 CSV、實驗平臺截圖或自然語言描述中接收實驗數(shù)據(jù)依次完成實驗設(shè)計校驗、統(tǒng)計顯著性計算、效應(yīng)量與置信區(qū)間評估最終產(chǎn)出包含明確產(chǎn)品決策Ship / Extend / Stop與業(yè)務(wù)影響估算的分析報告。讀完本文你將掌握該命令的五步工作流、完整的報告模板、背后的樣本量公式與統(tǒng)計檢驗實現(xiàn)以及如何利用倉庫中的 ab-test-analysis 技能與 Python/scipy.stats 完成可復(fù)現(xiàn)的顯著性計算。一、命令定位pm-data-analytics 插件中的實驗決策入口在 pm-skills 倉庫中pm-data-analytics 插件將「數(shù)據(jù)分析」能力拆分為三個命令與三個技能構(gòu)成產(chǎn)品經(jīng)理日常數(shù)據(jù)分析的完整工具箱命令/write-query自然語言生成 SQL、/analyze-cohorts留存與參與度隊列分析、/analyze-testA/B 測試結(jié)果分析技能sql-queries、cohort-analysis、ab-test-analysis。其中/analyze-test是唯一直接面向?qū)嶒灈Q策的入口。其元數(shù)據(jù)pm-data-analytics/commands/analyze-test.md 的 YAML frontmatter明確了它的職責(zé)邊界description: Analyze A/B test results — statistical significance, sample size validation, and ship/extend/stop recommendations argument-hint: test results as data, screenshot, or descriptionargument-hint表明該命令接受三種形態(tài)的輸入結(jié)構(gòu)化數(shù)據(jù)、實驗平臺截圖或純文字描述這也決定了 Step 1 的數(shù)據(jù)接收設(shè)計。從插件清單 pm-data-analytics/.claude-plugin/plugin.json 可以看到該插件版本為 2.0.0關(guān)鍵詞覆蓋 product-management、data-analytics、sql、cohort-analysis、retention而在 README.md 的插件總覽中/analyze-test被定位為「Analyze A/B test results —— statistical significance, sample size validation, and ship/extend/stop recommendations」。命令與技能的綁定關(guān)系是倉庫的顯式設(shè)計/analyze-test在 Step 3 中調(diào)用ab-test-analysis技能見 pm-data-analytics/skills/ab-test-analysis/SKILL.md。倉庫根目錄的 validate_plugins.py 中validate_cross_references函數(shù)L289-L310會校驗命令中引用的技能必須存在于同一插件內(nèi)保證這種「命令鏈技能」的結(jié)構(gòu)不懸空。二、Invocation三種調(diào)用姿勢命令支持三種等價調(diào)用方式覆蓋從「手上有原始數(shù)據(jù)」到「只有一段口頭描述」的全部場景/analyze-test Control: 4.2% conversion (n5000), Variant: 4.8% conversion (n5100) /analyze-test [upload a CSV of test results] /analyze-test [screenshot from your experimentation platform]第一種直接內(nèi)聯(lián)匯總統(tǒng)計量對照組轉(zhuǎn)化率 4.2%、樣本 5000實驗組轉(zhuǎn)化率 4.8%、樣本 5100適合數(shù)據(jù)已在手上、快速出結(jié)論的場景第二種與第三種面向原始事件數(shù)據(jù)與實驗平臺Optimizely、LaunchDarkly 等的導(dǎo)出結(jié)果命令會自動讀取并解析。這與 ab-test-analysis 技能中的約定一致If the user provides data files (CSV, Excel, or analytics exports), read and analyze them directly. Generate Python scripts for statistical calculations when needed.三、五步工作流從數(shù)據(jù)輸入到?jīng)Q策輸出Step 1接受測試數(shù)據(jù)Accept Test Data命令以「格式無關(guān)」為設(shè)計原則接受的輸入包括匯總統(tǒng)計各變體的轉(zhuǎn)化率與樣本量原始事件數(shù)據(jù)CSV要求包含user_id、variant、converted、timestamp等關(guān)鍵列實驗平臺截圖Optimizely、LaunchDarkly 等平臺的運行結(jié)果截圖實驗與結(jié)果的文字描述。CSV 這類原始數(shù)據(jù)會觸發(fā)技能中的自動處理邏輯讀取文件后生成 Python 腳本完成統(tǒng)計計算而不是依賴人眼估算。Step 2校驗實驗設(shè)計Validate Test Design這是命令強調(diào)「先校驗、再分析」的關(guān)鍵一步——結(jié)果來自有缺陷的實驗時再漂亮的顯著性數(shù)字也具有誤導(dǎo)性。四個校驗維度樣本量是否充足運行功效分析power analysis確認樣本量能否支撐期望效應(yīng)量的檢測實驗時長是否足夠至少覆蓋 1~2 個完整業(yè)務(wù)周期business cycles以捕獲周度周期波動隨機化是否干凈檢查樣本比率失配Sample Ratio MismatchSRM——當實驗組與對照組流量占比偏離預(yù)設(shè)比例時隨機化很可能被破壞實驗期間的外部因素季節(jié)性活動、市場事件、版本發(fā)布等是否污染了結(jié)果窗口。ab-test-analysis 技能為樣本量校驗提供了可直接套用的公式n (Z2α/2 × 2 × p × (1-p)) / MDE2其中 Zα/2 為 95% 置信水平下的雙側(cè)分位數(shù)約 1.96p 為基準轉(zhuǎn)化率MDE 為最小可檢測效應(yīng)Minimum Detectable Effect。技能同時設(shè)定了一個硬性閾值功效低于 80% 即為 underpowered統(tǒng)計功效不足必須顯式標記。Step 3分析結(jié)果Analyze ResultsStep 3 調(diào)用 ab-test-analysis 技能執(zhí)行五個層面的統(tǒng)計評估統(tǒng)計顯著性Statistical significance計算 p-value 與置信區(qū)間效應(yīng)量Effect size變體間的絕對差與相對差實際顯著性Practical significance效應(yīng)是否大到對業(yè)務(wù)有意義——統(tǒng)計顯著 ≠ 業(yè)務(wù)值得上線置信區(qū)間Confidence interval真實效應(yīng)的合理取值范圍分段分析Segment analysis數(shù)據(jù)允許時檢查不同用戶分段是否存在差異化效應(yīng)。技能在Calculate statistical significance步驟中給出了具體的計算口徑pm-data-analytics/skills/ab-test-analysis/SKILL.md L33-L41分別計算對照組與實驗組的轉(zhuǎn)化率相對提升Relative lift(variant - control) / control × 100p-value使用雙尾 z 檢驗two-tailed z-test或卡方檢驗chi-squared test95% 置信區(qū)間針對組間差值計算統(tǒng)計顯著性判定p 0.05實際顯著性判定提升量對業(yè)務(wù)是否有意義。對于提供原始數(shù)據(jù)的場景技能要求生成并運行 Python 腳本完成上述全部計算倉庫約定使用scipy.stats見命令 Notes 末尾。除主指標外技能還強制檢查守衛(wèi)指標guardrail metricsL43-L45如果收入、活躍度、頁面加載時間等守衛(wèi)指標在主指標提升的同時出現(xiàn)惡化那么「主指標獲勝」可能并不是一個真正的勝利——這是 Step 4 決策時需要權(quán)衡的核心輸入。Step 4生成分析報告Generate Analysis命令在 Step 4 輸出一份結(jié)構(gòu)化的完整報告模板命令執(zhí)行時會按此骨架填充真實數(shù)據(jù)## A/B Test Analysis: [Test Name] **Date**: [today] **Test duration**: [X days/weeks] **Total sample**: [N users] ### Results Summary | Variant | Sample | Metric | Rate | 95% CI | |---------|--------|--------|------|--------| | Control | [n] | [metric] | [X%] | [X% - Y%] | | Variant | [n] | [metric] | [X%] | [X% - Y%] | ### Statistical Analysis - **Relative lift**: [X%] ([CI range]) - **P-value**: [X] - **Statistically significant**: [Yes/No] at 95% confidence - **Minimum detectable effect**: [X%] (what the test was powered to detect) ### Sample Size Check - **Required sample**: [N] per variant (for [X%] MDE at 80% power) - **Actual sample**: [N] per variant - **Verdict**: [Sufficiently powered / Underpowered / Overpowered] ### Decision **Recommendation: [SHIP / EXTEND / STOP]** [Clear explanation of why, considering both statistical and practical significance] ### Business Impact Estimate If shipped to 100% of users: - **Expected impact**: [metric change per month/quarter] - **Revenue impact**: [if applicable] - **Confidence**: [How certain we are about this estimate] ### Caveats - [Any concerns about the test validity] - [Segments where results differ] - [Novelty effects or other biases to consider] ### Follow-Up - [What to test next based on learnings] - [Monitoring plan if shipping the variant]報告設(shè)計上值得注意的幾點Sample Size Check用「實際樣本 vs 需求樣本」直接給出 Sufficiently powered / Underpowered / Overpowered 判定與 Step 2 的功效分析首尾呼應(yīng)Business Impact Estimate把統(tǒng)計結(jié)果翻譯成月度/季度業(yè)務(wù)指標變化與收入影響并強制要求標注置信度避免把區(qū)間估計當確定值Caveats與Follow-Up則把實驗的有效性疑慮、分段差異、新奇效應(yīng)novelty effect和后續(xù)監(jiān)控計劃顯式列出。技能側(cè)還提供了一個更精簡的結(jié)果摘要格式L58-L72適合快速匯報Hypothesis / Duration / Sample頭信息 主指標與守衛(wèi)指標對照表Metric | Control | Variant | Lift | p-value | Significant?Recommendation / Reasoning / Next steps三段式收尾。Step 5提供下一步行動建議Offer Next Steps分析完成并非終點命令在 Step 5 主動銜接后續(xù)工作流提供三類跟進選項Want me todesign a follow-up experimentbased on these findings?——基于本次發(fā)現(xiàn)設(shè)計后續(xù)實驗Should Irun the analysis for specific segments?——針對特定用戶分段深入分析Want me togenerate the SQLto monitor this metric post-launch?——生成上線后監(jiān)控指標的 SQL。第三項直接與同插件的/write-query命令形成工作流銜接——這也呼應(yīng)了 README.md 中「Commands are designed to flow into each other」的設(shè)計理念一條命令結(jié)束后建議的相關(guān)命令恰好是產(chǎn)品經(jīng)理工作流的自然下一環(huán)。四、決策框架從統(tǒng)計結(jié)果到產(chǎn)品結(jié)論的映射表ab-test-analysis 技能給出了「實驗結(jié)果 → 推薦動作」的完整映射表這是 Step 4 中 SHIP / EXTEND / STOP 決策的依據(jù)pm-data-analytics/skills/ab-test-analysis/SKILL.md L49-L55OutcomeRecommendationSignificant positive lift, no guardrail issuesShip it— roll out to 100%Significant positive lift, guardrail concernsInvestigate— understand trade-offs before shippingNot significant, positive trendExtend the test— need more data or larger effectNot significant, flatStop the test— no meaningful difference detectedSignificant negative liftDont ship— revert to control, analyze why這張表的精髓在于引入了第五種狀態(tài)當主指標顯著為正但守衛(wèi)指標惡化時決策不是簡單的 Ship 而是 Investigate——先理解權(quán)衡trade-off再決定是否全量。這與命令文檔中「統(tǒng)計顯著性 ≠ 實際顯著性」的警示一脈相承。五、統(tǒng)計實現(xiàn)要點scipy.stats 與可復(fù)現(xiàn)計算當輸入為 CSV 原始數(shù)據(jù)時命令與技能約定使用Python scipy.stats生成完整分析命令 Notes 第 5 條If data is provided as CSV, generate the full analysis using Python with scipy.stats。從技能的算法描述可以還原出實現(xiàn)路徑轉(zhuǎn)化率converted列按variant分組求均值相對提升(variant_rate - control_rate) / control_rate * 100顯著性檢驗雙尾 z 檢驗對比例可用 z-test for proportions或卡方檢驗scipy.stats.chi2_contingency得到 p-value置信區(qū)間基于比例的 Wald 區(qū)間或更穩(wěn)健的 Wilson 區(qū)間輸出 95% CI樣本量/功效校驗代入 Step 2 的公式n (Z2α/2 × 2 × p × (1-p)) / MDE2反推需求樣本量并與實際樣本對比給出 powered 判定。技能中Think step by step. Save as markdown. Generate Python scripts for calculations if raw data is provided.L74意味著完整分析腳本會被保存保證結(jié)論可復(fù)現(xiàn)、可隨新數(shù)據(jù)重跑——這與/analyze-cohorts命令中「保存 Python 腳本以便用新數(shù)據(jù)重跑」的約定pm-data-analytics/commands/analyze-cohorts.md Notes是同一設(shè)計哲學(xué)。六、注意事項與常見陷阱Notes命令文檔在 Notes 一節(jié)集中列出了實踐中的關(guān)鍵警示這些是產(chǎn)品經(jīng)理最容易踩坑的地方統(tǒng)計顯著 ≠ 實際顯著數(shù)據(jù)足夠多時 0.1% 的提升也能顯著但未必值得上線——決策必須同時看效應(yīng)量的業(yè)務(wù)意義先查樣本比率失配SRM在信任任何結(jié)果之前確認實驗組/對照組流量比例符合預(yù)設(shè)新奇效應(yīng)會虛高短期結(jié)果建議上線后持續(xù)監(jiān)控 2~4 周讓新奇效應(yīng)消退后再下最終結(jié)論功效不足時正確答案通常是「延展」而非「無效果」Underpowered 實驗無法區(qū)分「沒有差異」和「差異太小測不出來」此時 EXTEND 比 STOP 更穩(wěn)妥收入類指標要用置信區(qū)間估算影響用置信區(qū)間的上下界分別估算最好與最壞的業(yè)務(wù)影響而不是只報點估計CSV 數(shù)據(jù)走 Python scipy.stats保證計算的精確性與可復(fù)現(xiàn)性而非手工估算。七、在倉庫中的實現(xiàn)結(jié)構(gòu)與進一步閱讀如果你希望深入理解該命令的工程實現(xiàn)與周邊配套可以在倉庫中按以下路徑繼續(xù)探索命令本體pm-data-analytics/commands/analyze-test.md —— 本文所基于的核心文檔frontmatter 含description與argument-hint底層技能pm-data-analytics/skills/ab-test-analysis/SKILL.md —— 樣本量公式、檢驗方法、決策映射表與結(jié)果摘要模板的完整定義插件清單pm-data-analytics/.claude-plugin/plugin.json —— 插件元數(shù)據(jù)、作者信息與關(guān)鍵詞插件 READMEpm-data-analytics/README.md —— 三個技能與三個命令的索引安裝方式在 README.md 中可查看claude plugin install pm-data-analyticspm-skills的安裝命令Claude Code 與 Codex CLI 均支持質(zhì)量保障validate_plugins.py —— 根目錄的插件校驗?zāi)_本validate_commandL232-L265檢查命令 frontmatter 必填字段validate_cross_referencesL289-L310校驗命令引用的技能存在性保證本文所述「命令 → 技能」鏈條的完整性。在 pm-data-analytics/skills/ab-test-analysis/SKILL.md 的 Further Reading 一節(jié)還列出了 A/B 測試基礎(chǔ)、實驗庫與指標選擇等延伸閱讀原文為外部鏈接此處僅提示其存在。結(jié)合命令文檔的完整工作流與技能層的統(tǒng)計實現(xiàn)/analyze-test為產(chǎn)品經(jīng)理提供了一條從「拿到實驗數(shù)據(jù)」到「做出有依據(jù)的產(chǎn)品決策」的標準化路徑先校驗實驗設(shè)計、再計算統(tǒng)計量、最終在統(tǒng)計顯著性與實際顯著性之間做出權(quán)衡把 A/B 測試從「看誰的百分比高」升級為「用統(tǒng)計嚴謹性說話」?!久赓M下載鏈接】pm-skillsPM Skills Marketplace: 100 agentic skills, commands, and plugins — from discovery to strategy, execution, launch, and growth.項目地址: https://gitcode.com/GitHub_Trending/pm/pm-skills創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考