指南:N/O-糖基化位點掃描、突變設(shè)計與治療性抗體優(yōu)化(scientific-agent-skills 倉庫實踐))
Glycoengineering 糖基化工程實戰(zhàn)指南N/O-糖基化位點掃描、突變設(shè)計與治療性抗體優(yōu)化scientific-agent-skills 倉庫實踐【免費下載鏈接】scientific-agent-skillsTurn any AI agent into an AI Scientist. The #1 Agent Skills library for science, used by 190,000 scientists worldwide. 165 ready-to-use validated skills plus 100 scientific databases covering biology, chemistry, medicine, and drug discovery. Compatible with Cursor, Claude Code, Codex, Pi, Antigravity, and the open Agent Skills standard.項目地址: https://gitcode.com/GitHub_Trending/cl/scientific-agent-skills本指南以 scientific-agent-skills 倉庫中 glycoengineering 技能模塊為核心系統(tǒng)講解蛋白質(zhì) N-糖基化 sequonN-X-S/T掃描、O-糖基化熱點預(yù)測、糖基化位點的定向引入與消除以及 NetOGlyc、GlycoShield-MD、GlyConnect 等外部工具鏈的使用方法。讀完本文你將能獨立完成治療性抗體 Fc 區(qū)糖基化分析、疫苗抗原糖基化遮蔽設(shè)計、生物類似藥糖型比較等典型糖基化工程任務(wù)并可直接將文中 Python 代碼應(yīng)用于你自己的蛋白序列分析。糖基化工程概述為什么糖修飾如此關(guān)鍵糖基化Glycosylation是蛋白質(zhì)最常見也最復(fù)雜的翻譯后修飾PTM影響超過 50% 的人類蛋白。糖鏈glycan調(diào)控蛋白折疊、穩(wěn)定性、免疫識別、受體相互作用以及治療性蛋白的藥代動力學(xué)。糖基化工程Glycoengineering正是通過理性修改糖基化模式來提升治療效力、穩(wěn)定性或?qū)崿F(xiàn)免疫逃逸。在 glycoengineering 技能 中明確區(qū)分了兩種主要的糖基化類型N-糖基化N-glycosylation連接在天冬酰胺AsnN上識別序列為N-X-[S/T]其中 X ≠ 脯氨酸 Pro發(fā)生在內(nèi)質(zhì)網(wǎng)/高爾基體ER/Golgi中。O-糖基化O-glycosylation連接在絲氨酸SerS或蘇氨酸ThrT上沒有嚴格的共有基序consensus motif主要以 GalNAcN-乙酰半乳糖胺起始。從技能 frontmatter 元數(shù)據(jù)看該技能當前版本為1.1作者為 Kuan-lin Huanglicense 標注為Unknown——在安裝該技能前應(yīng)核實其許可條款這也是倉庫 README.md 對每個SKILL.md中l(wèi)icense字段的通用要求。何時使用糖基化工程技能該技能適用于以下六類典型場景對應(yīng) SKILL.md 的 When to Use This Skill場景目標抗體工程優(yōu)化 Fc 糖基化以增強 ADCC、CDC或降低免疫原性治療性蛋白設(shè)計識別影響半衰期、穩(wěn)定性或免疫原性的糖基化位點疫苗抗原設(shè)計工程化 glycan shield糖基化遮蔽將免疫應(yīng)答聚焦到保守表位生物類似藥表征比較參比藥與生物類似藥之間的糖型模式藥物靶點分析判斷糖基化是否影響受體與靶點的結(jié)合蛋白穩(wěn)定性N-糖鏈??煞€(wěn)定蛋白結(jié)構(gòu)據(jù)此識別用于穩(wěn)定化突變的位置從倉庫結(jié)構(gòu)看該技能以分析工具 知識庫的形式組織主文檔 SKILL.md 提供可運行代碼與策略表格配套的 glycan_databases.md 則沉淀了糖數(shù)據(jù)庫、預(yù)測服務(wù)器、質(zhì)譜糖蛋白組學(xué)工具與糖命名體系等參考資料。N-糖基化 Sequon 分析掃描 N-糖基化位點N-糖基化發(fā)生在N-X-[S/T]序列sequon上其中 X ≠ 脯氨酸。核心掃描邏輯在 SKILL.md 中通過標準庫re與滑動窗口方式實現(xiàn)import re from typing import List, Tuple def find_n_glycosylation_sequons(sequence: str) - List[dict]: Scan a protein sequence for canonical N-linked glycosylation sequons. Motif: N-X-[S/T], where X ≠ Proline. Args: sequence: Single-letter amino acid sequence Returns: List of dicts with position (1-based), motif, and context seq sequence.upper() results [] i 0 while i len(seq) - 3: triplet seq[i:i3] if triplet[0] N and triplet[1] ! P and triplet[2] in {S, T}: context seq[max(0, i-3):i6] # ±3 residue context results.append({ position: i 1, # 1-based motif: triplet, context: context, sequon_type: NXS if triplet[2] S else NXT }) i 3 else: i 1 return results實現(xiàn)要點解讀序列統(tǒng)一轉(zhuǎn)為大寫后再匹配避免大小寫字母導(dǎo)致漏檢三重條件判斷N、X≠P、第三位為S或T嚴格對應(yīng)經(jīng)典 sequon 定義命中后記錄±3 殘基上下文seq[max(0, i-3):i6]便于評估位點是否處于柔性環(huán)區(qū)或 β-轉(zhuǎn)角等可及區(qū)域匹配成功后指針前進 3i 3避免重疊窗口重復(fù)計數(shù)未命中則單步前進輸出采用1-based 位置與文獻和 UniProt 中的編號習(xí)慣一致便于與實驗數(shù)據(jù)對照。summarize_glycosylation_sites函數(shù)進一步將掃描結(jié)果整理為可寫進實驗記錄research log的結(jié)構(gòu)化摘要區(qū)分 N-X-S 與 N-X-T 兩類位點并輸出位置詳情def summarize_glycosylation_sites(sequence: str, protein_name: str ) - str: Generate a research log summary of N-glycosylation sites. sequons find_n_glycosylation_sequons(sequence) lines [f# N-Glycosylation Sequon Analysis: {protein_name or Protein}] lines.append(fSequence length: {len(sequence)}) lines.append(fTotal N-glycosylation sequons: {len(sequons)}) if sequons: lines.append(f\nN-X-S sites: {sum(1 for s in sequons if s[sequon_type] NXS)}) lines.append(fN-X-T sites: {sum(1 for s in sequons if s[sequon_type] NXT)}) lines.append(f\nSite details:) for s in sequons: lines.append(f Position {s[position]}: {s[motif]} (context: ...{s[context]}...)) else: lines.append(No canonical N-glycosylation sequons detected.) return \n.join(lines) # Example: IgG1 Fc region fc_sequence APELLGGPSVFLFPPKPKDTLMISRTPEVTCVVVDVSHEDPEVKFNWYVDGVEVHNAKTKPREEQYNSTYRVVSVLTVLHQDWLNGKEYKCKVSNKALPAPIEKTISKAKGQPREPQVYTLPPSREEMTKNQVSLTCLVKGFYPSDIAVEWESNGQPENNYKTTPPVLDSDGSFFLYSKLTVDKSRWQQGNVFSCSVMHEALHNHYTQKSLSLSPGK print(summarize_glycosylation_sites(fc_sequence, IgG1 Fc))示例中直接內(nèi)置了IgG1 Fc 區(qū)序列含 N297 所在區(qū)域運行后即可看到該序列中的 N-X-S/T 位點及其上下文——這是抗體工程最常用的起點數(shù)據(jù)。突變 N-糖基化位點糖基化工程的核心操作之一是定點消除或引入糖基化位點。SKILL.md 提供了兩個可直接使用的工具函數(shù)① 消除位點Asn → Gln 保守替換def eliminate_glycosite(sequence: str, position: int, replacement: str Q) - str: Eliminate an N-glycosylation site by substituting Asn → Gln (conservative). Args: sequence: Protein sequence position: 1-based position of the Asn to mutate replacement: Amino acid to substitute (default Q Gln; similar size, not glycosylated) Returns: Mutated sequence seq list(sequence.upper()) idx position - 1 assert seq[idx] N, fPosition {position} is {seq[idx]}, not N seq[idx] replacement.upper() return .join(seq)默認將 Asn 替換為GlnQ兩者側(cè)鏈大小相近、形狀相似屬于保守替換同時 Gln 不會被糖基化因此 N297Q 是抗體工程中經(jīng)典的去糖基化突變。函數(shù)內(nèi)斷言目標位置確實是 N防止誤操作。② 引入位點定向創(chuàng)建 N-X-S/Tdef add_glycosite(sequence: str, position: int, flanking_context: str S) - str: Introduce an N-glycosylation site by mutating a residue to Asn, and ensuring X ≠ Pro and 2 S/T. Args: position: 1-based position to introduce Asn flanking_context: S or T at position2 (if modification needed) seq list(sequence.upper()) idx position - 1 # Mutate to Asn seq[idx] N # Ensure X1 ! Pro (mutate to Ala if needed) if idx 1 len(seq) and seq[idx 1] P: seq[idx 1] A # Ensure X2 S or T if idx 2 len(seq) and seq[idx 2] not in (S, T): seq[idx 2] flanking_context return .join(seq)該函數(shù)同時處理三個必要條件將目標位置突變?yōu)?Asn、將 1 位的 Pro 替換為 AlaX≠P 約束、將 2 位補齊為 S 或 T。這在疫苗設(shè)計中用于在表面創(chuàng)建 glycan shield 非常實用——把原本暴露的脆弱表位用新引入的糖鏈蓋住。O-糖基化分析啟發(fā)式熱點預(yù)測與 N-糖基化不同O-糖基化沒有嚴格的共有基序因此 SKILL.md 提供了一種基于局部 S/T 密度的啟發(fā)式熱點評分方法作為快速基線并明確提示不能替代 NetOGlycdef predict_o_glycosylation_hotspots( sequence: str, window: int 7, min_st_fraction: float 0.4, disallow_proline_next: bool True ) - List[dict]: Heuristic O-glycosylation hotspot scoring based on local S/T density. Not a substitute for NetOGlyc; use as fast baseline. Rules: - O-GalNAc glycosylation clusters on Ser/Thr-rich segments - Flag Ser/Thr residues in windows enriched for S/T - Avoid S/T immediately followed by Pro (TP/SP motifs inhibit GalNAc-T) Args: window: Odd window size for local S/T density min_st_fraction: Minimum fraction of S/T in window to flag site if window % 2 0: window 7 seq sequence.upper() half window // 2 candidates [] for i, aa in enumerate(seq): if aa not in (S, T): continue if disallow_proline_next and i 1 len(seq) and seq[i1] P: continue start max(0, i - half) end min(len(seq), i half 1) segment seq[start:end] st_count sum(1 for c in segment if c in (S, T)) frac st_count / len(segment) if frac min_st_fraction: candidates.append({ position: i 1, residue: aa, st_fraction: round(frac, 3), window: f{start1}-{end}, segment: segment }) return candidates參數(shù)與規(guī)則說明參數(shù)默認值含義window7局部 S/T 密度統(tǒng)計的滑動窗口大小奇數(shù)偶數(shù)時自動回退為 7min_st_fraction0.4窗口內(nèi) S/T 占比達到該閾值才標記為熱點disallow_proline_nextTrue跳過后接 Pro 的 S/TTP/SP 基序抑制 GalNAc-TO-GalNAc 糖基化傾向于簇集在 S/T 富集區(qū)段因此以窗口內(nèi) S/T 占比作為打分依據(jù)是合理的快速基線同時排除 SP/TP 抑制基序與 GalNAc-T 酶學(xué)的已知底物偏好一致。外部糖基化工程工具鏈SKILL.md 系統(tǒng)性匯總了五類外部工具配套的 glycan_databases.md 提供了更完整的數(shù)據(jù)庫與服務(wù)器清單。這些外部服務(wù)以官方地址為準建議直接通過 Web 界面或各服務(wù)官方 API 使用1. NetOGlyc 4.0O-糖基化預(yù)測用途高精度 O-GalNAc 位點預(yù)測輸入FASTA 蛋白序列輸出逐殘基 O-糖基化概率分數(shù)方法在實驗驗證的 O-GalNAc 位點數(shù)據(jù)上訓(xùn)練的神經(jīng)網(wǎng)絡(luò)技能內(nèi)置了提交封裝示例結(jié)果通常需要 1–5 分鐘返回參數(shù)可能隨 Web 服務(wù)版本變化多數(shù)場景建議直接使用 Web 界面。同系列的NetNGlyc 1.0用于 N-糖基化預(yù)測輸出逐天冬酰胺概率閾值約 0.5見 glycan_databases.md。2. GlycoShield-MD糖鏈遮蔽分析用于分析分子動力學(xué)MD模擬軌跡中糖鏈對蛋白表面的遮蔽程度# Installation uv pip install glycoshield # Basic usage: analyze glycan shielding from glycosylated protein MD trajectory glycoshield \ --topology glycoprotein.pdb \ --trajectory glycoprotein.xtc \ --glycan_resnames BGLCNA FUC \ --output shielding_analysis/參數(shù)含義--topology指定糖基化蛋白結(jié)構(gòu)PDB 格式、--trajectory指定 MD 軌跡XTC 格式、--glycan_resnames列出糖殘基名稱如 BGLCNAβ-GlcNAc、FUC巖藻糖、--output指定輸出目錄。輸出為逐殘基遮蔽分數(shù)及可視化結(jié)果。該包已被列入倉庫測試依賴清單 tests/skill-requirements.tomlglycoshield、pandas、requests說明它是本技能的官方推薦依賴。3. GlycoWorkbench糖鏈結(jié)構(gòu)繪制與分析用途繪制糖鏈結(jié)構(gòu)、計算質(zhì)量、標注 MS 譜圖支持格式GlycoCT、IUPAC 壓縮糖命名法補充能力MS/MS 譜圖碎片離子的標注見 glycan_databases.md4. GlyConnect糖蛋白數(shù)據(jù)庫用途檢索經(jīng)實驗驗證的糖蛋白及其糖基化位點查詢方式按蛋白UniProt ID、糖鏈結(jié)構(gòu)或組織查詢集成將 UniProt 蛋白與實驗驗證的糖基化數(shù)據(jù)關(guān)聯(lián)import requests def query_glyconnect(uniprot_id: str) - dict: Query GlyConnect for glycosylation data for a protein. url fhttps://glyconnect.expasy.org/api/proteins/uniprot/{uniprot_id} response requests.get(url, headers{Accept: application/json}) if response.status_code 200: return response.json() return {} # Example: query EGFR glycosylation egfr_glyco query_glyconnect(P00533)配套參考文檔 glycan_databases.md 還提供了更完整的 GlyConnect API 封裝get_glycoprotein_info按 UniProt ID 取糖基化數(shù)據(jù)與get_glycan_compositions按 GlyConnect 蛋白條目取全部糖型組成。5. UniCarbKB糖鏈結(jié)構(gòu)數(shù)據(jù)庫用途瀏覽糖鏈結(jié)構(gòu)按質(zhì)量或組成檢索格式GlycoCT 或 IUPAC 命名法補充組織/細胞類型特異的糖型數(shù)據(jù)與質(zhì)譜數(shù)據(jù)見 glycan_databases.md此外glycan_databases.md 還補充了 GlyTouCan糖鏈結(jié)構(gòu)登記庫GTC 唯一編號支持 GlycoCT/WURCS/IUPAC 三種格式并給出api.glytoucan.org查詢示例、KEGG Glycan糖鏈與生物合成通路、CAZy糖活性酶數(shù)據(jù)庫用于挑選糖基化工程所需的酶等資源以及 GlycoMine、SymLink 等機器學(xué)習(xí)預(yù)測服務(wù)器。核心糖基化工程策略治療性抗體優(yōu)化策略SKILL.md 給出了抗體場景的工程目標與對應(yīng)策略目標策略說明增強 ADCCFc Asn297 去巖藻糖基化非巖藻糖基化 IgG1 對 FcγRIIIa 的結(jié)合力約提升 50 倍降低免疫原性移除非人源糖鏈消除 α-Gal、NGNA 表位改善 PK 半衰期唾液酸化Sialylation唾液酸修飾可延長半衰期降低炎癥高唾液酸化HypersialylationIVIG 抗炎機制之一創(chuàng)建糖基化遮蔽表面引入 N-糖基化位點掩蓋易感表位疫苗設(shè)計常用突變位點突變效應(yīng)N297A/QIgG1移除 Fc 糖基化無糖基化aglycosylN297DIgG1移除 Fc 糖基化S298A/E333A/K334A增強 FcγRIIIa 結(jié)合F243LIgG1增強去巖藻糖基化T299A移除 Fc 糖基化glycan_databases.md 進一步匯總了治療性糖蛋白及其關(guān)鍵糖基化位點IgG1 抗體 Fc 區(qū) N297決定 ADCC/CDC 效應(yīng)功能、促紅細胞生成素EPO的 N24/N38/N83 與 O-糖鏈影響藥代、依那西普Etanercept的 N420、tPA 的 N117/N184/N448纖溶結(jié)合以及凝血因子 VIII 的 25 個 N-糖基化位點影響清除率——可作為糖基化工程改造的參考靶標集合。糖鏈命名與表示法IUPAC 壓縮命名法單糖縮寫符號全稱類型Glc葡萄糖HexoseGlcNAcN-乙酰氨基葡萄糖HexNAcMan甘露糖HexoseGal半乳糖HexoseFuc巖藻糖DeoxyhexoseNeu5AcN-乙酰神經(jīng)氨酸唾液酸Sialic acidGalNAcN-乙酰半乳糖胺HexNAc復(fù)雜 N-糖鏈結(jié)構(gòu)示例典型雙天線復(fù)雜型 N-糖鏈復(fù)雜 biantennary N-glycan的線性表示Neu5Ac-Gal-GlcNAc-Man\ Man-GlcNAc-GlcNAc-[Asn] Neu5Ac-Gal-GlcNAc-Man/ (±Core Fuc at innermost GlcNAc)牛津命名法N-糖glycan_databases.md 補充了糖蛋白組學(xué)中廣泛使用的牛津命名法將復(fù)雜 N-糖鏈編碼為文本字符串G0F Core-fucosylated, biantennary, no galactose G1F Core-fucosylated, one galactose G2F Core-fucosylated, two galactoses G2FS1 Core-fucosylated, two galactoses, one sialic acid G2FS2 Core-fucosylated, two galactoses, two sialic acids M5 High mannose 5 (Man5GlcNAc2) M9 High mannose 9 (Man9GlcNAc2)以及出版級插圖的SNFG 符號命名法藍圓葡萄糖、綠圓甘露糖、黃圓半乳糖、藍方N-乙酰氨基葡萄糖、黃方N-乙酰半乳糖胺、紫菱N-乙酰神經(jīng)氨酸唾液酸、紅三角巖藻糖。質(zhì)譜糖蛋白組學(xué)工具如需實驗驗證glycan_databases.md 推薦Byonic基于 MS2 譜圖的 de novo 糖肽鑒定位點特異性糖型歸屬、Mascot糖鏈特異搜索參數(shù)bottom-up 糖蛋白組學(xué)常用、Skyline糖肽靶向定量。批量糖基化分析示例將 N-糖基化掃描與 O-糖基化熱點預(yù)測組合可對多個蛋白批量生成糖基化景觀glycosylation landscape總覽。此示例來自配套參考文檔 glycan_databases.mdfrom glycoengineering_tools import find_n_glycosylation_sequons, predict_o_glycosylation_hotspots import pandas as pd def analyze_glycosylation_landscape(sequences_dict: dict) - pd.DataFrame: Batch analysis of glycosylation for multiple proteins. Args: sequences_dict: {protein_name: sequence} Returns: DataFrame with glycosylation summary per protein results [] for name, seq in sequences_dict.items(): n_sites find_n_glycosylation_sequons(seq) o_sites predict_o_glycosylation_hotspots(seq) results.append({ protein: name, length: len(seq), n_glycosites: len(n_sites), o_glyco_hotspots: len(o_sites), n_glyco_density: len(n_sites) / len(seq) * 100, n_glyco_positions: [s[position] for s in n_sites] }) return pd.DataFrame(results)輸出包含每蛋白的 N-糖基化位點數(shù)、O-糖基化熱點數(shù)、N-糖密度位點數(shù)/長度 × 100與具體位點位置列表適合做生物類似藥或候選抗體序列的初步篩選與橫向?qū)Ρ?。最佳實踐清單綜合 SKILL.md 與配套參考文檔糖基化工程項目的推薦流程為先用 NetNGlyc / NetOGlyc 做計算預(yù)測再做實驗驗證——快速基線可用本技能的啟發(fā)式函數(shù)高精度結(jié)論依賴神經(jīng)網(wǎng)絡(luò)服務(wù)器用質(zhì)譜驗證采用糖蛋白組學(xué)方法Byonic、Mascot進行位點特異性糖型譜分析考慮位點上下文并非所有預(yù)測出的 sequon 都實際發(fā)生糖基化受可及性、細胞類型、蛋白構(gòu)象影響抗體項目優(yōu)先表征 Fc N297 糖鏈這是決定效應(yīng)功能的關(guān)健位點務(wù)必最先分析先用 GlyConnect 查目標蛋白是否已有實驗驗證的糖基化數(shù)據(jù)避免重復(fù)勞動注意閾值語義NetNGlyc/NetOGlyc 的逐殘基概率閾值約 0.5glycan_databases.md解讀輸出時以此為準。與本倉庫技能的集成方式本技能遵循倉庫統(tǒng)一的 Agent Skills 規(guī)范README.md 說明每個SKILL.md含 YAML frontmattername、description、license、metadata.version倉庫的skills/目錄下每個子目錄對應(yīng)一個技能。安裝方式包括標準安裝器npx skills add K-Dense-AI/scientific-agent-skills適用于 Claude Code、Codex、Gemini CLI、Cursor 等支持 Agent Skills 標準的宿主單技能安裝gh skill install K-Dense-AI/scientific-agent-skills glycoengineering。技能運行所需的 Python 依賴glycoshield、pandas、requests已登記在 tests/skill-requirements.toml 的[skills.glycoengineering]條目下安裝時可參考該清單準備環(huán)境。倉庫的測試契約tests/_contract會對所有帶scripts/的技能執(zhí)行--help行為與腳本一致性檢查本技能以文檔內(nèi)嵌代碼 參考文檔的形式提供分析能力腳本依賴較輕屬于零門檻可直接在任意 Python 環(huán)境運行的類型。一句話總結(jié)糖基化工程 以 N-X-S/T sequon 掃描和 S/T 密度熱點預(yù)測為分析底座以定點突變N→Q 消除、定點引入為改造手段以 NetOGlyc/NetOGlyc、GlycoShield-MD、GlyConnect 等外部工具為精度補充最終服務(wù)于抗體功能優(yōu)化、疫苗免疫聚焦與治療性蛋白穩(wěn)定性設(shè)計?!久赓M下載鏈接】scientific-agent-skillsTurn any AI agent into an AI Scientist. The #1 Agent Skills library for science, used by 190,000 scientists worldwide. 165 ready-to-use validated skills plus 100 scientific databases covering biology, chemistry, medicine, and drug discovery. Compatible with Cursor, Claude Code, Codex, Pi, Antigravity, and the open Agent Skills standard.項目地址: https://gitcode.com/GitHub_Trending/cl/scientific-agent-skills創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考