ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

膜蛋白分析七库串联:从Uniprot到TMHMM的完整流程指南

膜蛋白分析七库串联:从Uniprot到TMHMM的完整流程指南 1. 为什么要凑齐这七个数据库——膜蛋白分析的完整拼图做膜蛋白研究的人大多有过这种体验好不容易把一条序列拿到手接下来却不知道该往哪儿查。翻Uniprot只有注释信息没有结构跑TMHMM只给跨膜螺旋不给分类想去PDB找结构搜半天全是同源度很低的蛋白翻来覆去绕圈子。我做了几年膜蛋白相关的生信分析最大的感受是膜蛋白本身就是一个需要“多维度互相印证”的研究对象单靠任何一个数据库都拼不出全貌。Uniprot管注释、InterPro管结构域家族、TCDB管转运分类、SURFY管表面暴露、PDB管三维结构、TMHMM管拓扑预测、OPM管膜内走向——这七个库各有侧重合在一起才是一条从“序列”到“注释”再到“结构”的完整链路。这篇文章把七个库按“注释—分类—结构—预测”四个层次拆开讲重点说清楚每个库的适用场景、实战操作步骤、参数怎么读、容易踩的坑。无论你是刚开始接触膜蛋白的新手还是已经跑过一轮数据库检索、但想把这套流程系统化的老手都可以直接照着我下面的流程走一遍。我默认你已经会基本的序列检索操作比如在NCBI做BLAST、会看fasta格式这是上手膜蛋白数据库分析的底线基础。2. 注释起点Uniprot 与 InterPro 的正确打开方式2.1 Uniprot 检索膜蛋白的实用技巧UniprotUniversal Protein Knowledgebase是绝大多数膜蛋白分析的“第一站”。它整合了Swiss-Prot人工审核注释质量高和TrEMBL自动注释覆盖面广对一个蛋白质来说Uniprot条目里的“Function”“Subcellular location”“Topological domain”“Transmembrane”这几个字段就是最直接的膜蛋白证据来源。很多新手第一次查Uniprot直接拿基因名或蛋白名搜然后挑第一个条目就开始分析这是最容易出问题的。膜蛋白往往有异构体isoform、有不同的命名体系同一个蛋白在不同物种里注释深度差别很大。更稳妥的做法是先限定物种名比如查人源的某转运蛋白就以“organism: Homo sapiens”为限定条件再看该条目是不是Swiss-Prot审核过entry status会明确标出reviewed或unreviewed。在Uniprot的高级检索Advanced Search里有几个我高频使用的检索式annotation:(type:transmembrane)直接筛出带跨膜区注释的条目keyword:Transport配合膜定位关键词锁定转运相关膜蛋白existence:Evidence at protein level只保留有蛋白水平证据的条目避免只有预测注释的序列误导后续分析拿到具体条目后重点看“Subcellular location”段落里的“Membrane”和“Multi-pass membrane protein”这类描述再对照“Topological domain”字段里的“Cytoplasmic”与“Extracellular”这两块信息直接决定了你后续跑TMHMM时怎么验证预测结果。2.2 InterPro 结构域分类的坑与用InterPro是一个集成了Pfam、PANTHER、SMART、CDD、PROSITE等多个成员数据库的聚合平台。它的核心价值不是告诉你“有哪些结构域”而是把不同数据库对一个蛋白的家族分类结果汇总去重给出一份统一的分类报告。对于膜蛋白InterPro最有用的两个信息是一这个蛋白属于哪个蛋白家族family比如“Major facilitator superfamily”这类膜转运蛋白超家族二它身上有哪几个跨膜相关的结构域签名signature比如某些GPCR家族的7次跨膜特征序列。这两条信息恰好可以和TCDB的分类结果相互印证。这里有个我反复遇到的坑InterPro的匹配结果会同时展示来自不同成员数据库的若干条记录它们的“置信度”和“覆盖范围”完全不一样。Pfam的匹配通常偏保守但很可靠某些基于短motif的PROSITE匹配则可能出现假阳性。所以不要只看“有没有匹配”要展开看每条匹配的“residue range”覆盖了序列的哪一段是否与跨膜区重合。如果多条匹配的区间互相矛盾一般优先信Pfam或CDD的结果。2.3 两者联动的典型场景我用过一个真实场景分析某个未知的膜蛋白时先在Uniprot里看到“Subcellular location: Membrane; Multi-pass membrane protein”又在InterPro里匹配到“Sugar transporter”家族的Pfam条目这时候基本可以判定它属于糖转运蛋白家族。接下来就可以跳到TCDB里按家族名搜看能不能找到对应的TC号如果TCDB里也有相同的家族归类那注释的可信度就大大提升了。Uniprot和InterPro在功能上是互补的前者是“这一条”蛋白的明细档案后者是“这一类”蛋白的家族背景。做膜蛋白项目我的习惯是永远把这两个库的结果并排看互相验证而不是只信其中一个。3. 功能特化TCDB 与 SURFY 的差异化定位3.1 TCDB 转运蛋白分类体系怎么读TCDBTransporter Classification Database是膜蛋白里最“专”的一个数据库。它不像Uniprot那样覆盖所有蛋白而是只收录转运蛋白transporter按照Saier实验室提出的Transport Classification系统把转运蛋白分成了几大类通道蛋白channels/pores、电化学势驱动转运蛋白、初级主动转运蛋白依赖ATP等能量、基团转位蛋白等等。TC号就是这套分类的“身份证”典型格式类似2.A.1.3.1这样分四层第一大类的编号表示转运机制比如2代表电化学势驱动第二个字母表示亚家族A往往代表某个超家族后面的数字再逐级细化到具体的底物特异性。我在实际项目里用TCDB的方式有两种。一种是从Uniprot条目里看“Cross-reference”部分如果这个蛋白已经被归入TCDB会有直接链接另一种是把序列在TCDB的BLAST页面里跑一遍看比对到哪个已知转运蛋白继承它的TC分类。后者对预测“全新”转运蛋白特别有用。读TC号时要特别注意分类的层级含义。比如你看到一个蛋白被归入2.A.1Major Facilitator Superfamily, MFS超家族这只说明它是“电化学势驱动的糖/药物/代谢物转运蛋白超家族”但具体转运什么底物还要看第三、第四层数字对应的家族成员。很多人只看到第一层分类就下结论说“这是某底物转运蛋白”这是明显的过度解读。3.2 SURFY 表面暴露蛋白筛选思路SURFY这个库相对冷门但在膜蛋白分析里位置很特殊。它的定位是聚焦“表面暴露蛋白”或“表面组”surfaceome分析也就是帮助判断一个蛋白的哪些区域是真正暴露在细胞外侧的。你可能会问跨膜区、胞内区、胞外区这些信息TMHMM也能给为什么还需要SURFY这里关键差异在于TMHMM给出的是“拓扑”即哪段穿膜、哪段在内外侧而SURFY更关注“暴露程度”比如胞外侧的loop里哪些残基真正伸出表面、可以成为抗体结合位点或疫苗候选表位。在做表面抗原筛选、膜蛋白胞外片段功能研究这类任务时这个维度的判断几乎是刚需。值得注意的是SURFY这类表面暴露分析通常需要额外的特征输入比如蛋白的三维结构或同源模型。如果手上只有序列可以先跑AlphaFold获取预测结构再结合SURFY做表面残基打分如果没有结构它会依赖序列特征做启发式判断此时结论的可靠性会打个折扣。3.3 什么时候该用它们TCDB和SURFY的使用场景可以划得很清楚任务目标所用数据库输出判断一个未知蛋白是否为转运蛋白、属于哪个家族TCDBTC分类号、家族归属判断蛋白表面暴露残基、筛选表位SURFY表面暴露区域评分与位置给转运蛋白补充底物特异性信息TCDB Uniprot底物类型、机制描述膜蛋白胞外片段的功能位点分析SURFY 结构库可设计抗原/抗体的残基候选这两个库都不是“必查项”但凡是涉及“这个蛋白到底转运什么”或者“这个蛋白表面哪里能用”它们就是最快给出答案的地方。4. 结构视角PDB 检索与 OPM 膜走向4.1 PDB 里找膜蛋白结构的正确姿势PDBProtein Data Bank是实验解析三维结构的大本营。膜蛋白因为难结晶、难纯化历史上在PDB里的占比一直偏低。但近几年冷冻电镜cryo-EM技术成熟之后膜蛋白结构数量有了明显增长尤其是离子通道、GPCR和转运蛋白这类热门靶点基本都有高质量结构可查。在PDB检索膜蛋白结构不要直接在首页搜蛋白名称那样容易把配体复合物、突变体、不同物种的同源结构全都混在一起数据噪音很大。我推荐的做法是先在Uniprot条目的“Structure”区域找到对应的PDB条目列表那里的对应关系是注释过、可信的。如果没有结构条目再用PDB的Advanced Search以蛋白名称加“homo sapiens”之类的物种限定再按分辨率resolution、实验方法X-ray/cryo-EM/NMR筛选。这里讲一个多数人容易忽略的点PDB里的膜蛋白结构文件坐标对应的往往是“去膜环境”下的构象——有的结构是去垢剂环境里解的有的甚至只解了部分胞外域。因此拿到PDB条目后光看pdb文件本身是不够的必须结合它的“ligand”、“modified residue”等注释信息判断这个结构是否完整、是否包含完整的跨膜区。4.2 OPM 数据库膜平面上的坐标OPMOrientations of Proteins in Membranes数据库解决的是一个PDB本身不回答的问题这个膜蛋白埋在膜里的时候是怎么摆放的具体来说OPM为每一个已解析的膜蛋白结构计算了它在脂双层中的空间取向——包括穿膜角度、插入深度、膜边界在哪一层残基附近以及这个蛋白插入膜的整体自由能transfer energyΔG。为什么这个信息重要如果你只做序列分析确实用不到OPM但你要是做分子动力学模拟、要做膜环境下的结构比对或者要判断某个残基突变后是否会影响膜插入稳定性OPM的取向参数就是必需的坐标系。没有它你可能把本应在膜内的疏水段错误地放到了水相整个模拟就是白跑。OPM的使用很直接在网站上搜索蛋白名或PDB编号它会列出该蛋白在膜中的定位参数同时提供一个调整好取向的坐标文件可以直接下载用于后续建模。我个人的建议是凡是做膜蛋白MD模拟初始构象一律用OPM处理过的坐标不要自己对着PDB原始坐标瞎摆膜。4.3 结构与拓扑预测的校准PDB和OPM还有一个妙用校正拓扑预测。比如TMHMM预测某个蛋白有6次跨膜但PDB里已有同源蛋白结构显示其实只有5次跨膜、多出来的一段是一次长疏水loop。这种矛盾出现时结构信息永远优先于预测信息——实验结构是ground truth预测工具只是参考。我在实战中的处理顺序是先跑TMHMM得到初步拓扑再去PDB/OPM找同源结构验证两者一致的拓扑才敢写进论文或用于设计后续实验。如果对不上就回到Uniprot看是不是注释覆盖不全或者预测时信号肽干扰了结果。这个“预测—结构—再预测”的循环是我认为膜蛋白分析里最值得养成的习惯。5. 预测利器TMHMM 的用法、参数与边界5.1 TMHMM 原理极简版TMHMMTransMembrane Hidden Markov Model是基于隐马尔可夫模型的跨膜螺旋预测工具也是目前α螺旋型膜蛋白拓扑预测里最常用的之一。它的输入就是一条氨基酸序列输出的是预测出的跨膜螺旋位置、残基位于膜内侧还是外侧的拓扑分配、以及每段螺旋的置信度。很多文章会用“TMHMM server 2.0”版本在线提交序列后很快就能出结果。输出部分我建议只认真看四块信息predhel预测的螺旋数、拓扑字符串一串由i/M/o组成的序列i代表inside、M代表membrane、o代表outside、每段螺旋跨过的残基范围、以及对应的概率值。拓扑字符串是解读结果的关键。比如某蛋白预测结果是iiiii...MMMMMMMMMMMMMMMM...ooooo就是说N端在胞内、跨越一次膜、C端在胞外。这种“一次跨膜”拓扑和“多次跨膜”拓扑在后续实验设计上的意义完全不同。5.2 输出解读与常见误判TMHMM最经典的误判来源有两个一是信号肽二是短的疏水片段。先说信号肽。真核生物的分泌蛋白或膜蛋白N端常常有一段信号肽它本身是疏水的TMHMM很容易把这段误判成一条跨膜螺旋导致预测结果多出一次跨膜。解决方法是在跑TMHMM之前先用SignalP把信号肽切掉再用剩余序列跑TMHMM。我在分析宿主蛋白时几乎每次都做这一步。再说短疏水片段。有些膜蛋白的跨膜螺旋很短或者在序列中存在一段疏水性较强但功能上并不穿膜的片段TMHMM也可能把它们识别进去。判断方法很简单看那一段螺旋的长度和概率。常规α螺旋跨膜区长度大约是20个残基左右如果预测片段明显短于这个长度且概率偏低比如低于0.5就要警惕是误判。5.3 和其他拓扑预测工具的关系膜蛋白拓扑预测不止TMHMM一个选择常用的还有Phobius、MEMSAT3、TOP-CONS、DeepTMHMM等等。TMHMM能流行这么多年核心优势是简单、快、结果稳定适合批量跑序列但它对β桶状膜蛋白如外膜蛋白porin完全不适用β桶的跨膜结构是反平行β折叠片不是α螺旋用TMHMM去预测外膜蛋白就是张冠李戴。如果序列比对结果显示目标蛋白属于β桶外膜蛋白家族应该改用BOCTOPUS或者PRED-TMBB这类专门工具。我之前处理过一个从宏基因组里注释出来的疑似孔蛋白用TMHMM预测出来“没有跨膜螺旋”一度以为它是个分泌蛋白后来用PRED-TMBB一跑发现是典型的β桶这个教训记忆非常深。另外DeepTMHMM基于深度学习的新版本在处理信号肽和跨膜区重叠问题上比2.0版好一些如果预算和算力允许可以两个版本都跑一遍对比。6. 一体串联从一条序列到膜蛋白全景画像的实操流程6.1 完整流程速览前面四个部分分别介绍了七个库的用法但实际做项目时它们不是孤立的。下面就是我日常用的完整流程从一条未知序列开始得到一张“膜蛋白全景画像”输入序列在Uniprot检索/比对获得基础注释和跨膜区标注用SignalP处理信号肽再用TMHMM跑拓扑预测把序列提交InterPro获得结构域和家族分类如果是疑似转运蛋白用TCDB进一步分类定家族用PDB查询是否存在实验结构或同源结构若有结构用OPM获取膜内取向参数结合SURFY做表面暴露分析输出可用于表位筛选的候选区域这七步做完你就同时拥有了这个蛋白的“身份信息”Uniprot、“家谱信息”InterPro/TCDB、“结构信息”PDB/OPM和“功能位点信息”TMHMM/SURFY。6.2 每一步干什么、为什么这么干第一步在Uniprot里做的是“建档”。就算序列没有完美匹配Uniprot的BLAST也能帮你找到同源蛋白间接获得功能线索。第二步做“形状刻画”。拓扑预测告诉你的不只是跨膜次数的数字更关键的是起始端在膜内还是膜外——这决定了后续做表达载体设计、标签位置选择时的策略。第三步做“身份确认”。InterPro的家庭分类往往直接对应某个功能类别比如“ABC transporter”家族、某个激酶家族。这一步能快速把你从“这个蛋白是什么”拉到“这个蛋白大概是干什么的”这一层级。第四步做“功能深挖”。如果InterPro提示它是转运蛋白TCDB会把分类细化到具体的转运机制和底物类别这是InterPro给不了的信息深度。第五和第六步做“空间定位”。先去PDB找结构有结构就立刻去OPM拿膜内的摆放坐标。这两步是判断“胞外区/胞内区哪个loop可以做实验”的最可靠依据。第七步做“靶点挖掘”。SURFY给出表面暴露残基如果你要设计抗体制剂、疫苗多肽或者做细胞表面标记这一步是实际产出最直接的一环。6.3 一个具体例子走一遍用一条假设的未知人源序列举例先跑Uniprot BLAST比对到一个人源溶质转运蛋白Uniprot注释显示它是“multipass membrane protein”。再用SignalP发现N端无信号肽TMHMM预测出12次跨膜螺旋N端和C端都在胞内这个结果和同家族蛋白的已知拓扑吻合。随后InterPro匹配到“Major facilitator superfamily”的Pfam条码TCDB里找到同一家族TC号归为2.A.1大类下的某成员。PDB检索该家族找到几个同源蛋白的冷冻电镜结构其中分辨率最高的一条已经在OPM里收录——OPM给出的膜插入自由能ΔG为负值说明这个蛋白插入膜的过程是热力学有利的。最后用SURFY分析胞外侧暴露loop选出一个高暴露片段作为后续免疫实验的候选表位。整个流程走下来一条孤零零的序列就变成了一张带注释、带分类、带结构参照、带候选位点的完整画像。这比单查任何一个库得到的结论都扎实得多。7. 常见问题与排查技巧实录7.1 高频问题速查表现象可能原因排查与解法TMHMM预测螺旋数远超预期信号肽干扰先用SignalP切除信号肽再重跑InterPro完全无匹配序列太新或属于未收录家族试HMMER搜索、扩大同源范围后再试PDB搜不到目标结构该蛋白或近缘物种无实验结构去AlphaFold数据库取预测结构或做同源建模TCDB搜不到转运分类不是典型转运蛋白或依赖BLAST继承用序列BLAST遍历TCDB库OPM搜不到某蛋白结构未被收录或并非标准膜蛋白用PPM在线服务器自行计算膜取向SURFY输出不稳定缺少三维结构输入先建模型或取AlphaFold结构再做表面分析Uniprot条目是unreviewed该蛋白注释未被人工审核提高证据阈值找reviewed同源条目做参考7.2 我踩过的坑与补救方法先说一个最让我印象深刻的坑当年分析一个细菌外膜蛋白用TMHMM跑出来“0跨膜螺旋”我一度以为序列拿去错了或者输入出了bug。后来才意识到自己犯的是工具选型错误——β桶外膜蛋白必须用专门的预测器。这个教训让我明白了工具使用前必须先判断蛋白的类型序列亲疏水性、家族归属都会直接影响预测策略。现在我的习惯是任何序列在跑TMHMM之前先看一眼它在Uniprot/InterPro的家族归属心里对它是α螺旋还是β桶有个预判再去选预测工具。第二个坑是PDB检索时忽略了“结构域结构”和“全长结构”的区别。有些PDB条目只包含某一个胞外结构域并不覆盖跨膜区。我曾经拿一个只有胞外域的晶体结构当成了全长结构来设计跨膜区突变结果实验设计偏差很大。现在检索PDB时我会专门看链的长度与序列覆盖度判断它是否是完整结构。第三个坑是OPM坐标的“适用条件”。OPM给出的膜取向是基于某个特定脂环境计算的不同脂质组成下膜蛋白的插入角度可能会有数度的差别。如果是做精细的MD模拟建议用OPM坐标做初始定位但在平衡阶段要允许蛋白在膜内自由调整不要死锁初始姿态。7.3 批量分析的效率建议如果你要处理的不止一条序列而是几十上百条候选膜蛋白我再推荐一套组合策略批量用TMHMM跑拓扑这一步非常快把结果按螺旋数分组每组抽样用InterPro分类再挑代表性成员去PDB/OPM做结构验证。不要每条序列都全七库走一遍那样的时间成本太高而且很多冗余。批量跑TMHMM时我习惯保留原始拓扑字符串方便后续和TCDB分类结果做关联分析。比如批量比较同一TC家族成员的拓扑一致性如果家族内多数成员是12次跨膜只有个别成员预测是10次一般优先怀疑那个个别成员的序列质量或注释拼接有问题。8. 写在最后我的几条习惯建议把七库串起来跑通之后我最大的体会是膜蛋白分析没有银弹靠的是交叉验证。Uniprot的注释再漂亮也要用InterPro和TCDB从家族层面复核TMHMM的预测再流畅也要回到PDB/OPM看有没有结构证据支持而所有这些序列水平的分析最终都要落到SURFY这类功能位点分析上才能真正对实验设计产生价值。如果只让我选两个最重要的使用习惯第一个是永远先判断蛋白类型再选预测工具第二个是永远用OPM做膜内坐标而不是自己摆膜。这两个点分别护住了“序列分析的边界”和“结构分析的基座”在实战中帮我校正了绝大多数返工问题。最后再分享一个小技巧在做完一轮七库分析后把每一步的关键结论整理成一张记录表包括序列ID、螺旋数、家族分类、TC号、PDB条目、OPM膜取向参数、表面暴露候选区段。这张表就是你后续写文章、做实验设计、跟合作者沟通的统一语言能省掉无数翻历史记录的精力。这套流程我用了很多年期间数据库本身也在不断更新但“注释—分类—结构—预测”四层互证的思路始终没变。你现在拿着这套方法从一条序列出发已经足够把膜蛋白的全貌理清楚了。接下来要做的就是带上自己的数据去实战跑一轮遇到具体问题再回头翻这篇对应章节就行。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进