ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

UPR通路泛癌解析:多组学揭示未折叠蛋白响应与肿瘤进展关联

UPR通路泛癌解析:多组学揭示未折叠蛋白响应与肿瘤进展关联 未折叠蛋白响应UPR是我这两年做泛癌数据时最常被“打脸”的通路之一。教科书上它是内质网里的“质检员”负责把错误折叠蛋白修好或清掉可一到肿瘤里它就像一张双面牌一边保护癌细胞扛住恶劣微环境一边又在极端压力下推细胞走向凋亡。到底哪个方向占上风、跟肿瘤进展什么关系一直是悬案。海南大学的盛夏课题组做了一项泛癌尺度的系统解析把UPR活性拿到三十多种癌型里统一度量再与肿瘤分级、突变负荷、免疫浸润和干性特征逐一对表给出了一个层次非常完整的答案。这篇博文我想从项目本身出发把这项研究的底层逻辑、技术路线、核心发现以及我个人复现同类分析时踩过的坑完整拆一遍。先说清楚这篇内容适合谁看。如果你正在做通路活性类的泛癌分析或者准备用TCGA/ICGC这类公开数据构建分子分型想搞明白“一个通路如何影响肿瘤进展”这类问题到底该怎么下手这篇文章值得看完。如果你只是好奇UPR是什么、为什么研究团队要把它做成“泛癌”我也会用尽量白的语言把原理讲透不堆黑话。1. 从一条“细胞自救通路”到一张泛癌全景图项目要回答什么问题1.1 为什么UPR是肿瘤研究里绕不开的主角未折叠蛋白响应Unfolded Protein ResponseUPR本质上是内质网压力下的三条信号通路联动。当细胞内错误折叠蛋白积累到一定程度三个传感器——PERK、IRE1α和ATF6——会被激活各自往下游传递信号。PERK通路通过磷酸化eIF2α抑制全局翻译减少新蛋白合成同时激活ATF4转录程序IRE1α通过剪切XBP1 mRNA产生有活性的转录因子XBP1s上调内质网分子伴侣和脂质合成相关基因ATF6则转移至高尔基体被剪切后激活ERAD相关基因加速降解错误蛋白。你可以把UPR想象成工厂里的“应急指挥中心”生产线上废品变多了指挥中心先下令减速生产线PERK再让人手去修理废品IRE1α/XBP1最后紧急调度垃圾清运车把修不好的废品拖走ATF6。这套机制在正常细胞里是短时应急的压力解除就关闭。但肿瘤细胞不一样它们长期处于缺氧、营养匮乏、酸中毒和氧化应激状态内质网里永远有修不完的蛋白。于是UPR从“应急模式”变成了“常开模式”癌细胞逐渐依赖UPR来维持蛋白稳态和存活。这就是所谓的“非致癌性成瘾non-oncogene addiction”——癌细胞并没有突变UPR通路本身而是依赖这条通路的高活性来生存。这个特性让UPR成为非常有潜力的治疗靶点但问题是UPR在三通路的相对强度上差异极大有时候PERK分支占主导有时候IRE1α分支更活跃不同癌种里主导分支甚至可能相反。若是把UPR当作一个整体去看容易得出互相矛盾的结果。这也是当前文献里UPR与肿瘤预后关联众说纷纭的根源结论吵架往往不是数据错了而是“UPR”这个定义本身就太宽泛。1.2 泛癌视角为什么重要大多数靶向UPR的研究集中在单一癌种比如胰腺癌、乳腺癌或多发性骨髓瘤。单癌种研究能挖得很深但得到的结论很难迁移。举个例子在一种癌里UPR高活性与不良预后相关换一个癌种可能完全反转。这种差异可能来自肿瘤起源组织本身对蛋白分泌压力的耐受度不同也可能来自微环境里免疫细胞构成的差异。如果视线钉在一个癌种上你会误以为UPR有“固定的”临床意义但真相可能是“因癌而异”。泛癌分析解决的就是这个问题。它把三四十种癌症拉到同一把尺子下量一遍先看普遍规律再看组织特异性的偏差。这种分析做得好的话能回答几个单癌种回答不了的问题UPR高活性到底是多数实体瘤的共同特征还是只在特定癌型里显著UPR的哪条分支与肿瘤分级、转移的关系最强UPR活性和免疫细胞浸润之间的关联是免疫“热肿瘤”更依赖UPR还是“冷肿瘤”更依赖海南大学的这个项目出发点本质上就是这些问号。该团队没有把UPR当成一个简单的“高风险基因集”去套预后模型而是把激活状态拆成三个功能分支再用多组学数据交叉验证最后落回到肿瘤进展的临床指标上。这种“机制先行、验证兜底”的思路比一上来就堆预后模型的做法稳妥得多。2. 数据从哪里来怎么看本次分析的技术栈与数据策略2.1 多组学数据整合单一数据源做不了这件事要做泛癌UPR分析第一步就是选数据。这个研究走的是公开多组学路线主阵地是TCGAThe Cancer Genome Atlas泛癌数据覆盖三十多种癌型。TCGA的好处是每个样本都同时有转录组、甲基化、拷贝数变异、体细胞突变和临床注释而且样本量、批次控制都经历过严格质控。对UPR这种需要“多角度互证”的通路转录组打分只是起点还需要蛋白层面、DNA层面和单细胞层面的数据来交叉验证。具体来说本研究的验证链条大概是这样设计的先用TCGA转录组做全癌种UPR活性打分得到UPR高/低的初步分层再用蛋白组学数据比如CPTAC里的磷酸化蛋白组或反相蛋白阵列RPPA看关键标志物如p-eIF2α、XBP1s在蛋白层面的趋势是否吻合接着用单细胞转录组数据主要来自公共数据库如GEO、HCA或其自有数据确认信号来自恶性细胞还是微环境细胞最后回到临床表型分期、分级、生存看差异是否有实际意义。这种“多组学交叉验证”的思路很值得学习。很多人做泛癌分析时只盯着表达矩阵算完ssGSEA分数就急着跑Cox回归结果遇到芯片批次效应、基因覆盖不全、或者干扰细胞类型占比变化等问题时完全没有排查手段。而加入了蛋白组和单细胞层面的验证之后至少能区分“转录层面的UPR升高”到底是肿瘤细胞真实上调了通路还是只是微环境里免疫细胞比例变化带来的“假阳性”。2.2 UPR活性如何量化直接决定结论质量的第一步这是整个项目里最容易被低估的环节。UPR不是单基因而是一组动态联动过程。早期研究爱用几个标志基因如HSPA5/BiP、DDIT3/CHOP、XBP1的表达量均值为代表但这种方法有两个明显缺陷一是标志基因的选择主观性很强换个标志基因结论可能就变了二是它完全看不出来“三条分支谁主导”这个关键结构。目前主流的方法是基因集打分代表性工具有ssGSEA单样本基因集富集分析、GSVA、singscore、AUCell等。它们的共同思路是给定一组代表该通路的基因计算该通路在单个样本中的综合活性分数而不是看某一个基因的表达量。实际操作里我见过很多人用GSVA去打分但GSVA在不同数据集之间的绝对分数可比性较差泛癌跨数据集比较时容易出偏差ssGSEA在泛癌分析里应用更广因为它对基因数量的敏感性更低、更适合跨平台数据。团队在做UPR打分时没有只挑一组“总UPR基因集”而是把UPR拆成了三个功能性分支基因集PERK/eIF2α/ATF4轴、IRE1α/XBP1s轴、ATF6轴。每个分支单独打分再综合出UPR总活性。拆开打分有个明显的好处可以观察到在特定癌种里UPR总活性可能变化不显著但某一条分支明显上调。如果只看总量这个信号就被稀释掉了。我自己的经验也是这样——只报告“UPR活性高低”而不拆分支等于把篮球比赛简化成“谁得分多”完全丢了比赛节奏和打法信息。2.3 肿瘤进展的表型怎么刻画不止是“好坏预后”UPR打分完成之后下一步是建立“UPR活性-肿瘤进展”的关联。肿瘤进展不是一个单一维度团队的做法是把进展拆成多个可量化表型病理学层面看TNM分期和分级分子层面看肿瘤突变负荷TMB和拷贝数变异免疫层面看免疫浸润丰度、细胞毒活性和免疫检查点表达干细胞层面看干性指数mRNAsi。一套做下来UPR就不再只是一个“预后基因标签”而是和肿瘤行为的各个侧面形成了关联网络。这里要特别说一下干性指数。肿瘤干细胞样细胞被认为是最难被药物清除的种群而最近几年有多篇重要文献明确指出UPR与肿瘤干细胞维持密切相关。比如PERK-ATF4轴可诱导癌细胞向高间质/干细胞样状态转化。团队把干性指数纳入分析的聪明之处在于它提供了一个“功能视角”——即便UPR活性与分期和生存没有直接线性关系只要它与干性指数强相关也足以说明该通路正在为肿瘤的“耐药蓄水池”添水。分析这类关联时还有一个可选方向就是代谢重编程打分因为UPR的ATF6分支会直接调控脂质合成脂代谢又与肿瘤膜完整性密切相关。把这些表型合并起来看UPR的“全貌”才开始真正浮现。3. 团队最核心的发现UPR活性与肿瘤进展的关联网络3.1 UPR高活性的肿瘤亚型长什么样基于上述打分系统研究团队把泛癌样本分为UPR高活性组和低活性组然后系统比较了两组间的分子与临床特征。最直观的发现是UPR高活性组在多种癌型里表现出更高的组织学分级和更晚的分期。也就是说肿瘤越“恶劣”UPR的灯往往亮得越猛。但这并不是一个绝对规律——在某些癌型里UPR高活性反而集中在早期说明UPR激活的时机可能存在癌种特异性的“窗口效应”。更值得关注的是UPR高活性组里不仅三个分支的转录本上调连带着内质网分子伴侣、ERAD组分和脂质代谢相关的基因也同步上调。这提示该高活性状态不是单纯“应激失控”而更像是一整套蛋白稳态调节程序被肿瘤主动锁定。换句话说肿瘤细胞不只是在硬扛压力它已经把“抗压程序”整合进了自己的生存策略。团队还观察到UPR高活性的肿瘤亚型往往伴随间质成分增加间质评分和上皮-间质转化EMT相关特征在高活性组显著富集。这个发现很有故事性UPR可能不只是被动应对压力还在主动改变肿瘤细胞的分化状态让细胞变得更具“侵袭性”。3.2 与免疫微环境的交互既是“护盾”也是“信号”泛癌UPR分析里最吸引人的部分当属UPR与免疫微环境的关系。团队的结果显示UPR高活性组通常伴随更低的抗肿瘤免疫浸润水平尤其是CD8阳性T细胞和自然杀伤细胞的丰度显著降低而调节性T细胞、肿瘤相关巨噬细胞等免疫抑制性种群则相对富集。这暗示了一个可能机制UPR激活可促进肿瘤细胞分泌免疫抑制因子同时通过下调表面抗原提呈相关分子来“隐去身份”从而躲过免疫攻击。更有意思的是UPR与免疫检查点分子的关系。在部分癌型中UPR高活性组与PD-L1CD274高表达显著相关。这条线索把UPR和“免疫检查点抑制治疗耐药”联系了起来肿瘤细胞使用UPR来维持存活又通过上调PD-L1等分子抑制T细胞攻击。两个机制叠加形成一道复合盾牌。这样的发现对临床有直接参考价值——如果未来的确要通过药物靶向UPR那就要考虑与PD-1/PD-L1抑制剂联用而不是单兵作战。需要提醒的是这类关联分析看到的只是共变关系。要证明“UPR高是通过某个具体的配体-受体轴来抑制免疫”还需要细胞共培养、条件性敲除等实验。但泛癌分析的作用在于它能从几十万个数据点里画出一条最值得验证的因果候选路径告诉实验团队“往哪打靶”这远比漫无目的的筛选高效。3.3 驱动基因突变与UPR活性的耦合最后一块拼图是UPR活性与肿瘤驱动突变的关系。团队分析了TCGA的体细胞突变数据发现UPR高活性组的肿瘤突变负荷TMB整体偏高且某些已知驱动基因突变与UPR活性显著共存。比如在特定癌型里TP53突变样本的UPR活性明显高于野生型样本。这个耦合背后是有逻辑的TP53突变会让细胞逃逸凋亡被压垮的内质网压力没法通过p53介导的凋亡来“清算”细胞只能长期维持UPR来续命。类似地KRAS、EGFR等癌基因突变也会驱动异常蛋白质合成进一步加重内质网负担。肿瘤细胞相当于“一边踩油门一边开风扇散热”。泛癌数据把这些“司机突变”和“散热系统”之间的统计学关联展示出来为后续构建基因型-通路表型联合分层提供了线索。这一部分也能看出团队在分析上的克制。他们没有给每个突变和UPR的关系套上“因果关系”的帽子而是用“共变”“共存”“显著关联”这类限定词。这个态度是对的——泛癌数据分析真正能提供的是“候选假说”不是“因果判决书”。实验验证的事应该留给湿实验室。4. 这套分析里的方法学亮点与可复现性陷阱4.1 评分构建别小看基因集的选择UPR打分系统的质量很大程度上取决于基因集的质量。目前公开的通路数据库如Hallmark、KEGG、Reactome里都有“UPR相关通路”但直接用会出现几个问题一是不同数据库对“UPR”边界的定义不一致Hallmark里的“Unfolded Protein Response”只有113个小鼠基因对应的人类同源基因偏重应激核心模块二是泛癌场景下基因在不同组织里基线表达差异就很大单个基因的绝对表达水平跨癌种可比性差。团队处理的思路是从文献和数据库里筛选出经过功能验证的UPR核心基因再手动合并同源关系确保三个分支都覆盖到而不是直接拉取某个数据库的整套基因。这个“人工审查数据库兜底”的基因集构建方式听起来毫不惊艳但恰恰是决定后续结论稳定性的关键动作。我在多年分析里多次遇到过换一套来源的基因集ssGSEA分数和后续生存分析的显著性直接变脸。所以如果读者打算复现这类分析第一优先级就是“把基因集固定下来”并且把基因构成、版本日期作为分析元数据写入方法部分否则半年后你自己都说不清当时用的是哪一版。4.2 共识聚类与鲁棒性验证别让你的亚型是一次性的当团队基于UPR三个分支的评分去区分亚型时用到的不是主观阈值而是共识聚类consensus clustering。共识聚类的思路是用不同的样本子集和聚类算法反复跑最后汇总出一个“共识矩阵”观察样本被稳定分到哪一组。这样做的好处是亚型的划分不是赌在某一次聚类结果上而是经过多次重采样后依然稳健的样本归属。这个策略能大幅降低“靠运气分型”的概率。我见过许多人做分型时只跑一次k-means或者层次聚类然后看一眼热图就说“我们发现了两个亚型”。这种做法的风险在于聚类的类数选择k值本身带有主观性不同的采样或特征选择都可能让样本“换组”。合理的做法是对k进行扫描比如k2到k6结合共识矩阵的CDF曲线、PAC分数、silhouette分数综合确定k值然后固定k值后再评估组间差异的生物学意义。团队在方法学上对鲁棒性验证着墨不少这值得每一位做分子分型的读者认真学一遍。4.3 时间分辨率从静态走向动态TCGA数据本质上是一张“静态快照”——每个样本只反映肿瘤被切除那一刻的分子状态。但对于UPR这种动态响应的通路静态数据只能告诉你“灯亮着”却不能告诉你“灯是刚亮还是即将熄灭”。为了弥补这个缺陷团队借助了体外分化或药物处理条件下UPR周期的时间序列转录组数据尝试将横截面信号向动态轨道映射。比如某些基因在UPR早期被诱导、后期回落单看TCGA快照会误判为“不响应”。这是泛癌分析最容易忽视的坑把所有差异都当成稳定差异。实际上UPR的很多标志基因是瞬时性表达的采样的时机可能决定了是否能检测到差异。对这类通路最理想的策略是叠加动态模型或速度分析来模拟过程变化。团队在这条路上做了尝试虽然没有做到单细胞水平的RNA velocity级别的动态重建但至少向领域内传达了一个信号——做应激通路分析不能只看静态表达还要想法子把动态维度补进来。5. 对想做同类泛癌分析的后来者我的几条实操经验5.1 数据下载与批次效应的坑泛癌分析最耗时也最劝退的环节之一就是数据准备。TCGA的数据可以通过GDC下载但要注意下载的表达矩阵有多个版本有STAR-Counts、TPM、FPKM、RPKM等多种形态。做通路活性分析时我通常建议用TPM因为它相对更适合跨样本比较且在ssGSEA打分前应该再做一次log2转换。如果你直接用FPKM或者RPKM高表达基因的方差会被放大会直接扭曲基因集富集结果。批次效应也是个大坑。TCGA本身由多个中心测序不同平台如Illumina GA、HiSeq 2000、HiSeq 2500之间表达定量的batch差异可能掩盖真实的生物学差异。处理办法是要么使用官方推荐的统一处理后的数据版本要么明确用ComBat-seq之类的工具做批次校正。但注意校正本身也可能抹掉部分真实生物学信号所以校正前后都应该跑一遍核心结论确保结论不是“校正出来的”。5.2 通路活性打分工具的选用现在有很多UPR打分工具或通路活性推断方法可选我按自己的经验列个参照表工具/方法输入要求适用场景注意事项ssGSEA表达矩阵基因集泛癌跨样本比较最常用需对表达量做秩次变换本质是比较“基因集在尾部表达的高于整体”的程度GSVA表达矩阵基因集样本数量较少时的探索性分析对不同数据集的绝对分数可比性更差不适合直接跨项目合并singscore表达矩阵基因集简单快速适合单个通路的粗筛对基因集长度敏感基因越多分数越稳定AUCell单细胞表达矩阵单细胞数据的通路活性打分需要先建立基因排序计算量大如果做的是UPR这样的多分支通路我强烈建议先算主成分再把三个分支的分数分别映射到主成分上看它们在PCA空间里的方向是否分离。这样能比较直观地确认“三条通路是否提供独立信息”还是“只是同一个程序的不同侧面”。团队在文章里用了类似的多变量思路虽然具体方法表述各不相同但原理是共通的用数据自身结构去验证基因集的生物学结构而不是默认数据库的划分一定正确。5.3 多表型验证从关联到因果到最后一步很多人的分析就停在了“UPR与预后显著相关”这句话上。但这个结论对治疗的指导价值其实有限。高水平的泛癌分析一定要往前走一步做多表型验证。具体到UPR这个话题我建议至少从四个方面补数据蛋白层面有没有对应改变单细胞层面信号是否定位在恶性细胞免疫微环境里是否有对应的细胞组成变化体外实验或已有药物库里有没有可以对照的表型数据。逃过这些验证的“相关”才有资格被称为“候选因果”。这里提一个我自己踩过的坑。以前我分析某个通路和免疫浸润的相关性得出了一个非常显著的结果。后来加上单细胞数据一看那个信号完全来自微环境里巨噬细胞占比的变化肿瘤细胞本身根本没上调那套通路。如果我当时直接下结论整篇文章的方向都会带偏。所以当你发现UPR活性与表型强相关时先别急着高兴——多问一句这个信号是“肿瘤细胞内在的”还是“微环境细胞贡献的”。泛癌数据里这个区分往往需要通过CNV推断的恶性细胞评分如inferCNV或单细胞亚群注释来完成。最后分享一段个人操作体会做这类泛癌通路分析几年下来我最深的体会有两点。第一基因集的定义要“锁死”。同一个UPR用Hallmark版本和用Reactome版本得到的样品分层可以差出去一大截。建议在做项目的第一天就把基因集导出存档并记录来源版本后续所有讨论都基于这个固定版本不要中途频繁换基因集做对比否则你会陷入“换一个基因集出一个故事”的循环里。第二分析结论一定要在蛋白组或者单细胞层面试一次水。TCGA表达矩阵太干净了容易给人一种“通路很听话”的错觉只有等你打开单细胞图谱看到信号确实集中在恶性细胞亚群里心里那块石头才会真正落地。海南大学的研究组把UPR在泛癌层面的“作战地图”铺开了后续的机制深挖和药物联用实验必然还有很多硬仗要打。对同样想做通路类泛癌研究的人而言我建议用这篇研究当模板从基因集构建、分支打分、多组学验证到稳健分型每一步都走扎实最后产出的结论一定比单纯堆一个预后signature要耐得住检验。希望这篇拆解能帮你少踩几个我自己踩过的坑。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进