一个融合蛋白点亮了肿瘤的暗蛋白质组:Ewing肉瘤的隐秘翻译图谱
本文由WorkBuddy Agent撰写并直接通过WordPress API发布于笔者个人网站www.liangxiao.pro。内容可能存在不准确之处,仅供研究参考。
过去十年里,蛋白质组的边界被反复向外推。核糖体测序显示基因组中的翻译区域远多于注释的编码序列——这些区域如今有了统一称谓,叫做 translon[5]——而它们的产物中有相当一部分并不出现在常规可溶性蛋白池里,反倒更容易出现在 HLA-I 呈递的肽段池中[7]。2026 年初,一项跨实验室协作把人类微蛋白与 peptidein 的目录系统性地扩了一遍[4],为这场”暗蛋白质组”清点提供了参考坐标系[4];至于这些产物究竟更像抗原来源还是新型功能蛋白,近年已有专门的综述讨论[8]。但这些产物在肿瘤里如何被激活、是否真能构成肿瘤特异的抗原库,一直缺少一个能同时回答机制与呈递的实验体系。Ewing 肉瘤提供了一次难得的自然实验:几乎全部病例都由同一个嵌合转录因子驱动,其中 EWSR1::FLI1 约占八成五。最近由荷兰 Princess Máxima 儿童肿瘤中心、法国 Institut Curie 与德国 DKFZ 联合贴在 bioRxiv 上的工作,正是把这个单一驱动当成把手,去撬动整块暗蛋白质组[1]。
研究的规模在同类工作中少见。作者整合 133 例患者肿瘤的短读长转录组、四个细胞系与一个融合工程化间充质干细胞的 Nanopore 直接 RNA 测序与 PacBio HiFi 长读长数据重建参考转录组,再对 48 例患者肿瘤做深度核糖体测序,累计超过 40 亿条核糖体保护片段,并称其为迄今最深的癌症翻译组;其中 47 例匹配了全局蛋白质组,此前发表的细胞系与 PDX 的 HLA-I 免疫肽组也被并了进来。特异性过滤做得相当克制:候选转录本须同时满足融合敲低后下调、靠近 GGAA 微卫星,且在 GTEx 一万七千余例正常组织、TCGA 一万两千余例 EF1 阴性肿瘤、儿科肿瘤队列与发育图谱中均不表达。最终清单是 124 个基因间 neogenes(同一团队此前只报告过 26 个[2])与嵌入 252 个已知编码基因中的 2,244 个 neoisoforms。
有意思的是这些转录本的来源。EWSR1::FLI1 获得了对 GGAA 微卫星的异常亲和力,而这种序列并不在经典 ETS 因子的结合谱内,融合蛋白因此在全基因组范围内打开染色质,把沉默区域变成启动子。作者把由此产生的三类事件拆得很清楚:其一是基因间区域的整套新基因;其二发生在已知基因内部,融合结合在基因内诱导出新的转录起始位点,产生截短或移码的亚型,减数分裂受限的 KASH5 就是典型,其 3′ 端被异常激活后给出 54 与 119 个氨基酸的两个翻译区,都丢掉了经典 KASH5 的卷曲螺旋与 EF-hand 结构域,DeepLoc 预测其中一个因丢失信号肽而转向内质网或分泌途径,等于用一种此前未描述过的机制重新激活了一枚癌睾抗原;其三最出人意料,是核糖体对 poly(A) 尾的通读。
| 路线 | 基因组机制 | 代表例子 | 关键证据 |
|---|---|---|---|
| 基因间 neogenes(124 个位点) | 融合结合 GGAA 微卫星,打开沉默染色质,产生全新转录本 | 灵长类中新近起源的短 ORF | 364 个 translon;13 个新蛋白有肽段证据,11 个呈递于 HLA-I |
| 基因内 TSS 与 neoexon(252 个基因内 2,244 个亚型) | 已知基因内部出现新起始位点或新外显子,产生截短、移码产物 | KASH5 3′ 端再激活(54 aa 与 119 aa),丢失 EF-hand 与卷曲螺旋 | 254 个 translon(210 框内、44 移码);16 个新蛋白有肽段证据,4 个呈递于 HLA-I |
| poly(A) 通读 | 无终止密码子的 3′ UTR ORF 被读进多聚 A 尾,非终止衰变未能清除 | TRPM4-dORF(80 aa),患者中最丰富的肿瘤特异微蛋白 | 5 条特异肽段、47 例肿瘤中 27 例检出、约 1,500 条 poly(A) 核糖体足迹 |

TRPM4 的这条下游 ORF 是全文最扎实的发现。它位于 TRPM4 经典转录本的 3′ UTR,紧邻一个 FLI1 结合的 GGAA 重复,长 80 个密码子,翻译终止位点落在所有转录本模型与 GENCODE 注释之外——换言之这个 ORF 没有终止密码子,核糖体会一路读进 poly(A) 尾,本应触发的非终止衰变显然没有把它清除干净。证据链是完整的:患者队列中约一千五百条带多聚 A 尾的核糖体足迹读数、在三个蛋白质组数据集里反复出现的五条特异肽段、47 例肿瘤中 27 例的胰酶肽段检出、非 EwS 模型中的彻底缺席;在患者样本中它的翻译水平比 TRPM4 主 CDS 还高约 1.5 倍,而在 BodyMap 与 RiboCrypt 覆盖的近四千个非 EwS 核糖体测序数据集中基本为零(胚胎干细胞中有 0.1–1 PPM 量级的背景,比 EwS 低约两个数量级)。通读本身也不是孤例:EwS 队列中有 670 个基因检出 poly(A) 足迹,读数总量多出一倍的正常组织参考里只有 83 个基因,且富集发生在携带 neoisoform 的基因上。作者对此措辞谨慎,只说这提示融合驱动的转录重排可能改变了翻译保真度——EWSR1::FLI1 已知调控可变剪接与 mRNA 衰变,究竟是 RNA 加工层面的失控还是 3′ UTR 架构改变,目前无从判断。

从质谱的角度看,这篇文章最值得记下的是检测层级的不对称。作者把四套数据集——细胞系面板、A-673 深挖多酶切数据、47 例患者肿瘤全局蛋白组,以及细胞系与 PDX 的 HLA-I 免疫肽组——统一搜索自建的 translon 数据库,共检出 911 个有肽段证据的 nc-translon,其中 765 个来自免疫肽组,仅 155 个出现在全局蛋白组,两者共同检出的只有 9 个。原因不难理解:neogene 翻译区中位只产生 5 条胰酶肽段,典型蛋白是 60 条,短 ORF 在胰酶路线上的覆盖几乎靠运气;反过来每个 neogene translon 中位对应 15 条预测强结合肽,免疫肽组有足够的取样面。作者进一步把新蛋白 C 端疏水性升高、结构无序与在全局蛋白组中难以检出这几件事,与 DRiPs 模型[6]联系起来,认为快速周转反而保证了 HLA-I 通路持续得到抗原供应。这个解释有吸引力,但必须说清楚它仍是推论,文中并没有直接测定降解速率;而且”911 个隐秘蛋白”里绝大多数并非 EwS 特异——它们来自一个 24,478 个通用 nc-translon 的池子——真正属于 EwS 的新蛋白是 29 个(13 个来自 neogene、16 个来自 neoisoform),其中呈递在 HLA-I 上的 15 个(11 与 4)。读者需要从标题往下走一档。

转化层面的证据同样需要分级。19 个候选新蛋白做了瞬转过表达,只有 8 个能被流式稳定检出,免疫荧光又独立确认了其中几个的定位与 DeepLoc 预测一致(Ew_NG3 与 Ew_NG5 在核内,TRPM4-dORF 在胞质,KASH5 的截短产物在内质网),内源 CRISPR 敲入标签的 Ew_NG157 也在核内稳定表达。但功能上是一片空白:五个稳定表达的新蛋白过表达不增强增殖,七个 neogene 的 siRNA 敲低、Ew_NG48 的 CRISPRi 与 shRNA 都没有可测表型,作者自己的判断是它们更像融合蛋白在转录枢纽里随意结合的乘客产物。免疫治疗相关的证据要乐观一些:TNS1 移码亚型衍生的一条 HLA-I 肽用合成肽完成了谱图验证(另有两个谱图同样得到验证),五个细胞系与五个 PDX 模型各自至少呈递一条 nc-translon 编码的肽,据此外推的人群 HLA 覆盖则是纯计算推断;真正把杀伤落到实处的,是同一批作者此前公布的 TCR-T 工作——靶向公共 neogene 编码抗原可特异性杀死 Ewing 肉瘤细胞[3]。也就是说,可成药性目前停在可检测性与体外及异种移植杀伤这一层,离临床还有相当距离。
进化分析给这项工作加了一个有意思的注脚。364 个 neogene translon 里有 219 个起源于灵长类或更晚,44 个移码 translon 中有 14 个如此,而长度匹配的非翻译对照序列在序列特征与起源时间上并无差别——被激活的是中性演化中随机获得翻译能力的序列,融合蛋白只是碰巧触碰了它们。同时只有约三分之一的新蛋白序列能在小鼠基因组中找到对应,这既解释了为什么啮齿类模型在 EwS 上历来表现不佳,也意味着后续的功能与安全性验证只能依托患者来源模型。
把这几层放在一起看,这篇预印本的价值不在于又发现了多少新蛋白,而在于把一个因果链钉死了:一个融合蛋白足以在转录与翻译两层同时重写细胞的产物清单,其中一部分产物会进入 HLA-I。对 Ewing 肉瘤这类突变负荷极低的儿童肿瘤而言,这条路径格外实在——个体化新抗原路线在几乎无突变的肿瘤中无从下手,而由驱动性融合统一激活的暗抗原天然是共享的,这正是现货型 TCR-T 与共享抗原疫苗得以成立的前提。从这篇工作到真正的疫苗,中间还隔着免疫原性与安全性的临床验证,以及一个尚未回答的问题:这些蛋白质对肿瘤本身到底有没有用。
参考文献
- Broeils LA, Pilet J, Koshkina MK, et al. Oncogenic fusions induce an extensive cancer-restricted cryptic proteome in Ewing sarcoma. bioRxiv 2026. doi: 10.64898/2026.09.16.751792
- Vibert J, Saulnier O, Collin C, et al. Oncogenic chimeric transcription factors drive tumor-specific transcription, processing, and translation of silent genomic regions. Mol Cell 2022;82:2458-2471.e9. doi: 10.1016/j.molcel.2022.04.019
- Lalanne AI, Collin C, Petit F, et al. Specific killing of Ewing sarcoma by TCR-T cells targeting public neogene-encoded antigens. bioRxiv 2026. doi: 10.64898/2026.06.20.733160
- Deutsch EW, Kok LW, Mudge JM, et al. Expanding the human proteome with microproteins and peptideins. Nature 2026. doi: 10.1038/s41586-026-10459-x
- Świrski MI, Tierney JAS, Albà MM, et al. Translon: a single term for translated regions. Nat Methods 2025;22:2002-2006. doi: 10.1038/s41592-025-02810-3
- Yewdell JW, Antón LC, Bennink JR. Defective ribosomal products (DRiPs): a major source of antigenic peptides for MHC class I molecules? J Immunol 1996;157:1823-1826. doi: 10.4049/jimmunol.157.5.1823
- Cuevas MVR, Hardy M-P, Hollý J, et al. Most non-canonical proteins uniquely populate the proteome or immunopeptidome. Cell Rep 2021;34:108815. doi: 10.1016/j.celrep.2021.108815
- Bawden EG, Amigorena S, Arribas YA. Decoding the Cryptic Proteome Between Antigens and Novel Functional Proteins. Eur J Immunol 2025;55:e70102. doi: 10.1002/eji.70102
内容经AI校正和润色,审慎阅读