一个二倍体基因组里,可能藏着约100万个rNMP
研究人员分析了CD4+ T细胞、人胚胎干细胞(human embryonic stem cell, hESC-H9)以及HEK293T细胞,并设置野生型(wild type, WT)和RNASEH2A敲除(RNH2A-KO)背景。RNASEH2A是核糖核酸酶H2(RNase H2)的催化亚基,而RNase H2负责启动核糖核苷酸切除修复(ribonucleotide excision repair, RER),是清除DNA内嵌rNMP的主要通路。
通过RNase HII切割结合DNA片段长度模拟,研究人员估算: 一个野生型人类二倍体基因组中约存在100万个内嵌rNMP。 随后,研究人员利用ribose-seq和Ribose-Map把这些位点定位到单碱基分辨率,并将这一全基因组分布称为核基因组“ribome”(nuclear ribome)。 |
真实样本与匹配的随机分布在常染色体上的差异达到统计学显著(p<0.05),RNH2A-KO细胞中的非随机性尤其明显。于是,问题从“DNA为什么会混入rNMP”,变成了“为什么它们总在某些区域出现”。
它们不是随机掉进去的,而是扎堆在基因启动的地方
最突出的热点是GC富集区域。CpG岛(CpG island)在多类基因组注释区域中显示出最高的rNMP富集,启动子样调控元件(promoter-like signature, PLS)、5′非翻译区(5′ untranslated region, 5′ UTR)和第一外显子也明显富集。
线索进一步指向转录起始位点(transcription start site, TSS)。约 65%的CpG岛位于TSS的3 kb范围内, 而rNMP在TSS附近约1 kb内出现强富集。蛋白编码基因TSS附近的富集因子(enrichment factor, EF)最高可接近 3倍, 非编码基因最高约 1.75倍; 与之相对,转录终止位点(transcription termination site, TTS)附近没有观察到类似富集。
研究人员还定义了核糖核苷酸富集区(ribonucleotide-enriched zone, REZ):连续5个0.5 Mb区间的EF均>1.2,并且在至少80%的文库中重复出现,也就是一个共同REZ至少连续覆盖2.5 Mb。它们与CpG岛、R-loop和G-四链体(G-quadruplex, G4)区域明显共定位。更值得注意的是,即使把与CpG岛重叠的区域排除,R-loop和G4的富集仍然存在,这说明rNMP的落点可能同时受DNA序列、转录活动和局部DNA结构影响,而不是由单一因素决定。
基因越“忙”,TSS附近的rNMP越多
把rNMP图谱与RNA测序(RNA sequencing, RNA-seq)叠加后,一个规律在不同细胞类型中反复出现: TSS附近的rNMP EF随着基因表达和转录输出增加而升高, 而且最强的关联集中在TSS下游1 kb以内。相比之下,整个基因体(gene body)中的rNMP水平与转录输出之间的关系明显弱得多。
与此同时,TSS附近的rNMP富集与DNA甲基化水平总体呈负相关。换句话说,那些转录更活跃、通常甲基化程度更低的启动子区域,也往往是rNMP更容易富集的区域。
但这里尤其需要注意因果关系:这些结果并不能直接写成“rNMP促进了转录”。研究人员反而更倾向于认为,高转录位点可能首先增加了rNMP嵌入的机会,而这些rNMP随后再参与局部DNA拓扑调节。于是,一个更有意思的反馈模型浮现出来—— 转录可能塑造rNMP的分布,而rNMP的加工又可能反过来影响转录所依赖的DNA物理状态。 |
RNase H2缺失后,rG暴露出一条Top1补偿路径
为了进一步追踪rNMP如何被处理,研究人员比较了野生型和RNH2A-KO细胞。在野生型细胞的TSS附近,rC通常是富集最明显的rNMP;当RNase H2缺失后,rG明显累积,尤其集中在非模板链(non-template strand)。如果进一步降低拓扑异构酶1(topoisomerase 1, Top1),TSS附近的rNMP还会继续升高,其中 rG的增加最为突出。
更关键的是,RNH2A-KO细胞原有的链偏倚在Top1敲低后被打破,同时非模板链上的rG进一步积累。这支持一种补偿模型:正常情况下,RNase H2承担处理DNA内嵌rNMP的主要任务;当RNase H2失效后,Top1会参与处理启动子附近的rNMP。
而且,rG比例随着转录输出升高的现象,主要出现在RNase H2缺失及Top1敲低背景,并集中在非模板链。rNMP的命运因此并不只是“哪个碱基更容易被误掺入”这么简单,而是同时受到 转录强度、DNA链方向以及修复通路状态 的影响。
最关键的一步:rNMP真的能改变DNA的“拧紧程度”
如果研究只停留在共定位和相关性,它更像是一张新的基因组图谱。把机制向前推进的一步,是研究人员将rNMP与 DNA超螺旋(DNA supercoiling) 连接起来。
研究人员首先使用一个 4.3 kb的负超螺旋质粒 进行体外实验。质粒分别来自能够正常清除rNMP的大肠杆菌,以及rNMP会大量积累的rnhB缺失菌株。结果显示,无论是细菌RNase HII还是人RNase H2,都能够切开含有内嵌rNMP的负超螺旋质粒,使DNA转向缺口或松弛状态;而对于rNMP已被有效清除的野生型质粒,则没有观察到类似变化。这部分实验进行了 4次独立重复。
随后,研究人员回到人细胞,挑选了 7个 在RNH2A-KO后TSS下游rG富集升高的基因,覆盖低、中、高三种转录水平,并利用补骨脂素(psoralen)更偏好结合负超螺旋DNA的特性进行检测。结果显示,这7个基因中,RNH2A-KO细胞的TSS区域相对负超螺旋信号均高于野生型,而且高转录基因中的差异最明显。
因此,现有数据支持这样一个模型: RNase H2依赖的rNMP加工参与调节启动子附近的DNA超螺旋状态。 但这个结论仍需要控制表述强度,它并没有证明每一个rNMP都像经典表观遗传标记一样,可以直接决定某个基因“开启”还是“关闭”。 |
端粒又给出了另一套rNMP规律
端粒(telomere)是这张ribome图谱中另一个非常突出的热点。野生型细胞中,端粒rNMP的平均EF超过 5; RNH2A-KO文库中也超过 2。 需要注意的是,这里的EF是相对于每个文库各自全基因组背景计算的相对富集,因此不能简单把敲除细胞中较低的EF理解成“端粒rNMP绝对数量减少”。
更特别的是它们的组成。野生型CD4+ T、hESC-H9和HEK293T细胞的端粒G链存在明显的 rA偏好, 并出现TrA序列模式;而这一特征在RNH2A-KO细胞中消失,转而更接近全基因组范围内的rG优势。
研究人员据此提出,这种端粒rA模式可能与端粒酶(telomerase)有关,并可能反映不同的rNMP产生或清除机制。不过,这目前仍然属于机制推断,而不是已经被直接验证的“端粒酶分子特征”。此外,短读长测序无法把这些rNMP精确分配到某一条染色体的具体端粒末端。
“表观遗传调节因子”,应该怎么理解?
这项研究最容易引发讨论的概念,是研究人员将DNA内嵌rNMP称为一类 表观遗传调节因子(epigenetic modulators)。
从功能角度看,这个说法有相当清晰的实验依据:rNMP并不改变DNA本身的碱基序列,却可以通过RNase H2和Top1的加工影响DNA超螺旋,而DNA拓扑又与转录密切相关。它与DNA甲基化、组蛋白修饰并不是同一种化学机制,却提供了另一条“序列不变,但功能状态可以改变”的潜在调控路径。
但如果采用更严格、强调稳定维持甚至细胞代际传递的表观遗传定义,目前的证据还不充分。该研究主要建立在群体水平的全基因组图谱、基因敲除/敲低实验以及少数位点的DNA拓扑检测之上;局部超螺旋只测量了有限位点,高度重复的端粒、着丝粒等区域受到短读长测序限制,群体细胞实验也无法直接给出单个rNMP从嵌入、被识别、被切除到转录改变之间的时间顺序。
因此,更稳妥的理解是:这项研究发现了一类此前被低估、具有表观遗传调控潜力的非经典DNA化学特征,并首次把它与人类细胞中的转录相关DNA拓扑系统连接起来。 |
最值得继续关注的,也许已经不是“DNA里有没有rNMP”,而是“谁先谁后”:是活跃转录首先制造了rNMP热点,还是某些rNMP又进一步改变局部转录?R-loop、G4、DNA聚合酶停顿与rNMP嵌入之间的时间顺序是什么?在RNase H2缺陷相关疾病,例如Aicardi-Goutières综合征(Aicardi-Goutières syndrome, AGS)中,这条 rNMP-DNA拓扑-转录 轴是否也参与疾病发生过程?RNase H2功能缺失与AGS及基因组不稳定的关系此前已有明确背景依据,但这篇研究本身尚未在患者组织中验证上述新机制。
过去被归为“错误”或“损伤”的分子,如果反复出现在同一类功能区域,并且能够改变基因组的物理状态,就值得重新审视它在细胞中的角色。DNA序列告诉我们基因组“写了什么”,而这项研究提醒我们,DNA分子此刻处于什么样的化学与拓扑状态,同样可能决定这些文字如何被读取。 |
参考文献