人类基因组的高分辨率单分子复制图谱分析
发布时间:
2026-08-16 15:49
人类基因组的高分辨率单分子复制图谱分析
艾伦·图兰乔 、维多利亚·罗雅特 、迪莱塔·恰尔多 、弗洛伦斯·普鲁克斯 、洛朗·拉克鲁瓦 、让 - 米歇尔·阿尔博纳 、本杰明·奥迪特 、奥利维耶·伊里安 、贝努瓦·勒塔莱克
法国国家科学研究中心 - 巴黎高等师范学院生物学系综合生物学研究所,巴黎文理研究大学,法国国家科学研究中心,法国国家健康与医学研究院,75005 巴黎,法国
法国国家科学研究中心 - 地中海生物学研究所,法国国家科学研究中心 - 里昂高等师范学校综合生物学实验室,法国国家科学研究中心 - 里昂高等师范学校。法国里昂,69342,邮编 07,法国
这些作者贡献相同:艾伦·图兰乔、维多利亚·罗雅特、迪莱塔·恰尔多 *邮箱:alan.tourancheau@bio.ens.psl.eu;hyrien@bio.ens.psl.eu;letallec@bio.ens.psl.eu
摘要
尽管近年来由于长读长测序技术的兴起取得了显著进展,但基于高分辨率单分子(SM)的大型基因组复制图谱分析仍难以实现。在此,我们提出一种复制标记策略,即使用胸苷类似物溴脱氧尿苷(BrdU)对异步生长的细胞进行重复脉冲标记,这大大增加了可检测到的复制轨迹数量。我们表明,“多脉冲”BrdU 标记方案与 ForkML(一种将纳米孔读数中的 BrdU 信号转化为定向和定位复制叉的机器学习方法)相结合,能够在千碱基分辨率下建立整个人类基因组的 SM 复制图谱。
正文
DNA 复制的单分子(SM)分析为真核生物基因组复制提供了关键见解,无论是通过揭示复制过程的基本原理,还是通过测量关键参数,如叉速或起始点之间的距离。SM 方法通常依赖于对掺入复制 DNA 中的胸苷类似物在拉伸的 DNA 纤维上进行免疫荧光检测,这使得能够可视化沿着单个分子延伸的复制叉以及起始和终止事件 。尽管传统的 SM 技术非常适合捕捉复制灵活性并揭示细胞间异质性,但它们无法大规模绘制复制轨迹,将大多数研究限制在“匿名”叉上,并阻碍了基因组和染色质背景的整合。目前,这一障碍正被逐步克服,特别是由于引入了
基于长读长测序的复制图谱绘制方法,如 DNAscent 、FORK - seq 及其衍生物 ,这些方法用专门的碱基识别器直接识别取代了胸苷类似物的免疫化学检测,同时提供了复制信号的基因组坐标。这些技术最初是在酿酒酵母模型生物中建立的,在那里它们成功地生成了全基因组的 SM 复制图谱 ,现在已扩展到高等真核生物 。然而,后生动物基因组的巨大规模迄今为止限制了高覆盖度的 SM 研究,要么局限于特定的、富集的基因组位点7,要么局限于染色体外 DNA ,全基因组研究成本仍然过高。最近报道了果蝇基因组 的 SM 复制图谱分析 ,这是一个重要的进展,尽管低覆盖度和分辨率(每 100 kb 少于 10 个叉)妨碍了详细分析。由于超长的、可映射的 DNA 分子,DNA 复制的光学图谱分析 为后生动物基因组的高通量 SM 研究提供了一种有价值的替代方法,如在人类细胞中全基因组鉴定早期起始位点所示 。其局限性包括由于使用不能被动进入细胞的荧光核苷酸,适用性基本上局限于细胞提取物和同步化细胞,以及起始位点定位的最大分辨率为 。
为了绘制人类基因组中的复制叉进展情况,我们最近引入了ForkML,这是一种机器学习方法,用于解释在暴露于两个连续的溴脱氧尿苷(BrdU)脉冲(中间间隔在无BrdU培养基中进行细胞培养)的异步细胞的基因组DNA纳米孔读数中胸腺嘧啶类似物溴脱氧尿苷(BrdU)的信号 。此过程在两个时间点捕获正在进行的复制叉位置,通过将脉冲之间复制叉移动的基因组距离除以脉冲间时间间隔的持续时间来获得复制叉速度。由于我们的标记方案不使用会干扰后续BrdU掺入的胸腺嘧啶追赶步骤,我们推断原则上可以应用无限数量的连续BrdU脉冲。在这里,我们表明增加BrdU脉冲可在整个S期跟踪复制叉,并按比例增加可检测到的复制信号数量,从而缓解大基因组的覆盖限制。结合ForkML,这种“多脉冲”策略允许计算整个人类基因组的高分辨率SM复制图谱。
我们旨在将“多脉冲”方法应用于常用的HCT116上皮细胞系。BrdU脉冲持续时间和浓度分别设置为 和 ,脉冲开始之间间隔30分钟,如先前定义 。我们决定进行24次连续的BrdU脉冲,以使实验的总持续时间(即 )与HCT116的中位倍增时间相匹配(补充图1a,b)。因此,在此期间所有细胞将不可避免地经历S期并在BrdU存在的情况下复制其基因组。具体而言,标记方案包括用BrdU脉冲指数生长的细胞,用预热的PBS洗涤两次,在无BrdU的条件培养基中孵育直至脉冲开始后30分钟,然后在收获细胞之前重复此操作23次(图1a)。条件培养基取自含有等量细胞的“姐妹”培养皿,并与标记的培养皿同时接种;使用它而不是新鲜培养基以确保在实验过程中培养基组成保持一致。重要的是我们验证了用 孵育细胞长达 对HCT116细胞生长没有可检测到的影响(补充图1c)。流式细胞术分析进一步表明,“多脉冲”程序对细胞周期中的细胞分布只有轻微影响,多标记细胞仅在G1期略有减少,在G2/M期略有积累(补充图1d,e)。此外,这可能是由于重复洗涤和培养基更换而不是BrdU标记本身导致的,如单独用BrdU溶剂PBS处理24次脉冲的细胞具有可比的细胞周期分布所示(补充图1d,e)。细胞反复暴露于BrdU不会导致检查点蛋白Chk1的磷酸化(补充图1f),表明在实验时间范围内没有诱导复制应激。我们标记方案的主要缺点是由于频繁更换培养基导致 细胞损失(补充图1g,h)。总之,这些结果表明“多脉冲”策略允许在生理相关条件下检查复制动态。
’多脉冲’复制轨迹主要表现为一系列相邻、相似、不对称的BrdU信号(图1b - e)。每个信号都由一个从基线开始的陡峭上升段和一个逐渐下降至背景BrdU水平的部分组成,如前所述 ,这分别对应于脉冲期间和在无BrdU培养基中细胞孵育期间的BrdU掺入,并揭示了叉的方向。换句话说,一个不对称的BrdU信号代表一个在给定方向上在 时间段内延伸的叉。例如,在图1b中,读数#1显示一个向右移动的叉,每隔30分钟捕获一次,共捕获了11次,在此期间移动了 ;读数#2(图1c)显示一个向左的叉连续被捕获了14次,即在整个S期,在HCT116细胞中估计为 (补充图1b,e)。起始事件以分叉的叉(图1d)和与脉冲开始后起始的叉对相对应的对称BrdU信号(图1e)的形式被识别;同样,终止事件被检测为单独的、汇聚的叉(图1d)或作为代表在BrdU水平回到基线之前叉合并的对称BrdU信号(图1e)。值得注意的是,’多脉冲’方法使得从叉从起始点发出的那一刻到它遇到汇聚叉的时间能够追踪一个叉(图1d,e),从而使DNA复制程序在我们眼前展开。
使用ForkML管道 ,我们发现在进行了24次脉冲处理的HCT116细胞中,定向复制轨迹的数量比仅进行了两次脉冲处理的细胞多 倍(平均每Gb映射DNA上分别为10,172条和818条轨迹;见方法),正如预期的那样,这一增加与BrdU脉冲次数成比例。使用牛津纳米孔技术(ONT)PromethION设备进行测序的11个’多脉冲’实验,每个实验根据测序通量产生了300,000到100万个定向复制轨迹(表1),这使得能够以 分辨率计算人类基因组基于SM的复制叉方向性(RFD)图谱(图2a和补充图2)。该图谱显示了主要向右和向左叉进展区域的独特交替,如反复观察到的 ,从左到右和从右到左的转变分别指示起始和终止区域。最重要的是,它与使用GLOE - seq技术在同一细胞系中生成的图谱惊人地相似 (图2b,c;斯皮尔曼成对相关系数为0.82),这验证了我们方法的稳健性。主要区别在于’多脉冲’RFD图谱的幅度更高,常常达到接近1的绝对值,表明在整个细胞群体中单向复制,而GLOE - seq的绝对RFD值几乎不超过0.7;这可能归因于GLOE - seq图谱中更高的背景噪声。
除了建立人类基因组的高分辨率单分子复制图谱外,“多脉冲”策略还识别出了超过一百万个单独的起始和终止事件(表1),这比最近对后生动物基因组的单分子研究高出两个数量级以上 。它还与使用光学复制图谱定位的 万个早期起始事件相媲美 ,同时在整个S期定位起始点激发。最后,与“双脉冲”标记程序 一样,“多脉冲”方案使得监测叉速成为可能,并且可以在更长的时间段内进行监测——通常是几个小时,甚至是整个S期持续时间。例如,图1b的读数#1上显示的向右移动的长距离叉速可以通过计算两个给定连续BrdU脉冲开始时叉位置之间的距离与时间间隔持续时间的比率,在九个连续的30分钟时间段内进行计算。在4.5小时的监测期内,所讨论的叉表现出相当均匀的移动(范围为1.3 - 1.6 kb/min,中位数为1.4 kb/min),这与图1c的读数#2上显示的向左叉形成鲜明对比,后者在S期过程中显著加速(测量速度13次;范围为0.5 - 1.8 kb/min,中位数为1.1 kb/min)。因此,“多脉冲”实验特别适合深入分析叉进展动态,揭示S期叉移动的一致性或缺乏一致性。
总之,我们的“多脉冲”方法将生成大型基因组的高分辨率全基因组复制图谱的能力与在整个S期测量叉速并以前所未有的规模精确定位单个起始和终止事件的能力结合起来。它完全弥合了基于单分子和群体的检测方法之间的差距,最终将DNA复制的单分子分析带入基因组时代,有能力揭示人类基因组的复制策略。
细胞系和细胞培养
从美国典型培养物保藏中心(ATCC;#CCL - 247)购买的HCT116人结肠癌细胞,在含有10%胎牛血清(多米尼克·杜彻 #500105G1G,批次P190801,和#500105M1M,批次S00G0)的 McCoy’s 5A培养基(Gibco #16600082和#26600023)中培养,并补充 青霉素和 链霉素(Sigma - Aldrich #P4333)。细胞在 培养,并且常规确认支原体污染为阴性。
新合成DNA的多次BrdU脉冲标记
对数生长期的细胞用 (Sigma - Aldrich #B5002,溶解于PBS)脉冲标记 ,用预热的PBS洗涤两次,在无BrdU的条件培养基中孵育至BrdU脉冲开始后30分钟,整个过程重复23次,总实验持续时间为12小时(24×30分钟)。然后用PBS洗涤细胞,通过胰蛋白酶消化收获细胞,并在根据制造商针对超长DNA测序应用的说明使用Monarch HMW DNA Extraction Kit for Cells & Blood(新英格兰生物实验室 #T3050)提取基因组DNA之前进行计数。条件培养基来自一个“姐妹”培养皿,其中接种的细胞与标记的细胞同时且数量相等;制备的“姐妹”培养皿数量与BrdU脉冲次数相同。系统地使用未处理细胞的对照培养皿来评估“多脉冲”实验期间的细胞损失(补充图1g);还评估了用BrdU或PBS进行24次脉冲标记循环后回收的细胞数量(补充图1h)。
细胞生长和倍增时间
在72至 的时间段内定期测定细胞数量。根据生长曲线,按照公式 (细胞初始数量)估算指数生长细胞的倍增时间(T)。
细胞周期分析
将指数生长的未处理细胞或如上述用BrdU或PBS脉冲标记24次的细胞,与 -乙炔基-2’-脱氧尿苷(EdU,耶拿生物科学公司#CLK-N001-100)一起孵育 ,然后用乙醇固定。将固定的细胞离心沉淀,在室温下于含0.2% Triton X-100的PBS中孵育20分钟,用含0.1% BSA的PBS洗涤,然后进行“点击化学”反应,通过在补充有 AF647-吡啶甲基叠氮化物(耶拿生物科学公司#CLK-1300A-1)、 CuSO4(耶拿生物科学公司#CLK-MI004-50)和10 mM抗坏血酸钠(耶拿生物科学公司#CLK-MI005-1G)的PBS中室温孵育(避光)30分钟,用AF647染料对EdU进行荧光标记,最后用含0.1% BSA的PBS洗涤。用4’,6-二脒基-2-苯基吲哚(DAPI,密理博#5.08741.0001)对DNA进行复染。使用配备Everest软件(版本3.2.12.0)的ZE5细胞分析仪(伯乐公司)对样品进行分析。数据使用FlowJo v10.10.1进行处理。
免疫印迹分析
使用RIPA缓冲液(150 mM NaCl、1% NP-40、0.1% SDS、1%脱氧胆酸钠、50 mM Tris-HCl pH 7.5、1 mM EDTA和1 mM EGTA)以及用于细胞裂解的Pierce通用核酸酶(赛默飞世尔科技#88700)加上蛋白酶和磷酸酶抑制剂(200 µM PMSF;蛋白酶抑制剂混合物,西格玛-奥德里奇公司#P8340;磷酸酶抑制剂混合物2,西格玛-奥德里奇公司#P5726),获取未处理细胞、如上述用BrdU脉冲标记24次的细胞或用 羟基脲(西格玛-奥德里奇公司#H8627)处理 的细胞的总蛋白提取物。简要地说,将细胞在RIPA缓冲液中于冰上孵育20 - 30分钟,在 以 离心 ,收集含蛋白质的上清液。使用考马斯亮蓝法测量蛋白质浓度。 蛋白质通过在12%凝胶上进行SDS-PAGE分离并转移到硝酸纤维素膜上。分别用1:1000的小鼠抗Chk1抗体(圣克鲁斯公司#sc-8408,批次1009)、1:1000的兔抗磷酸化Chk1(Ser345)抗体(细胞信号技术公司#2348,批次18)和1:1000的小鼠抗β-肌动蛋白抗体(细胞信号技术公司#58169,批次1)进行Chk1、磷酸化Chk1(Ser345)和β-肌动蛋白免疫印迹,使用1:50000的HRP偶联抗兔(普洛麦格公司#W401B)或抗小鼠(普洛麦格公司#W402B)作为二抗。使用SuperSignal West Femto最大灵敏度底物(赛默飞世尔科技#34095)化学发光试剂进行检测。使用Amersham ImageQuant 800(通用电气公司,软件版本1.1.2)进行成像。
文库制备和数据采集
样本使用ONT的R9.4.1 PromethION流动槽进行测序。测序文库使用ONT连接测序试剂盒SQK-ULK001按照ONT方案制备。在测序过程中,使用ONT EXP-WSH004试剂盒清洗流动槽,并将文库重新加载两次。数据使用MinKNOW(ONT,版本23.07.12和23.11.7)以默认参数采集。
BrdU碱基识别、读数比对和BrdU信号分割
BrdU碱基识别和读数比对按照参考文献 (R9.4.1数据集;Megalodon v2.2.9、Guppy v4.4.1和minimap2 v2.26)中的方法进行。BrdU信号分割使用ForkML按照参考文献 中的方法实现。T2T-CHM13 (v2.0)用作参考基因组。
比较HCT116细胞用2个或24个BrdU脉冲标记后ForkML检测到的定向复制轨道数量。用2个或24个BrdU脉冲标记细胞后,每千兆碱基映射DNA中检测到的定向复制轨道的平均数量分别根据参考文献 的补充数据1中的图(HCT116_UT_R9_rep1-4样本)和本研究表1中的图(HCT116_rep1-11样本)计算得出。
RFD图谱
HCT116“多脉冲”RFD图谱在不重叠的1 kb基因组窗口中计算为(RFD = (R - L)/(R + L)),其中(R)和(L)分别是每个窗口内向右和向左定向的复制轨道覆盖度。定向复制轨道从同向叉足迹推断得出。对于每个轨道,将叉方向分配给检测到的片段,并延伸到相邻的未分配区域,直至相邻叉调用之间的中点,或者在读取末端,延伸到距读取边界距离的一半,从而在避免冲突叉方向分配重叠的同时,最大化每个读取的可解释部分。使用了所有11个HCT116生物学重复样本。HCT116 GLOE-seq RFD图谱按照参考文献9中所述在不重叠的 窗口中计算。
“多脉冲”和GLOE-seq RFD图谱的全基因组比较
使用六边形散点图比较“多脉冲”和GLOE-seq RFD图谱。点被汇总到六边形箱中,箱的颜色表示同源类别的基因组窗口数量。为了考虑不同的分辨率(“多脉冲”和GLOE-seq RFD图谱分别为1和 窗口),将每个10 kb的GLOE-seq RFD值与相应的十个 基因组窗口的“多脉冲”RFD值进行匹配。使用 cor函数计算两个图谱之间的斯皮尔曼等级相关系数。
数据可用性
本研究中生成的纳米孔测序数据将在发表时提供。本研究中使用的参考文献 中的HCT116 GLOE-seq数据可在NCBI的生物项目数据库中获取,登录号为PRJNA554350(GSM4305465和GSM4305466)。
致谢
作者感谢IBENS GenomiqueENS设施在纳米孔测序方面的协助,以及IBENS IT平台和BioClust计算集群(Labex Memolife)进行数据管理。这项工作得到了医学研究基金会[给O.H.的FRM EQU202203014910]和国家研究机构[给B.A.和O.H.的NanoPoRep ANR- 18-CE45-0002、HUDROR ANR-19-CE12-0028和SMAHGR ANR-23-CE12-0021]的资助。V.R.得到了高等教育和研究部以及医学研究基金会[FRM FDT202404018224]的奖学金支持。
利益冲突
作者声明无利益冲突。

图1. 使用“多脉冲”BrdU标记和ForkML分析人类基因组的复制动态。a,实验工作流程。BrdU脉冲浓度和持续时间分别设置为4分钟和10 μM。b - e,用BrdU脉冲标记24次的HCT116细胞基因组DNA的纳米孔读数的BrdU含量谱示例。每个分子上方显示ForkML推断的复制叉足迹,蓝色和红色箭头分别表示向左和向右的叉。绿色三角形和红色正方形分别标记ForkML推断的起始(分叉叉)和终止(汇聚叉)事件的位置。ForkML估计的叉速度(如可用)显示在顶部。灰色点,100 bp上平均的BrdU信号;黑线,2.5 kb上的高斯平滑信号。

图2. 基于单分子的人类基因组高分辨率RFD分析。a,基于在24次用BrdU脉冲标记的HCT116细胞基因组DNA的纳米孔读数中由ForkML检测到的定向复制轨迹聚集构建的18号染色体 部分1 kb窗口中的RFD谱。平均覆盖度约为65x。所有人类染色体显示在补充图2中。b,在与a相同染色体区域的HCT116细胞中以10 kb窗口计算的GLOE-seq RFD谱。平均覆盖度<1153x。a,b,正(右向叉占主导)和负(左向叉占主导)RFD值分别为红色和蓝色。c,“多脉冲”和GLOE-seq RFD谱之间的全基因组比较,以六边形箱表示为二维密度图。对角线表示两种方法之间相等的RFD值。 中的GLOE-seq数据来自参考文献18。
| 运行名称 | 映射的DNA(Gb) | 定向复制轨道数量 | 起始事件数量 | 终止事件数量 |
| HCT116_rep1 | 31.7 | 333,303 | 47,289 | 47,677 |
| HCT116_rep2 | 29.2 | 310,858 | 43,508 | 43,483 |
| HCT116_rep3 | 91.3 | 974,222 | 126,849 | 126,695 |
| HCT116_rep4 | 73.4 | 728,850 | 102,855 | 100,715 |
| HCT116_rep5 | 97.1 | 1,016,387 | 146,187 | 146,056 |
| HCT116_rep6 | 73.6 | 762,719 | 112,154 | 111,890 |
| HCT116_rep7 | 103.5 | 1,019,308 | 148,298 | 145,928 |
| HCT116_rep8 | 100.6 | 1,022,747 | 148,359 | 147,541 |
| HCT116_rep9 | 81.0 | 774,826 | 110,925 | 108,706 |
| HCT116_rep10 | 90.9 | 912,267 | 131,766 | 129,738 |
| HCT116_rep11 | 107.9 | 1,044,768 | 139,865 | 137,481 |
| 总计 | 880.2 | 8,900,255 | 1,258,055 | 1,245,910 |
表1. 本研究中测序的“多脉冲”样本的详细信息。Rep,重复样本。
参考文献
1. Techer H, et al. Replication dynamics: biases and robustness of DNA fiber analysis. J Mol Biol 425, 4845-4855 (2013).
2. Muller CA, et al. Capturing the dynamics of genome replication on individual ultra-long nanopore sequence reads. Nat Methods 16, 429-436 (2019).
3. Hennion M, et al. FORK-seq: replication landscape of the Saccharomyces cerevisiae genome by nanopore sequencing. Genome Biol 21, 125 (2020).
4. Claussin C, Vazquez J, Whitehouse I. Single-molecule mapping of replisome progression. Mol Cell 82, 1372-1382 e1374 (2022).
5. Theulot B, et al. Genome-wide mapping of individual replication fork velocities using nanopore sequencing. Nat Commun 13, 3295 (2022).
6. Theulot B, et al. Telomere-to-telomere DNA replication timing profiling using single-molecule sequencing with Nanotiming. Nat Commun 16, 242 (2025).
7. Carrington JT, et al. Most human DNA replication initiation is dispersed throughout the genome with only a minority within previously identified initiation zones. Genome Biol 26, 122 (2025).
8. Jones MJK, et al. A high-resolution, nanopore-based artificial intelligence assay for DNA replication stress in human cancer cells. Nat Commun 16, 7732 (2025).
9. Rojat V, et al. Automated mapping of DNA replication fork progression in human cells with ForkML. Nat Commun 17, (2026).
10. Georgieva D, Liu Q, Wang K, Egli D. Detection of base analogs incorporated during DNA replication by nanopore sequencing. Nucleic Acids Res 48, e88 (2020).
11. Jaworski JJ, Pfuderer PL, Czyz P, Petris G, Boemo MA, Sale JE. ecDNA replication is disorganized and vulnerable to replication stress. Nucleic Acids Res 53, (2025).
12. Han D, Shepherd C, Benton ML, Nordman JT. Nanopore-based sequencing of active DNA replication reveals key principles of metazoan replication dynamics. Sci Adv 12, eaed2806 (2026).
13. De Carli F, Gaggioli V, Millot GA, Hyrien O. Single-molecule, antibody-free fluorescent visualisation of replication tracts along barcoded DNA molecules. Int J Dev Biol 60, 297-304 (2016).
14. Lacroix J, et al. Analysis of DNA Replication by Optical Mapping in Nanochannels. Small 12, 5963-5970 (2016).
15. De Carli F, Menezes N, Berrabah W, Barbe V, Genovesio A, Hyrien O. High-Throughput Optical Mapping of Replicating DNA. Small Methods 2, 1800146 (2018).
16. Wang W, et al. Genome-wide mapping of human DNA replication by optical replication mapping supports a stochastic model of eukaryotic replication. Mol Cell 81, 2975-2988 e2976 (2021).
17. Petryk N, et al. Replication landscape of the human genome. Nat Commun 7, 10208 (2016).
18. Sriramachandran AM, et al. Genome-wide Nucleotide-Resolution Mapping of DNA Replication Patterns, Single-Strand Breaks, and Lesions by GLOE-Seq. Mol Cell 78, 975-985 e977 (2020).
19. Kara N, Krueger F, Rugg-Gunn P, Houseley J. Genome-wide analysis of DNA replication and DNA double-strand breaks using TrAEL-seq. PLoS Biol 19, e3000886 (2021).
20. Koyanagi E, et al. Global landscape of replicative DNA polymerase usage in the human genome. Nat Commun 13, 7221 (2022).
21. Nurk S, et al. The complete sequence of a human genome. Science 376, 44-53 (2022).
22. R Core Team. R: A language and environment for statistical computing. R Foundation for Statistical Computing (2025).
BrdU,HCT116细胞,纳米孔测序,人类基因组,复制叉
表观信息
艾维缔官网
艾德官网
B站IVDSHOW
抖音军哥聊表观
视频号艾维缔
小红书艾维缔
快手表观盒子
表观遗传学
联系我们