上海交通大学《Cell》+1
无错误、完整的基因组组装是进行无偏比较基因组学和功能遗传分析的终极参考。尽管长读长测序技术和组装算法的进步使得端粒到端粒(T2T)完整组装成为可能,但共识准确度仍存在关键局限,尤其是在解析高度重复的同源区域方面。
2026年8月6日,上海交通大学毛亚飞团队与原中国科学院脑科学与智能技术卓越创新中心孙强团队在
Cell
在线发表题为
Complex subtelomeric architectures in a complete rhesus macaque reference genome
的研究论文。
该研究实现了恒河猴(Macaca mulatta)基因组的“近乎完美”端粒到端粒组装——T2T-MMU8v2.0,达到了基因组完整性检查器(GCI)100分、共识序列中零个错误k-mer(k=21)的质量标准。

“完美”基因组的标准
研究团队首先提出了一个完整且近乎完美基因组的三条标准:
(1)高碱基级准确度:估计质量值QV≈100(k=21),即每100亿个碱基中约1个错误
(2)完全连续性:GCI=100,无间隙
(3)完全覆盖:无未定位或折叠区域
攻克亚端粒卫星序列瓶颈
优化组装策略揭示,长读长技术偏差以及杂交组装框架的局限性,使得亚端粒区富含的卫星序列成为获取完整组装的主要瓶颈。研究团队成功解析了约8 Mb的SATR卫星阵列,并发现了268个此前未注释的重复序列家族。

文章模式图(图源自
Cell
)
四种独特的SATR基因组结构
通过精细解析,研究定义了四种独特的SATR基因组结构,每种结构具有不同的卫星组成、片段重复组织方式和表观遗传特征,与人科动物基因组中观察到的亚端粒结构存在显著差异。
重复区域的“基因创新”
这些看似“垃圾”的重复区域并非沉默的荒漠:其中包含58个正在被转录的基因,表明在这些重复区域存在基因创新。这一发现挑战了传统认知——原来那些高度重复的区域也可能是新基因诞生的摇篮。
功能提升
从功能上看,T2T-MMU8v2.0提高了比对准确性和染色质可及性检测能力,从而能够更精细地识别群体变异和调控元件。
意义
需要客观指出的是:该基因组组装基于一只雌性恒河猴的单倍体,个体间的结构变异和杂合区域仍需更多样本补充。此外,SATR卫星序列的功能验证仍需进一步的实验研究。
尽管如此,这项研究为灵长类基因组学树立了新的基准:它首次实现了非人灵长类的“零错误k-mer”T2T组装,并揭示了此前难以获取的基因组结构在功能和进化上的重要意义。对于以恒河猴为模型动物的神经科学、发育生物学和疾病研究而言,T2T-MMU8v2.0将极大地提高遗传分析和调控元件注释的精度,推动灵长类比较基因组学进入“完整基因组学”时代。
参考消息:https://www.cell.com/cell/abstract/S0092-8674(26)00225-4
