真正的革命不是测DNA,而是让AI读懂整个生命系统

真正完整的人类基因组,直到最近才出现。

以前大家一直说已经读完了人类基因组,可真正翻开最后几页才发现,居然还有一大堆空白。那些一直被忽略的区域,偏偏和衰老、癌症、生育、遗传疾病都有关系。这篇发表在《Cell》的评论文章讨论的重点,并不是又发明了一台测序仪,而是宣布一个时代已经结束,另一个时代正式开始。

人类基因组为什么一直都不是完整版

很多人以为,人类基因组计划二十多年前就已经完成,所以今天做基因检测,不过是在已有地图上找不同的位置。

真正的情况却像一本一千页的书,中间有八十页因为太难印刷,被直接撕掉了。后来所有人都拿着这本缺页版教材学习,时间久了,大家甚至忘记它本来就少了内容。论文一开始就指出,人类基因组计划最大的遗憾,就是重复序列无法完整组装,大量重要区域只能留下空缺。

这些缺失区域长期被认为价值不高,因为它们重复太多,像打印机不停复制同一句话。可真正深入以后才发现,这些区域恰恰参与染色体稳定、端粒、着丝粒、多拷贝基因以及大量疾病相关机制,包括衰老、癌症、不孕和遗传疾病。以前看不到,不代表它不存在。

真正的问题并非科学家不知道那里有东西,而是以前的测序技术读得太短。短读长数据遇到重复区域,就像把几千块完全一样颜色的拼图混在一起,电脑根本不知道哪一块应该放在哪里,于是只能留下一个大大的空洞。

T2T真正改变的不是地图,而是地图是否完整

文章不断强调一个关键词:Telomere-to-Telomere,简称 T2T(端粒到端粒)。它表示整条染色体从一端端粒一直连续到另一端端粒,中间没有任何缺口。

这个概念看起来只是一个名字变化,实际上代表评价标准发生了变化。过去很多论文也喜欢写 complete(完整)或者 whole genome(全基因组),后来大家发现,这两个词用得太宽松。真正没有任何缺口的染色体,其实非常少,所以 T2T 成了新的质量标准。

能够进入 T2T 时代,并不是因为算法突然变聪明,而是因为测序终于能够读到几百万碱基长度的超长序列,再配合 PacBio HiFi 高精度长读长和新的组装算法,过去几十年无法跨越的大型重复区域终于第一次能够连续拼接出来。

更有意思的是,这件事情形成了正反馈。第一次得到完整基因组以后,这些过去从未见过的数据,又反过来重新训练测序模型,提高测序准确率,让下一代 T2T 基因组更容易完成。论文认为,高质量参考基因组本身已经成为未来算法持续升级的重要训练数据。

AI时代为什么突然开始重做整个基因组

如果只是为了补齐几段缺失序列,这场技术革命不会引起这么大的关注。真正改变方向的原因,是人工智能的发展,把完整数据突然变成了刚需。

人工智能训练有一个很简单的规律,教材越完整,学出来的模型越聪明。如果教材本身少了八个百分点,而且偏偏少的是最复杂、变化最快的章节,那么模型再聪明,也只能学会一套残缺知识。论文直接指出,以前整个基因组有约8%的内容长期缺失,其中很多还是近年来快速演化形成的区域,因此任何预测模型都会天然存在盲区。

这里出现一个重要概念:Sequence-to-Function Model(序列到功能模型)。它的目标不是记住某段DNA长什么样,而是看到DNA序列以后,就预测它未来会影响哪些蛋白质、哪些组织、哪些疾病风险。这种模型想学会规律,就必须拥有尽可能完整的数据,否则等于一直在拼缺角拼图。

论文拿 AlphaFold 举了一个很有意思的例子。AlphaFold 成功的重要原因,并不仅仅是算法优秀,更重要的是前面几十年积累了足够完整、足够可靠的蛋白质数据库。作者认为,未来基因组领域也需要建立类似的数据基础,把完整基因组、表观基因组、转录组、蛋白质组等各种数据一起组成训练集,让人工智能学习真正完整的生物规则,而不是一直围着残缺参考基因组打转。

另一个容易忽略的变化,是训练数据开始强调来自同一个个体。过去很多数据库东拼一点、西拼一点,不同人的数据混在一起分析。论文认为,未来应该把完整双倍体基因组与同一个人的甲基化、染色质开放状态、转录组等功能数据配对采集,这样人工智能才能准确知道每一个调控元件真正对应哪一条染色体,而不会出现配错对象的情况。

个性化基因组正在取代参考基因组

过去做基因分析,大多数流程都是先把一个人的DNA拿去和标准参考基因组比较,再寻找哪里发生了变化。这种方法像所有人都穿同一双鞋,再去比较谁的脚比较奇怪。

论文提出的新方向叫 Personalized Genomics(个性化基因组)。它的核心变化不是继续优化参考基因组,而是让每个人拥有属于自己的完整基因组,再把所有分析直接建立在这个人的基因组之上。分析对象第一次从公共模板变成了患者本人。

这样带来的最大变化,是大量过去需要分别完成的检测都有机会统一完成。例如寻找重复扩增、复杂结构变异、多拷贝基因变化等,以前往往需要不同实验分别检测;未来只需要查询患者自己的完整基因组,就可能一次完成分析。论文把这种变化描述成,把许多单独检测转换为针对完整个人基因组的直接查询。

作者进一步设想未来医疗流程:先完成低成本全基因组测序,然后重建个人完整双倍体基因组,再结合数据库和最新文献,由人工智能完成搜索、推理与总结,最后交给临床医生解释诊断、风险预测和治疗方案。人工智能负责处理指数级增长的信息,人类医生负责最终医学判断,两者形成新的协作方式,而不是彼此替代。

文章最后留下一个耐人寻味的判断。过去二十多年,行业一直努力回答的是“如何测完整个基因组”;现在真正的问题已经变成“如何理解整个基因组”。前一个问题主要属于测序技术,后一个问题则属于人工智能、生物学和医学共同面对的新挑战。从补齐缺页,到真正读懂整本书,这才是作者眼中 T2T 时代真正开始的地方。


从测完整基因组,到读懂整个生命系统

真正值得关注的变化,并不是测序仪越来越快,而是整个研究目标已经发生了变化。以前大家拼命把DNA一个字一个字读出来,现在真正困难的是理解这些文字为什么这样排列,又为什么会决定生命活动。

论文专门提出一个容易被忽略的问题。对于能够直接改变蛋白质编码的突变,人们已经可以比较准确预测影响,因为遗传密码规则已经研究几十年。但是,大量位于非编码区域的变异,依然很难判断后果,例如影响基因调控、RNA剪接以及各种调控网络的变化。这说明,人类真正不了解的内容,大部分仍然藏在非编码区域。

过去这些区域长期缺失,所以很多预测模型天然存在知识盲区。如今T2T完整基因组第一次把这些区域连续展示出来,再配合同一个人的甲基化、转录组等功能数据,人工智能终于能够学习整个调控网络,而不是只学习其中最容易观察的一部分。论文认为,这些原本处于"黑暗区域"的序列,正在不断揭示新的基因组织方式和调控规律,并将持续提高未来预测模型的准确率。

整篇评论最后一句其实点出了全文真正想表达的中心思想。

过去几十年,整个基因组时代关注的是 Sequencing Whole Genomes(测完整个基因组);未来真正的重要任务将变成 Understanding Whole Genomes(理解整个基因组)。前者属于数据获取的问题,后者属于知识生成的问题,而人工智能恰好站在这两个时代的交汇点上。

总结:

完整基因组解决的是数据缺口,个性化基因组解决的是参考偏差,人工智能解决的是知识理解。真正的竞争开始从测得出来,转向看得明白。

以前缺的是DNA,现在缺的是理解。

原文期刊:Cell
发表日期:2026年8月6日
原文标题:Filling the holes in whole genomes: A vision for personalized genomics from telomere to telomere
作者单位背景:Johns Hopkins University、Shanghai Jiao Tong University、Beijing Institute of Genomics, Chinese Academy of Sciences、Genome Institute of Singapore、University of California, Santa Cruz