人类基因暗物质地图集开张:Google DeepMind用AI算完90亿种DNA拼写错误,但科学家说先别激动!
你身体里那本30亿字母的“天书”,Google DeepMind刚用AI替你翻了一遍!
2026年9月8日,Google DeepMind正式上线AlphaGenome Atlas——一个用AI预计算了人类基因组中全部90亿种单核苷酸变异(SNV)分子影响的数据库。规模达1PB,比AlphaFold数据库大30倍以上。免费向学术界开放。
听起来像是“基因版Google Maps”,输入一个DNA字母的改动,立刻告诉你这个改动在哪个组织、哪个细胞里会捅什么娄子。
但事情没那么简单。
上线当天,Hacker News的评论区就炸了锅。一位用户 bluntly 指出:“圈内人都知道,AlphaGenome和此前的SOTA模型Borzoi相比,基本零提升。”
这就怪了。一个登上Nature封面的模型,一个被DeepMind副总裁称为“人类基因组高分辨率地图”的工具,怎么在实战派眼里就成了“换皮产品”?
答案藏在两个字里:数据库 vs 模型。
你查的是“地图”,不是“实时导航”
AlphaGenome Atlas本质上是个预计算好的数据库。DeepMind团队把AlphaGenome AI模型跑了一遍,算出90亿种单字母变异的调控影响,然后把结果存起来——1PB的数据,供人查询。
而Borzoi是一个模型。你给它一段DNA序列,它现场算给你看。
区别在哪?打个比方:
Borzoi像个现炒的厨师——你点菜,他现做。AlphaGenome Atlas像个预制菜超市——所有菜已经做好冷冻起来,你直接拿就行。
DeepMind自己承认:此前约9000名研究人员通过API访问AlphaGenome模型预测,但“需要写代码”对很多生物学家来说是道门槛。所以干脆把所有可能的结果全算好,做成一个不用写代码、开浏览器就能查的网站。
这个策略很聪明。AlphaFold数据库已经证明了“预计算+免费开放”的威力——2亿多个蛋白质结构预测,被全球数百万用户访问。
但问题来了:预计算的结果,可信吗?
90亿个预测,没一个是实验验证过的
Nature新闻稿里埋了一句关键的话:“它不会取代实验。”
DeepMind自己也写得明明白白:AlphaGenome没有被验证或批准用于临床。
这不是谦虚,是事实。
一篇2026年7月发表的预印本研究做了一个实验:对一种最简单的病毒,逐点突变它的DNA,然后看各种AI模型的预测准不准。结果呢?“各种专门的AI模型都做出了糟糕的预测”。病毒比人类简单得多,预测都翻车,何况人类基因组?
另一项独立研究发现了更具体的问题:AlphaGenome在预测“个人基因组基因表达变化”时表现拉胯。具体数据:基因表达预测的平均Pearson R只有0.151,而Borzoi是0.058——看起来AlphaGenome更好,但距离“可用”还差得远。而在染色质可及性预测上,AlphaGenome能做到R=0.627,Borzoi只有0.448。
同一个模型,预测染色质可及性挺准,预测基因表达就不行。研究者管这叫“模态差距”。
模型强不强,取决于你问它什么问题。
单碱基分辨率?Borzoi是32碱基bin
AlphaGenome最引以为傲的卖点是“单碱基对分辨率”。Borzoi的空间分辨率是32个碱基对。AlphaGenome的输入窗口是100万个碱基对(1 Mb),Borzoi是524 kb。
听起来AlphaGenome完胜。
但Nature上那篇论文的摘要写得很微妙:“AlphaGenome在26项变异效应预测评估中的25项中,匹配或超过最强的现有外部模型。”
“匹配或超过”——不是“碾压”,不是“颠覆”,是“匹配或超过”。
伦敦国王学院的Xianghua Li博士说得更直白:“单独看每一项预测,这个AI的表现和现有最佳工具一样好,但没有更好。”
Science Media Centre的专家反应中,多位科学家表达了类似观点。
这让人想起AlphaMissense——DeepMind之前那个预测错义突变致病性的模型。有研究者批评它“只发布了覆盖部分混淆矩阵的指标”,“假阴性率?那东西对变异效应预测模型怎么可能重要嘛”——讽刺。
但它确实帮人找到了致病突变
别急着下结论。AlphaGenome Atlas有两个真实案例,值得认真对待。
案例一:罕见病
Broad Institute的Laura Covill团队接手了一个长期未确诊的罕见病案例。他们用AVI评分(AlphaGenome Variant Impact,一个把数千种预测浓缩成单个数字的指标)筛了一遍变异。AVI锁定了一个DNM1基因上的变异,预测它会创造一个错误的剪接位点。这个线索成了破案的关键证据。
案例二:复杂性状
Dr. Gareth Hawkes用AlphaGenome Atlas分析了UK Biobank 54000多人的数据。按预测的分子效应把变异分组后,他多发现了22%的非编码遗传关联。盯住top 1%的高影响变异,他找到了19个与BMI相关的基因区域。
两个案例说明一件事:这工具能帮人更快地提出好问题。它不是来回答问题的,是来帮人找到该问哪个问题的。
1PB数据免费开放,但商业用途不行
AlphaGenome Atlas通过网站门户和API免费向学术界开放。DeepMind产品经理Dhavi Hariharan说:“能不能给我一个分数,告诉我这个变异值不值得深挖?”——这是API用户的高频需求。于是他们做了AVI评分。
但商业用途不行。有Hacker News用户直言:“作为股东,我受够了DeepMind一直在搞免费赠送。”另一位用户回怼:“是啊,别管能改变生命的医学研究了,先想想投资者的财务回报行吗?”
这场争论不会消失。DeepMind的算力成本是天文数字,1PB数据的存储和维护也不便宜。免费模式能持续多久,是个悬而未决的问题。
缺少模型权重,没法自己调
另一个被反复提及的硬伤:AlphaGenome的模型权重和代码没有完全公开。
这意味着:你没法在自己的数据上重新训练它,没法针对特定问题微调它,没法把它集成到自己的分析管道里做定制化改造。
你只能用DeepMind给好的那套预测。
Borzoi在这方面更开放。虽然Borzoi也是个庞然大物,但研究社区可以拿到模型,自己跑、自己改、自己验证。
“黑箱”和“白箱”的差别,在科学界从来不是小事。
所以,这到底是不是大新闻?
Hacker News上那个说“零提升”的用户,说得不完全对,也不完全错。
对的地方:AlphaGenome在预测精度上确实没有质的飞跃。它是在Borzoi、Enformer这些前代模型的基础上做了改进,不是从零到一的突破。伦敦国王学院的Li博士说得很清楚:“从科学角度看,这个模型没有揭示关于基因或生物学的新发现。”
不对的地方:AlphaGenome Atlas不是模型,是数据库。把预测结果预计算好、打包成1PB、做成不用写代码就能查的网站——这件事本身是有价值的。
Francis Crick研究所的Robert Goldstone博士的评价或许最平衡:“AlphaGenome代表了基因组AI领域的一个重大里程碑。这种分辨率,特别是在非编码DNA上,是一项突破,把技术从理论兴趣变成了实用工具。”
但他也补了一句:“AlphaGenome不是解决所有生物学问题的魔法子弹。”
比起“准不准”,更要问“用来干什么”
回到最本质的问题:你用AlphaGenome Atlas来干什么?
如果你是做罕见病诊断的临床研究员:AVI评分能帮你从海量变异中快速筛选候选者。Broad Institute的案例证明了这一点。但你最终还是要用实验验证。
如果你是做复杂性状遗传学的:AlphaGenome Atlas能帮你发现更多统计关联。但关联不等于因果。
如果你是做基础生物学的:这个工具能帮你生成假设、优先安排实验。但它不会替你回答“这个基因到底怎么工作”。
如果你是患者或临床医生:DeepMind自己说了——AlphaGenome没有被验证或批准用于临床。AVI分数暂时进不了诊断流程。
AlphaGenome Atlas真正改变的是工作流程,不是科学认知。
它让一个原本需要写代码、调API、等结果的过程,变成了“打开浏览器、输入变异、看分数”。UCSD的Jonathan Sebat教授说得很直白:“我们自己实验室的工作流可以大大简化,因为我们什么都不用算了,直接查就行。”
这就像一个天文学家,以前每次想看星星都要自己磨镜片、组装望远镜;现在有人把哈勃望远镜拍好的照片全存成一个数据库,你打开电脑就能看。
你看到的还是那些星星,但你看到的速度不一样了。
而速度,在科学发现中,往往就是一切。