Tempus AI启动百万基因组计划

Tempus怕不是疯了...

PART.01

“疯狂计划”

2026年9月11日,美国NGS+AI标杆企业Tempus AI宣布将在未来几年构建一个包含10万份全基因组并与纵向临床信息关联的研究平台。

等下,我回忆一下。

2025年3月19日,Illumina公司和NashBio宣布,Alliance for Genomic Discovery(AGD)计划已完成250,000个全基因组测序,创建了同类中最大、最全面的临床基因组数据集之一,助力加速药物靶点发现、治疗研究和临床开发。

你看,人家都已经是最大了啊。

Tempus在公告中是这么说的:

现有的人群规模基因组计划大多取自普通人群,并非旨在将基因组数据与纵向疾病和治疗结局关联。

该项目的工作将创建首个围绕疾病人群和患者结局构建、专门为人工智能驱动研究优化的去标识化多模态全基因组测序(WGS)数据集。

简而言之,Tempus想要建立的是一个专门为AI研究打造的、多模态的、跟疾病高度关联的WGS数据集。

呃,还得是最大的。

所以,该数据集完成后,Tempus 计划扩展该工作,目标是达到100万份基因组。

好家伙,那确实是最大了。

研究人员可在此访问基因组信息以及临床病史、影像、病理和患者结局,可以使AI 研究人员更好地理解疾病并开发新的 AI 赋能洞察。

难道,Tempus也想做AI掘金时代的“卖水人”?

说实话,Tempus早就是“卖水人”了。

只不过这次,他要做的是先去“建新水厂”再卖水。

PART.02

“吞金巨兽”

我们从这份公告里面获得了3个重要信息:

第一,靶向数据已经不足以支撑AI模型的训练。

我们必须明白,Tempus已经累积了巨大的靶向测序数据。

这张图是2025Q4 Tempus给出的,当然他们做了夸张。

比如35万例DNA+RNA数据中的DNA数据大部分是中小Panel,最多有部分全外显子数据。

如果是WGS数据,那Tempus还费个什么劲?

第二,强调多模态数据既是Tempus对技术的尊重,也是对自身资产的待价而沽。

Tempus一直在强调这是一个多模态的数据集,Tempus手里就握有大量的患者医学影像记录、临床诊断、用药、终局的记录,再把患者的DNA翻出来做个WGS相对简单。

而其他的公司要反过来用患者的信息去找对应的影像记录、诊断记录等就不那么简单了。

第三,AI4S是个吞金巨兽。

在今天,WGS数据生成已经非常廉价了。

一个30x的人类基因组(简单理解就是把人类基因组测个30遍)大概90 Gbase,在中国大约100美元左右就能搞定,美国可能贵点,贵多少咱就不敢多说了。

毕竟,Tempus手里还有庞大的Illumina测序仪存量,让他换华大智造、真迈或者Ultima不太现实。

但是,AI4S模型的训练依然不能只看WGS测序端的这一点费用。

存储,一个panel的数据可能就占用1GB的存储,而WGS数据则要数十倍于此。

计算,想想一个WGS数据做mapping、variant calling的开销...在这期间产生的中间文件又是海量。

另外,只有NGS数据是不是不太够?要不要上个长读长测序做个补充?(PacBio狂喜)

而且,我们还没有算其他模态数据的开销、多模态联合训练的开销...

总之,AI4S就是一个吞金巨兽啊...这还只是生命科学领域的一个切面而已...

PART.03

利好了谁?

没想到Tempus在AI时代最核心的卡位是对多模态数据的掌握,如果Tempus声称的信息是准确的,那它确实握有开启多模态AI4S高阶模型的一把重要钥匙。

而今,他要通过百万例WGS数据让这把钥匙更难替代。

我有预感,如果这条路能够走通,Tempus后续对于数据的渴求会更加强烈。

什么单细胞、蛋白组,通通都要安排上。

利好10x Genomics,利好Quanterix、Alamar。

咦,这些Illumina不是都有么?最利好Illumina啊。

免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。

举报

评论

  • 推荐
  • 最新
empty
暂无评论