Tempus AI启动百万基因组计划
Tempus怕不是疯了...
PART.01
“疯狂计划”
2026年9月11日,美国NGS+AI标杆企业Tempus AI宣布将在未来几年构建一个包含10万份全基因组并与纵向临床信息关联的研究平台。
等下,我回忆一下。
2025年3月19日,Illumina公司和NashBio宣布,Alliance for Genomic Discovery(AGD)计划已完成250,000个全基因组测序,创建了同类中最大、最全面的临床基因组数据集之一,助力加速药物靶点发现、治疗研究和临床开发。
你看,人家都已经是最大了啊。
Tempus在公告中是这么说的:
现有的人群规模基因组计划大多取自普通人群,并非旨在将基因组数据与纵向疾病和治疗结局关联。
该项目的工作将创建首个围绕疾病人群和患者结局构建、专门为人工智能驱动研究优化的去标识化多模态全基因组测序(WGS)数据集。
简而言之,Tempus想要建立的是一个专门为AI研究打造的、多模态的、跟疾病高度关联的WGS数据集。
呃,还得是最大的。
所以,该数据集完成后,Tempus 计划扩展该工作,目标是达到100万份基因组。
好家伙,那确实是最大了。
研究人员可在此访问基因组信息以及临床病史、影像、病理和患者结局,可以使AI 研究人员更好地理解疾病并开发新的 AI 赋能洞察。
难道,Tempus也想做AI掘金时代的“卖水人”?
说实话,Tempus早就是“卖水人”了。
只不过这次,他要做的是先去“建新水厂”再卖水。
PART.02
“吞金巨兽”
我们从这份公告里面获得了3个重要信息:
第一,靶向数据已经不足以支撑AI模型的训练。
我们必须明白,Tempus已经累积了巨大的靶向测序数据。
这张图是2025Q4 Tempus给出的,当然他们做了夸张。
比如35万例DNA+RNA数据中的DNA数据大部分是中小Panel,最多有部分全外显子数据。
如果是WGS数据,那Tempus还费个什么劲?
第二,强调多模态数据既是Tempus对技术的尊重,也是对自身资产的待价而沽。
Tempus一直在强调这是一个多模态的数据集,Tempus手里就握有大量的患者医学影像记录、临床诊断、用药、终局的记录,再把患者的DNA翻出来做个WGS相对简单。
而其他的公司要反过来用患者的信息去找对应的影像记录、诊断记录等就不那么简单了。
第三,AI4S是个吞金巨兽。
在今天,WGS数据生成已经非常廉价了。
一个30x的人类基因组(简单理解就是把人类基因组测个30遍)大概90 Gbase,在中国大约100美元左右就能搞定,美国可能贵点,贵多少咱就不敢多说了。
毕竟,Tempus手里还有庞大的Illumina测序仪存量,让他换华大智造、真迈或者Ultima不太现实。
但是,AI4S模型的训练依然不能只看WGS测序端的这一点费用。
存储,一个panel的数据可能就占用1GB的存储,而WGS数据则要数十倍于此。
计算,想想一个WGS数据做mapping、variant calling的开销...在这期间产生的中间文件又是海量。
另外,只有NGS数据是不是不太够?要不要上个长读长测序做个补充?(PacBio狂喜)
而且,我们还没有算其他模态数据的开销、多模态联合训练的开销...
总之,AI4S就是一个吞金巨兽啊...这还只是生命科学领域的一个切面而已...
PART.03
利好了谁?
没想到Tempus在AI时代最核心的卡位是对多模态数据的掌握,如果Tempus声称的信息是准确的,那它确实握有开启多模态AI4S高阶模型的一把重要钥匙。
而今,他要通过百万例WGS数据让这把钥匙更难替代。
我有预感,如果这条路能够走通,Tempus后续对于数据的渴求会更加强烈。
什么单细胞、蛋白组,通通都要安排上。
利好10x Genomics,利好Quanterix、Alamar。
咦,这些Illumina不是都有么?最利好Illumina啊。
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。


