清华崔鹏:Sora不是世界模型,不能反事实的只能叫worldmap|世界模型50人
外国人不能搞的,中国人也能搞。
作者:杨诗涵
编辑:林觉民
七年前,ICML的讲台上,崔鹏独自面对近千双眼睛。
台下八九百人挤满了巨大的会议厅,四个巨幅屏幕横排铺开。那是他第一次站上如此规格的讲台,连手中那支激光笔该指向哪一块屏幕都拿不准。“我是头一次在这么大的空间里做tutorial。”这位清华大学计算机系的长聘副教授后来向左林右狸回忆时说。
正是这场两个半小时的演讲,在因果智能的编年史上刻下了一道清晰的分水岭。
在此之前,用因果的思想改造机器学习这一方向,在学界几乎处于腹背受敌的境地。
人工智能圈对它不关注,传统因果圈对它的范式不认可。崔鹏团队的论文投一篇被毙一篇,只要标题上出现“causal”二字,就会被送到传统因果推断审稿人手中,对方从定义上便判定这不属于“真正的因果”,连讨论的余地都不给。
逼到绝境,他们只能换一种策略。论文里保留因果的魂,但不冠因果的名,改叫“causality-inspired stable learning”,把审稿人换成关心泛化问题的那批人,此后才渐渐逆转局面。
传统深度学习,做的是关联拟合。例如训练数据里狗大多出现在草地上,模型就把草地和狗牢牢绑定,如果环境换成房间,就很难识别出来。崔鹏团队要剥掉这类虚假相关,方法来自因果推断中的potential outcome框架:算法自动给高频出现的样本降权,给低频样本升权,当出现在草地上的狗和在其他环境里的狗比例差不多时,狗和草地的关联会被抹掉,只剩下狗的眼睛、鼻子、耳朵这些本质特征。
崔鹏将他的成果带进了ICML这场tutorial。他讲了两个半小时,提问又持续了半个多小时,台下气氛热烈到近乎亢奋。散场之后,命运的齿轮开始转动——Nature Machine Intelligence的编辑当场约他聊了半小时,请他撰写一篇perspective paper(观点论文)。
对崔鹏而言,这条“冷板凳”,终于焐热了。因果智能从边缘地带,被正式推入了主流视野的聚光灯下。
崔鹏并没有停步于此。2023年,受到ChatGPT横空出世的启发,他带领团队开始探索通用因果智能之路。将稳定学习、结构因果模型等因果思想与大模型预训练技术相结合,研发并开源了国内首个、国际领先的结构化数据通用大模型LimiX,一个能够洞悉数据背后因果的能力模型。LimiX构建的是数据空间的结构化世界模型,可广泛应用于电力、钢铁、石化等泛工业和AI4Science场景,可干预、可反事实、可验证。
这是继“稳定学习”后,崔鹏再次提出一个新的方向,这次的名字更加响亮和雄心勃勃:数据大模型(Large Data Model,简称LDM)。崔鹏判断,要想推动和引领LDM方向的发展,离不开巨大的资源投入。也因此,他联合创立了稳准智能。
中国科学院院士张钹给出了一个极具分量的判断:LimiX的成功,让中国正在实现从大语言模型(LLM)的并跑,到数据大模型(LDM)领跑的跨越。
这种跨越的意涵远比一句口号沉重。过去几十年,中国在基础软件、底层框架、核心算法上始终扮演追赶者的角色,但这一次,在结构化数据这一赛道上,中国第一次占据了领跑位。
崔鹏认为,LDM的价值在结构化数据,必须和行业深度绑定。“全世界真正的工业化国家没有几个,只有中国拥有完整的重工业和轻工业。美国想把重工业搬回去,几代人也做不到。美国押注大语言模型,本质上是它脱实向虚太久,要靠消费互联网弥补短板。但人工智能最大的价值空间,在中国一定在实体经济。美国在LDM这条路上没有声响,不是技术不行,是没有场景,也没有动力。”
他引了钱学森的话:外国人能搞的,难道中国人不能搞?我希望以后能再加一句——外国人不能搞的,中国人也能搞!
在对话中,崔鹏还对世界模型提出自己的判断。在他看来,Sora并不是世界模型,其沿袭的仍是语言模型的逻辑,依赖于海量数据中的相似样本,本质是关联拟合,不具备反事实能力,而后者恰是世界模型的核心所在。
他的判断标准有三:世界模型无大一统之说,一是必为领域特定,二是在该领域内须具通用性,三是必能支撑干预与反事实操作。“三者缺一,都只能称作world map,而不是world model。”
以下是左林右狸与崔鹏的对话,在不改变原意的前提下进行了编辑整理。
01 把causal从标题里拿掉,那条冷板凳焐热了
左林右狸:2016年,你把因果思想带进机器学习。说句实话,那两年正是深度学习最风光的时候,主流叙事是数据越多、算力越大,智能就越强。你把方向押在因果这个非主流上,最初的处境是什么样的?
崔鹏:非常孤独,可以说到腹背受敌。在人工智能领域,大家那会儿对因果完全不关注;而在因果领域,正统做因果识别理论的人也不认我们,觉得你们这不叫真正的因果。我们投一篇就被毙一篇,只要题目上出现causal,就会落到搞因果的人手里,他们不认可我们提出的新范式。
左林右狸:这是一个非常具体的困境,标题里带causal,论文就活不过审稿。后来你把方向改叫causality-inspired stable learning,听起来像是给论文换了身衣服。这一步当时是怎么想通的?
崔鹏:原来题目里带causal,就会落到做传统因果推断的审稿人手里。他们的标准很严格,你得满足某些数学假设、符合某种范式,才算真正的因果。我们做的方向本身就不是传统因果推断,他们从定义上就把我们拒了,根本不给讨论的空间。
后来我们换了个思路。核心思想全是因果的,但我们不再叫它causal,改叫因果启发的稳定学习。题目里不带causal了,审稿人就变成了关心泛化问题、分布外问题的那批人。我们的问题是well-defined的,稳定学习的目的是什么、怎么量化评估、理论是否完备,这些都可验证。只要理论做得严谨、实验做得扎实,拒稿的理由就不充分。所以后来越来越顺,投一篇中一篇。
左林右狸:2019年,你和张潼(机器学习领域知名学者)在ICML做的tutorial,直到今天很多人回忆起来都说那是因果智能的转折点。那场演讲到底发生了什么?
崔鹏:那个场面我到现在都记得。巨大的会议厅里四个大屏横排铺开,我上去第一句话就说,我是头一次在这么大的空间里做tutorial,连激光笔都不知道该指哪块屏。我当时只有一篇ICML论文,就敢站上去,真是初生牛犊不怕虎。
现场来了八九百人,是那届ICML tutorial里人最多的。我讲了两个半小时,结束后提问环节又持续了半个多小时,大家都很兴奋。Nature Machine Intelligence(《自然·机器智能》)的编辑就在台下,听完直接约我聊了半小时,邀请我写一篇perspective paper。那一刻我知道,这个方向立住了。
左林右狸:这场tutorial为什么是转折点?你当时最想表达的核心观点是什么?
崔鹏:我一直在表达一个观点:causal是一个方向,不是有道门槛迈过去才算causal,而是往那个方向走的过程都应该算。稳定学习本质上是在让机器学习的过程逐渐贴近因果规律。它不是传统因果推断,但它是在往causal的方向带。
如果一直把causal定义成一扇窄门,只有进去才算,那这个领域很难发展起来。没有任何一个领域是这样定义自己的。你做的是不是机器学习?你做的是不是数据挖掘?没有人会这么问,但因果领域很原教旨主义。这恰恰是因果一直打不开局面的原因。那场演讲相当于帮大家破除了一个心理障碍:原来觉得因果有个守门的不敢冲,现在敢冲了。
左林右狸:你说过一句话,因果是自然科学的终极问题。这个判断从何而来?你做的因果智能,和传统的因果推断是一回事吗?
崔鹏:如果因果的问题得到终极解决,自然科学就没了。物理、化学、生物,所有学科不都是在找因果吗?哲学上,休谟、亚里士多德都讨论过因果的存在性问题。而且大部分真实场景下,因果是没有标准答案的。严格意义上,吸烟导致肺癌到现在都没有严格的因果结论,你没法排除存在一个未知基因,有这个基因的人既倾向于吸烟又倾向于得肺癌。
所以我们不纠结什么是真正的因果,这个话题的讨论已经有几千年,争论不清。我们做的是因果智能,把因果的思想用到AI里,解决智能问题。智能问题是可测的、可量化的,比如能不能提升泛化能力?能不能提升举一反三的能力?能不能让模型更可解释?它管用就行。
02 大模型本质上是在刷题,Sora不是世界模型
左林右狸:聊完坐冷板凳的来路,我们想跟你聊当下最热的几个词。主流叙事是数据够多,智能就会涌现,但你有个流传很广的判断:大模型本质上还是在刷题。这个判断是怎么来的?
崔鹏:两个小孩都考了100分,一个靠刷题刷出来的,一个作业都不做也能考100分,差在聪明程度。聪明就是看它的分布外泛化能力,比如做三道题,能不能解十道题。大语言模型学会说人话,用了70%的全互联网数据,人类需要这么多吗?显然不用。因此大模型本质上还是在刷题,算力和数据消耗巨大,它的智能和终极意义上的高级智能还有很大差距。
左林右狸:这个比喻很扎心,能展开讲讲吗?此前清华丘成桐班的舆情事件里也出现了刷题这个词。
崔鹏:大语言模型的设计目标就是在独立同分布下做到最好,假设训练和测试数据来自同一个分布。要在整个语言领域做到通用,唯一的办法就是在训练阶段把所有可能性都见到,这本质上就是刷题。最近你提到的舆情事件,本质上也是这么回事,题库已经被刷烂了,它并不能内化成孩子的内在能力。
但现在更关键的问题是,物理世界具备不具备刷题的可能?我认为不存在。物理空间的数据本身就不是有限空间,可获取性又极差。你不可能像爬取互联网文本一样,把工厂里的结构化数据都扒出来。所以这条路在物理世界根本走不通。
左林右狸:和刷题一样被滥用的,还有世界模型。视频生成叫世界模型,模拟器也叫世界模型,很多投资人的BP(商业计划书)里都这么写。在你看来,这个词被滥用了吗?
崔鹏:肯定被滥用了。世界模型的核心是什么?是反事实(counterfactual,对没有发生的事情做假设推演)。每个人内心都有一个世界模型:如果我今天上班没迟到,会是什么情况?这种反思和推断会优化下一步决策。科学做的也是这个事。
反事实是因果的第三层境界。因果第一层是关联(Association),第二层是干预(Intervention),第三层就是反事实。如果一个声称是世界模型的系统没有任何反事实的设计,它怎么能叫世界模型?比如,Sora肯定不是真正的世界模型,它也是用大量数据去找相似案例,跟大语言模型是一个路径。
左林右狸:那在你心里,什么才配叫世界模型?我们注意到,你很少正面给定义,而是更习惯给判断标准。
崔鹏:我给不出一个严格的定义,但我心里有判断标准。第一,世界模型不存在大一统,一定是领域特定的,生物医学领域的世界模型、材料领域的世界模型,你得这么定义它。第二,它在这个领域里必须具备通用性。第三也是最本质的,它必须支持干预和反事实操作。否则它不能叫world model,只能叫world map,做了个世界描述而已。World model最早来自认知心理学的概念,人心里那个可以做反思的模型才叫world model。所以如果只是做关联拟合,哪怕把现有数据全描述出来了,也不是世界模型。
(注:打个比方,World map是一张画好的世界地图,标注了已知的一切,但它不能回答如果我在这个路口右转会怎样;world model则是一个能推演、能试错的模拟器,回答的是如果……会怎样。Sora能生成逼真的画面,本质是检索相似片段拼出看起来对的下一帧。它不干预世界,也没有反事实能力,所以在崔鹏的标准里,它是更精致的地图,不是世界模型。)
左林右狸:顺着世界模型再聊远一点:因果智能和AGI(通用人工智能)是什么关系?它是终局,还是路标?
崔鹏:我觉得因果智能更底层。如果因果智能实现了,具备关联、干预、反事实这三重能力,你在任何一个领域都可以很快构建出该领域的世界模型。它是一个基础的技术路径。
03图灵奖得主想借他的学生都没成功
左林右狸:顺着刚才聊到的路径之争,我们想跟你聊一件2018年的事。据说图灵奖得主Yoshua Bengio来清华访问,看了你的工作后,专门写信想邀你送学生过去,共同推动他正在酝酿的那个方向。当时为什么没答应?
崔鹏:2018年Bengio来清华,我给他介绍了因果和深度学习结合的工作,他很感兴趣,写邮件让我把学生送过去,共同推动这个方向。但我们那会儿有个想法:这是中国人自己提出的方向,我们能不能自己立得住、推出去?所以有些小小的私心,没送学生去。后来2019年Bengio提出了Causal Representation Learning的概念。我觉得他对因果的理解角度和我们还是存在差别。
左林右狸:坦率讲,听到你说Bengio对因果的理解有偏差,我们挺意外的。毕竟他的出发点和你很像,都把分布外泛化列为深度学习的头号问题。
崔鹏:出发点确实很像。他主页上列过深度学习最亟待解决的三个问题,首位就是分布外泛化(模型在没见过的数据环境里依然表现良好),跟我们2017年提稳定学习的初衷完全一致。差别在路径。他是做representation learning(表征学习,让模型把原始数据抽象成语义特征的学习范式)出身的,想把因果思想融进表征学习里,先学一个表征空间,再在里面发现因果结构,这当然是更ambitious的一个目标。
但这里有个根本性的卡点:学到哪一层,因果结构才会涌现?在像素层面定义因果是不可能的,你不能说哪个像素是哪个像素的因。往高抽象到物体层面,可能可以。问题是,你不知道抽象到哪一层才存在因果结构。这在因果里有一个分支叫causal emergence(因果涌现),至今没有大家公认的度量标准。所以从表征学习角度做因果,在解决真实问题中很难判断。
左林右狸:聊到这里我们有个直觉:是不是正因为你选的方向长期边缘,反而让你的组形成了不一样的气质?我们听说你带学生的风格也和很多组不太一样,学生一年发论文不超过两篇,几乎是逆着KPI的水流游泳。
崔鹏:对。我们组一年发大几十篇是不可能的。我招学生时就讲清楚风格,你如果只想发论文、刷KPI,可能不太适合我们。我们更关注定义新问题,而不是解别人定义好的问题。我常说,最聪明的人都在清华,如果大家都不做从0到1的事,那指着谁去做?
左林右狸:那你当年是怎么选到因果这个方向的?组里的学生具体在做哪些任务?
崔鹏:我们的策略是选企业非常关注、但学界不关注的方向。这样问题真实存在,企业有诉求,国内又没人做,他们只能找我们合作。我们组十几个学生,十几个企业项目,全是研究类,不做工程开发。**、腾讯、美团都是这种合作模式。某公司当时一年给我们三五百万,我们投论文之前把算法给他们讲清楚,算法他们直接拿去用。我们一个算法,给他们几个产品线提升了2.7%,这是什么概念呢?他们内部提升1‰,就算显著。
04 30个工艺参数压到5个,把因果带进工厂
左林右狸:聊到这里我们想问问你做的事到底做到了什么程度。先从名字开始吧,你的公司叫稳准智能。我们内部讨论这个名字的时候有个直觉:稳字放在准字前面,是不是藏着你对AI最重要的一个判断?
崔鹏:公司的名字叫稳准,原来的标签就是Stable Learning,稳嘛。但稳和准我们都想要,所以叫稳准。后来开玩笑说,我们稳准不狠,稳准(技术向)我们负责,狠不狠看国家怎么落地应用。稳指的就是泛化能力,在一小部分数据里学出来的模型,能不能在更复杂的环境下稳定表现。某种程度上,我认为稳比准还重要。
左林右狸:稳到底是怎么做到的?你能举一个具体的例子吗?
崔鹏:我用狗的识别来说明。现在的深度学习模型,如果训练数据里大量狗都在草地上,模型见到草地猜是狗的概率就会高,因为模型学到了草地和狗之间的强相关。这本质上是拟合数据分布,一旦换了环境,比如狗进了房间,它可能就不认识了。
稳定学习的核心思想是样本重加权,这个概念来自因果推断里的potential outcome框架(潜在结果框架,比较干预与不干预两种情形下结果差异的一套因果推断理论)。具体怎么做?训练数据里草地上的狗出现很多次,算法会自动把它们权重降下去;不在草地上的狗样本少,权重会提上来。最后,草地出现与否和狗标签之间就没了关联。剩下和狗这个标签强相关的,只有狗的眼睛、鼻子、耳朵这些本质特征。所以不管把狗放在草地上、房间里还是月球上,模型都能认出来。
人不就是这样吗?人从来不会对高频出现的东西给很多注意力,反而会对没见过的东西多看几眼。这就是为什么人能抓住本质特征,也是稳定学习能让模型在极少数据下依然聪明的秘密。
左林右狸:你们推出的产品叫LimiX(中文名极数),是一个面向结构化数据的通用大模型。它跟LLM最大的区别是什么?又跑到什么程度了?
崔鹏:我们是一横三纵的策略。一横是Limix Inside,像Intel Inside一样,只做基座芯片,赋能千行百业,合作伙伴做行业方案。三纵是电力能源、石油石化、钢铁冶金,这三个板块我们做标杆工程。现在已经在谈成为国网、中石油的行业大模型基座。
2025年8月,LimiX作为国内首个面向结构化数据的通用大模型开源。与LLM不同,它不靠真实文本喂养,而是在结构因果图生成的合成数据上预训练,学会分类、回归、缺失值填补、因果发现等任务,跨场景使用时几乎无需重新训练。2026年6月,稳准智能与腾讯云签署战略合作,LimiX正式进入腾讯云异构计算与AI训练平台的核心供应链。据团队披露,签约前数月,LimiX已在60多个真实场景完成部署,在电力、钢铁、石化三大行业的实测中,七成以上任务的表现超过原有专用模型;到7月的世界人工智能大会上,这一进度更新为800余个结构化数据场景的通用性验证。
左林右狸:能具体讲讲效果吗?说心里话,我们最想知道的是,它到底解决了什么以前解决不了的问题?
崔鹏:我举两个例子。一个是钢铁冶金,中钢研要研发特种钢,原来要调30个工艺参数,调一次炼一炉钢,成本几十万。我们用他们历史上100多个样本,锁定了5个因果性因子。这5个参数调优的结果能达到30维调优的97.3%,研发成本降低70%以上。我们还请了8位冶金专家做评测,因果性满分5分,我们的方法选出的参数达到4.2分,传统相关方法连2分都不到。
另一个例子是电价预测,我们的模型已经超过交易员水平,铺到了17个省做电力现货交易。
(注:这两个数字为什么重要?过去在钢铁这类场景,通常AI的做法是一个工厂训一个专用模型,数据少、成本高、换个产线就失效。崔鹏的LDM在100多个样本上就敢开箱即用的优化工艺参数,靠的不是数据多,而是先锁定哪个参数真正影响钢材性能这一层因果。一次试错就是一炉钢、几十万元的成本,能少试错,本身就是钱。)
左林右狸:这套逻辑能复制到别的行业吗?我们听说生物医药领域你们也已经在做了。
崔鹏:对,生物制药也是一样。我们2024年跟国家蛋白质中心贺福初院士(中国科学院院士、蛋白质组学领域领军科学家)团队合作,在蛋白质组学里找重大疾病的生物标志物,逻辑完全相通:哪些蛋白质是最具因果意义的因子。发完那篇文章后,好多搞AIDD(人工智能药物发现与设计)的人都来联系我们。这类问题本质上就是从海量组合里锁定关键的因果因子。
左林右狸:这个赛道上,你们有多少对手?
崔鹏:国内我们是唯一的。国际上四家,Priorlab(被SAP收购)、法国的TabICL(INRIA,巴黎国立计算机与自动化研究所)、美国的Kumo(被英伟达收购),亚马逊去年也发布了一个。技术能力上我们在第一梯队。用真实工业数据测,我们商业化的版本比国际竞对有身位级的领先。
05 外国人不能搞的,中国人也能搞
左林右狸:最后聊聊格局。前面我们听你反复说中国的机会来了,这个判断的具体依据是什么?
崔鹏:LDM作为通用因果智能的集大成者,发挥最大作用的地方是结构化数据,这必须和行业深度结合。中国的工业门类最完整、数字化条件比欧美强得多。全世界真正的工业化国家没几个,只有中国有完整的重工业和轻工业。美国想把重工业搬回去,几代人也做不到。所以因果智能在应用层面,中国有绝对的非对称优势。
左林右狸:那美国为什么押注大语言模型,而不是LDM?我们这次采访里听到一位大公司高管类似的判断:他们本质上是想用消费互联网的方式补短板。这和你看到的美国底层结构一致吗?
崔鹏:美国打了一张牌叫大语言模型,本质上是因为它脱实向虚已经很长时间了,要通过消费互联网的模式来弥补其他方面的不足,这和它的国民经济结构是匹配的。但中国国民经济结构不是这样,人工智能最大的价值空间在中国一定是在实体经济上。美国为什么在LDM这条路上没有声响?不是技术不行,是没有场景,也没有动力。
中国要引领第四次工业革命,也得出一张牌。我们觉得LDM很有机会。把中国的产业优势和技术优势结合起来,输出LDM的中国方案,美国大概率接不住,因为它不具备发挥LDM优势的条件。
左林右狸:我们注意到,中国科学院院士张钹给出一个分量很重的判断:LimiX让中国正在实现从大语言模型(LLM)并跑到数据大模型(LDM)领跑的跨越。你自己怎么看待这个判断?
崔鹏:张先生的这个判断分量极重。过去几十年,中国在基础软件、底层框架、核心算法上一直扮演追赶者的角色。但这一次,在结构化数据这一赛道上,中国第一次占据了领跑位。这种跨越远比一句口号沉重,它意味着人工智能在结构化数据领域长期存在的低效模式正在被终结。
左林右狸:最后一个问题。你引用过外国人能搞的,难道中国人不能搞这句话。放在今天,你想给它补一个下半句吗?
崔鹏:这句话出自钱学森先生(两弹一星元勋、中国航天事业的奠基人),当年他面对中国人能不能搞导弹的提问,回答是外国人能搞的,难道中国人不能搞?我希望以后能再加一句:外国人不能搞的,中国人也能搞。
写在最后
和崔鹏对话,我们印象最深的是关于“窄门”的比喻。因果曾被看作一扇只有守门人认可才能进的窄门,可崔鹏偏说,因果不是一个点,而是一个方向;稳定学习不必叫causal,却可以一步步朝因果走。
这个判断放在今天格外有意味:当大模型靠海量数据把关联拟合做到更好,真正难的是干预、反事实,是在“如果……会怎样”里推演下一步。他因此说Sora不是世界模型,只是world map;也因此把LDM带进钢铁、电力、石化这些真实场景。
崔鹏将愿望表达地很直接。“外国人能搞的,中国人也能搞”,他还想再加半句,外国人不能搞的,中国人也能搞。热词年年换,冷板凳不常有人坐。从ICML讲台上那支不知该指向哪块屏的激光笔,到稳准智能的LimiX,他一直在做同一件事:把没人看好但有价值的方向,推到聚光灯下。
我们欢迎所有能为左林右狸提供新观点新角度新信息的群友,加入我们的实名制社群,与左林右狸一路同行。管理员微信号:leiphonelinli,备注公司-职位-称呼通过更快。
相关视频
往期推荐
深访“清华具身五杰”赵昊:李飞飞和杨立昆路线都不够,4D才是王道
具脑磐石朱森华:仅有海量数据堆不出像人一样聪明的机器人|世界模型50人
我所知道的张磊:一场MSRA赛马与半个中国AI江湖
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。


