光象科技吕尧:世界模型不能只做预测,要读懂动作因果
VLA和世界模型短期必然融合。
作者:张进
编辑:林觉民
近一年,世界模型赛道站满了人:Google 用 Genie 做视频预测,李飞飞(ImageNet 创始人、斯坦福大学教授)带着 World Labs 押注 3D 空间生成,Yann LeCun(图灵奖得主、Meta 首席 AI 科学家)坚持视觉表征路线。
三个流派,各自都不缺拥趸。
光象实验室首席科学家吕尧觉得,这些路线都还没捅破那层窗户纸。它们的训练目标,永远是“未来预测得准不准”,而不是“我提的这个动作,会把世界变成什么样”。
吕尧把这层意思概括成四个字:动作因果。
在他看来,机器人的动作不是一个普通的输出变量,而是对物理世界的干预。
围绕这个判断,光象科技提出“物理原生智能 Phi”技术路线,第一代物理原生世界模型 Phi-WM 1.0 ActEffect 也于近日发布。这套体系最巧的设计之一,是推理时把世界模型移出链路,把它对物理规律的理解“蒸馏”进极轻量的策略权重。
机器人真正上岗时,靠的是肌肉记忆,而不是每次动手前都先做一遍冗长推演。
吕尧不是空谈路线的学院派。
他是清华车辆与运载学院李升波教授(强化学习与自动驾驶领域国际知名专家)的博士研究生,与李升波教授共同设计了 Phi 这套技术体系。他还参与过清华大学极限竞速战队,那支队伍在 2025 年 Hitch Open 世界 AI 竞速锦标赛上夺得总冠军,创造了天门山赛道的 AI 赛车竞速世界纪录。
光象科技同样来头不小,这是一只拥有自动驾驶量产背景的团队:由前阿里巴巴高德技术总监张涛与李升波联合创办,清华车辆学院与人工智能学院联合孵化,成立至今累计融资数亿元,投资方包括 IDG 资本、东方富海等。张涛主导的空间感知定位技术,此前已量产落地数百万车载终端。
吕尧
近日,我们和吕尧聊了聊 Phi 到底是什么、团队怎么分层注入物理状态、又怎么用物理定律去治模型的幻觉问题。
在采访的最后,吕尧还给我们分享了上个月举行的世界人形机器人运动会内幕,他全程参与。以下是对话实录,经过不改变原意的编辑整理:
01 什么是物理原生世界模型?
左林右狸:你从什么时候开始接触世界模型?
吕尧:从2018年开始,我的主要研究方向就是强化学习和神经网络优化。世界模型和基于模型的强化学习有很深的渊源。在强化学习中,不论是无模型方法还是基于模型的方法,都会涉及对环境状态转移、动作后果和长期回报的建模。只是过去大家更多称之为“基于模型的强化学习”,后来随着World Models、Dreamer等代表性工作的发展,“世界模型”逐渐成为一个更广泛使用的概念。
现在我们进一步把这些工作指向一个更通用的目标,即构建能够理解物理世界运行规律、并服务于机器人闭环决策的模型,因此会更明确地把它放在世界模型的研究框架下。
左林右狸:初代模型已经训练完成了,就是最近发布的这一版?
吕尧:是的。不过需要区分一下:物理原生智能Phi是一套完整的模型、数据和算法体系,最近发布的Phi-WM 1.0 ActEffect,是这套体系的第一批显性成果,主要验证“时序因果驱动”和“动作后果反馈”这部分能力,并不代表第一版模型已经把Phi的全部技术模块都实现了。
左林右狸:能不能再给我们解释一下,物理原生世界模型的核心理念是什么?
吕尧:我们对“原生”的理解主要有两个层面。
第一是学习方法上,学习信号来自真实的物理交互。模型不仅要看到状态发生了什么变化,还要学习动作如何引起状态转移,以及不同动作会分别产生什么后果。
第二是设计目标上,模型从一开始就是面向物理世界的真实需求设计的。语言或图像模型主要在信息空间中工作,一次回答错误的代价相对可控;但机器人有真实的物理实体,要通过动作与环境交互。一旦判断或执行错误,可能造成任务失败、设备损坏,甚至影响人员安全。因此,物理智能要求的不只是生成结果“看起来合理”,而是准确、稳定、安全,并能够闭环完成任务。
从技术上讲,Phi有三个基本特征。
第一是状态解耦表征。我们希望区分位置、速度、姿态、力、接触等具有明确物理意义、可以测量或建立解析数学模型的显式状态,以及摩擦、材料特性、环境扰动以及图像、点云等难以直接测量或只能通过神经网络建模的隐式状态。
第二是时序因果驱动。模型要理解先有动作,动作随后改变世界状态;同时还要对动作干预敏感。比如抓一个杯子,夹爪位置偏左一点、偏右一点或者闭合时机不同,都可能导致不同结果。模型不能只会复现一条正确轨迹,还要理解动作变化与结果变化之间的关系。
第三是物理定律约束。对于人类已经掌握、能够写出解析关系的部分,我们希望把相应的运动学、动力学和几何结构直接嵌入状态的Rollout过程,而不是全部从数据中重新学习。对于图像、点云、深度等高维观测所对应的隐式状态,则使用神经网络进行学习,并在适用的模块中引入对称性、守恒性和结构保持等约束,缩小模型可能学习到的假解空间。
算法层面,我们关注长期训练的稳定性、安全约束以及持续学习中的灾难性遗忘问题。
所以,物理原生智能并不是给传统神经网络附加几条物理公式,而是从数据组织、状态表征、模型结构到训练算法,都围绕物理交互闭环来设计。
左林右狸:现在很多公司都在说自己的世界模型能够理解物理规律,你们强调的是机器人要知道自己的动作会把世界变成什么样。能不能举一个例子,讲清楚别的模型做不到、你们能做到的一件事?
吕尧:我不想绝对地说别的模型原则上做不到,更准确的区别是:模型有没有被直接训练去理解和比较动作后果。
比如在抓取一个零件时,机器人可以提出几个非常接近的动作:一个抓取位置偏左,一个夹爪闭合稍早,一个位置和时机都比较合适。从视觉上看,它们都像是一次正常抓取,但实际结果可能分别是零件滑落、发生碰撞或者稳定抓起。
传统模仿学习主要告诉模型专家采取了哪个动作。我们的 ActEffect 则进一步在相同状态下比较多个动作提案的预测后果,让模型学习哪一个提案会得到更接近成功示范的未来结果,并据此改进自己的动作。
这种机制的价值主要体现在出现偏差时。模型不只是记住“正确动作长什么样”,还接受过“动作偏一点会怎样”的反馈,因此更有机会在扰动后修正动作,也能够为失败原因分析提供依据。
02 动作的地位应该被提高
左林右狸:现在业界谈世界模型,大家更多关注预测和表征,例如视频预测、状态预测以及 Yann LeCun 的 JEPA。你们为什么会特别关注动作对未来世界的影响?
吕尧:因为我们最终要解决的问题,不只是预测未来,而是让机器人生成能够完成任务的动作。
反过来看,要生成最优动作,就必须理解这个动作会对任务结果造成什么影响。机器人的动作不是一个普通的输出变量,而是对物理世界的干预。我们把这种“动作改变状态,状态变化进一步决定任务结果”的关系概括为动作因果。
传统的视频预测或状态预测路线很有价值,可以提供世界如何演化的先验。但如果训练目标主要关注“未来预测得像不像”,而没有显式区分哪些变化来自环境自身、哪些变化由机器人动作造成,那么模型学到的可能更多是相关性,而不是可用于决策的动作效应。
像素空间还包含大量与任务关系不大的细节,比如背景纹理、光照变化等。把所有细节都预测准确,并不等价于理解了怎样抓取、怎样避碰或者怎样完成装配。
JEPA一类表征学习路线解决的是另一个重要问题,即如何从高维观测中获得更加紧凑、与真实状态相关的表示。这个方向本身没有问题,但学到表征以后,怎样让策略理解不同动作的后果、怎样据此改进动作,仍然需要进一步解决。我们希望补上的就是这一部分。
左林右狸:您刚刚讲到动作因果,而您又说模型底层是让模型真正理解世界的物理规律。动作因果和模型要学到的东西是什么关系?
吕尧:物理世界的运行规律,很大程度上就是状态如何随时间和外部作用发生变化。无论是牛顿定律、麦克斯韦方程还是伯努利定律,核心描述的都是状态的转移规律。
以最常见的动力学为例,系统当前的位置、速度、姿态以及受到的力,共同决定下一时刻状态如何变化。对机器人来说,动作就是它主动施加到系统上的控制输入。
因此,我们要学习两类关系:一类是没有机器人干预时,环境自身怎样演化;另一类是在当前状态下施加动作以后,世界怎样发生受控转移。
所谓动作因果,就是把第二类关系明确表达出来:动作是干预,状态变化及任务结果是后果。它不是独立于物理规律之外的概念,而是物理状态转移规律在机器人决策问题中的具体体现。
左林右狸:现在是不是大多数具身模型,或者说具身大脑模型、世界模型,都只是停留在动作之前的那一步?
吕尧:不能说所有模型都是这样,但很多路线确实仍然把动作放在相对次要的位置。有些模型把动作作为预测未来的条件,有些模型先预测未来,再用逆动力学或者动作头生成动作。它们能够利用动作信息,但训练目标的中心通常还是未来状态是否预测准确,而不是策略自己提出的动作会产生什么后果。
我们的区别在于,把动作后果直接作为训练策略的反馈信号。世界模型不是只负责告诉策略“未来可能是什么样”,而是要进一步评价“你提出的这个动作,会把未来变成什么样”。
左林右狸:是指大脑的思考层面吗?
吕尧:预测当然也是思考的一部分。但对具身智能来说,更关键的思考应该包含因果和反事实:为什么会发生这个结果?换一个动作会怎样?哪个变化是环境自己产生的,哪个变化是由我的动作导致的?
很多现有模型在预测方面已经做得很好,但对于这些问题还没有被充分训练。因此,与其说它们完全没有思考,不如说它们的训练目标还没有完全对准具身智能最核心的闭环需求,动作的地位还可以进一步提高。
左林右狸:你们反复强调机器人要明白“我做了这个动作,世界会变成那样”。但在工厂里面,传送带自己在转、灯光自己在闪,机器人是怎么分清“我的动作造成的变化”和“别人造成的变化”的?
吕尧:这是受控世界模型需要解决的核心问题之一。
环境中确实同时存在两类变化:一类是传送带、光照、振动等环境自身的演化;另一类是机械臂抓取、推动和接触引起的受控变化。模型需要在给定当前状态和动作的条件下,识别动作额外带来了什么影响。
我们从理论上给出了表征裕度和转移裕度两个度量标准,分别描述两个条件。表征裕度关注模型能否从高维观测中保留真正的状态信息,不被背景纹理等替代特征主导;转移裕度关注在相同或相近状态下,训练数据中是否包含足够丰富的动作变化。只有动作有充分变化,模型才有机会区分“环境本来就会这样变化”和“因为我做了这个动作才发生变化”。
03 通过物理定律约束解决模型幻觉问题
左林右狸:你们把物理状态分为两层,第一层是显式的物理状态,第二层是隐式的物理状态。显式的是在现有互联网知识总结的基础上学习,隐式的是对人类现在抽象不出来、描述不了的规律进行学习。那怎么知道模型学到的是真正符合真实物理世界的规律呢?
吕尧:这里需要稍微澄清一下。显式物理状态并不是来自互联网知识,而是来自人类长期积累的科学知识、工程模型和可测物理量。
例如关节位置、速度、末端姿态、力和接触等状态,可以通过传感器测量,也可以使用运动学和动力学方程描述。对于这一部分,我们会尽量把与机器人构型相匹配的解析模型作为骨干;其中一些未知参数,例如载荷、摩擦和执行器偏差,仍然需要通过数据进行补偿。
另一部分信息来自图像、点云、深度等高维观测。这些观测中包含材料特性、复杂接触和环境因素,很难全部写成实时可用的解析方程,因此需要通过神经网络编码为隐空间状态表征,并在对称守恒等底层物理定律的约束下学习其转移规律。
引入物理约束的核心作用是缩小神经网络学习的假设空间,避免模型依靠虚假相关性完成训练任务。最终还需要通过干预实验验证:在相同初始状态下改变动作,模型预测的后果是否随之正确变化;换到新的环境、视角和任务以后,这种关系是否仍然成立。
左林右狸:显式的物理状态是可以穷尽的吗?
吕尧:我觉得“穷尽”并不是一个特别合适的目标。显式状态的选择取决于具体任务、传感器能力和模型需要。
常见的显式物理量包括位置、速度、姿态、力、接触、质量和几何尺寸等。我们不是希望预先列出物理世界中所有显式状态,而是希望找出对闭环决策最关键、能够可靠测量和建模的那一部分,其余部分由隐式状态补充。
左林右狸:遇到柔性物体、可变形件、线缆、液体这类写不出解析模型的对象,你们的显隐解耦是怎么处理的?
吕尧:这类对象并不是完全没有物理方程,柔性体、流体和线缆都有相应的连续介质或力学模型。真正的问题是,这些模型往往维度很高,边界条件复杂,材料参数难以准确获得,也未必适合在机器人控制中实时求解。
我们的处理思路不是在“全部解析”和“全部神经网络”之间二选一。对于拓扑关系、质量守恒、几何约束、边界条件等可以明确表达的部分,可以保留为显式结构;具体形变、复杂接触、材料参数以及解析模型无法覆盖的部分,则由数据驱动模型学习。
左林右狸:你们给的这套物理定律约束,其实还是在人类已知的认知框架下的。未来模型能不能学到人类未知的东西?
吕尧:有可能,但这需要区分两件事。
把已知物理规律注入模型,并不是要求模型只能复现人类已经写下来的公式。显式模型可以提供骨架,神经网络仍然可以从数据中学习人类尚未准确建模的规律。
但如果要进一步发现真正超出人类认知的新规律,仅靠被动训练一个世界模型可能还不够。还需要让智能体主动设计实验、提出假设、收集干预数据、验证和否定假设,并与持续学习和自进化系统结合。
这是一个很有价值的长期方向,但目前我们的第一阶段目标,还是先让模型在人类已经能够验证的物理范围内实现更可靠的泛化和闭环应用。
左林右狸:大语言模型和现在的视频生成派这一类世界模型,本质上还是做统计拟合,存在幻觉。你们这套世界模型系统,能不能解决具身智能 99% 到 100% 的确定性问题?
吕尧:“99%到100%”更准确地说,是对工业可靠性最后一公里的概括。在固定测试集上达到99%,与在长期运行、分布变化和低概率异常条件下接近零故障,是完全不同的问题。最后一个百分点往往包含大量训练数据中没有充分覆盖的状态。
纯粹依靠数据统计拟合,确实可能学到与训练分布高度相关、但并不稳定的替代规律。这种依赖朴素scaling law的方式得到的“通用”大模型,最后是很难保证在所有任务工种上的成功率从99%提升到100%的。因为一定会存在类似于视频预测模型的幻觉问题。
我们现在通过为模型学习注入物理规律约束,让模型的输入输出之间一定满足底层的物理定律,这样我们就可以信任它、解释它,它是物理世界里真实会发生的事件。在这个设计下,再通过数据Scaling的方式,就有潜力把整个模型能力真正从99%突破到100%。核心就在于,我们是通过物理定律约束的方式从理论上去解决幻觉问题。
左林右狸:你们这套模型的设计理念分成了显式和隐式。显式的就是注入已知的、能够描述的公式,也要给它最底层的物理约束去让它进一步学习。这种跟其他整个都在隐空间里学习不太一样。如果做比喻的话,你们的智能像是给了机器人一套写满了约束、被保护着长大的智能,其他的路线可能有点像野生长大的智能。最终得到的智能一样吗?
吕尧:我不认为结构约束等同于把智能“保护得不会成长”。恰恰相反,合理的先验能够让模型在有限数据和算力下,把学习能力集中到真正未知的部分。
如果完全没有结构限制,模型当然也可能通过足够多的数据学到很强的能力,但它所需的数据量可能更大,也更容易利用训练数据中的虚假相关性。在某些状态下能力很强,在另一些长尾状态下却没有保障。
物理原生路线的目标,是先把人类已经长期验证的知识和安全边界作为起点,再让模型在这个基础上学习人类无法完整描述的规律。它不会阻止能力涌现,而是希望提高学习效率、稳定性和可解释性。
在数据近乎无限、任务足够简单时,不同路线可能得到相近结果;但在数据有限、安全要求高和分布不断变化的真实物理世界中,它们的学习效率和可靠性可能会有明显区别。
04 策略蒸馏世界模型,输出动作,形成“肌肉记忆”
左林右狸:你们的理论结论是“训练集单步预测误差小不等于学会了真实转移”。你们在LIBERO(98.8%)和RoboCasa-GR1(67.5%)上的结果,这是单步预测意义上的成功,还是反事实误差意义上的成功?
吕尧:这两个数字都不是单步预测误差,也不是直接的反事实误差,而是机器人闭环完成任务的平均成功率。
我们关于世界模型的判断是:单步预测准确,并不足以证明模型学会了真实的受控状态转移。一个模型可能在训练策略经常访问的动作附近预测得很准,但一旦换成另一个动作,反事实预测就出现较大误差。
LIBERO和RoboCasa-GR1的结果评价的是完整系统:一方面,世界模型是否提供了有效的动作后果反馈;另一方面,策略是否成功吸收了这种反馈并生成了更好的动作。只有两部分共同发挥作用,最终任务成功率才会提高。
所以这些结果能够间接支持后果反馈机制对策略有效,但不能单独作为世界模型反事实误差的直接测量。
左林右狸:这样是不是就更复杂了?
吕尧:从训练系统看,我们不仅要求世界模型预测状态,还要求它对动作变化敏感,并把后果比较有效地传给策略。
但复杂性主要发生在训练阶段。ActEffect部署时会移除受控世界模型和未来观测分支,不需要在每次推理时展开世界模型,也不需要实时比较多个未来,因此推理仍然是相对轻量的。
这也是为什么我们强调Phi不是单一网络结构,而是模型、数据和算法的体系。模型职能变多以后,需要更稳定的优化算法和更清楚的数据分工,才能让整个系统协同训练。
左林右狸:你们的模型架构有优化的空间吗?其实GPT爆火以后,有一部分人相信极简的架构天花板更高。
吕尧:肯定还有优化空间。
我理解的“极简”不一定意味着模块数量越少越好,更重要的是训练目标是否统一、信息接口是否清楚,以及各个模块能否协同优化。很多成功的大模型看起来结构统一,是因为梯度能够端到端传播,训练目标也足够明确。
ActEffect虽然包含策略、受控世界模型和多个动作提案,但它们共同服务于一个目标:让后续动作提案比前面的提案产生更好的结果。训练阶段不是把几个互不相关的模块拼接起来,而是围绕统一目标实现端到端学习。
未来在注意力交互、缓存、动作提案生成、世界模型容量和训练效率方面都还有优化空间。我们认为当前模型中的职能划分是合理的,但不会说它已经是唯一或者最终最优的架构。
左林右狸:你们的世界模型只在训练的时候用,上岗的时候被“压缩”进机器人的快速反应里面,现场不再思考。那么现场遇到训练分布外的突发状况,机器人应该怎么办?
吕尧:需要区分模型本身和部署的工程系统。
ActEffect当前的设计是,受控世界模型主要用于训练,部署时策略直接输出动作,以满足实时性要求。因此,当前版本本身并不会在遇到任何分布外事件时自动重新展开世界模型、在线修改权重。
但是真实部署时也不会只依赖一个策略网络。系统还需要包括异常检测和故障恢复,遇到夹具松动、来料异常或者置信度明显不足时,合理的处理可能是降速、停止、回到安全位或者请求人工介入,而不是盲目按照训练经验继续执行。
此外,世界模型也可以在更慢的时间尺度上保留,用于异常诊断和后续策略更新,这正是我们正在推动的Harness系统和后续版本的能力。
左林右狸:你们的世界模型跑通的话,会让机器人拥有直觉吗?比如它不认识桌子上的新东西,但是它知道推一下边缘它会掉下去。
吕尧:可以把这种能力称为物理直觉。
世界模型在训练中学习动作与后果的关系,策略再通过后果反馈获得对动作干预的敏感性。即使部署时不显式展开未来,策略也可能快速判断某种动作容易造成物体滑落、碰撞或者失稳。这类似于把慢速推演沉淀成快速反应。
左林右狸:如果把您训练的世界模型比作一个刚出生的婴儿,它现在是几个月大的心智?
吕尧:我觉得用“几个月大”来类比并不准确。婴儿虽然执行具体工业任务的能力很弱,但天然具有开放世界感知、持续学习和总结经验知识的能力,这些恰恰是当前机器人还很缺乏的。
我们现在的模型更像一个在特定工位组接受过一段时间培训的实习生。它在一些操作任务中能够理解动作与后果,甚至比普通人执行得更稳定,但这种能力仍然集中在已经训练和验证的范围内。它距离真正理解开放物理世界、持续积累常识和自主适应任意新任务,还有一段距离。
左林右狸:所以,策略模型蒸馏的不是“技能”而是“直觉”?
吕尧:更准确地说,是把对动作后果的敏感性,也就是一种局部的物理直觉,沉淀到动作策略里面。
技能回答的是“怎样完成一个特定任务”,直觉回答的是“这样做大概会发生什么、这个动作是否有风险”。ActEffect希望训练出的策略同时具备两者:既能输出动作,也能通过训练阶段获得的后果反馈,对动作质量形成快速判断。
左林右左林右狸狸:你们的机器人训练的时候是用世界模型反复推演,部署的时候是把世界模型给撇开了,上岗后我们理解它是只剩下了肌肉记忆,也就是直觉。这个安排背后,岂不是说懂物理的世界模型它注定只是一个脚手架,用完就拆?
吕尧:即使把世界模型称为脚手架,我也不认为脚手架没有价值。关键在于它是否有效塑造了最终策略。
训练阶段,世界模型可以评价策略提出的动作,让策略逐渐把“这个动作会产生什么后果”沉淀成快速反应。部署时,不必在每一个毫秒级控制周期都重新展开复杂推演,这与人类把大量训练转化为肌肉记忆是相似的。
但世界模型也不一定永久退出系统。在熟悉任务中可以由快速策略直接执行;在复杂规划、异常诊断、新任务学习和离线自进化过程中,世界模型仍然可以发挥作用。
因此,更合理的形态是多时间尺度协同:快速策略负责实时动作,世界模型在较慢的时间尺度上负责训练、规划、诊断和更新。它既可以是老师,也可以是慢速认知模块。
05 Phi-WM 1.0 ActEffect实现了 VLA 与世界模型的融合
左林右狸:你们的物理原生世界模型与世界动作模型(WAM)的核心区别,是动作因果是否作为模型中的一等公民。但主流的世界动作模型同样也做动作与未来的联合预测,大家也都说能学到因果。能不能用一个消融实验来回答:拿掉你们 ActEffect 里面的哪一个部件,性能会掉到什么水平?
吕尧:动作和未来的联合预测确实能够产生信息耦合,但联合预测本身并不自动等价于因果辨识。提前预测未来,再生成动作去真实执行到期望的未来,也可能产生“鸡生蛋,蛋生鸡”的问题,模型可能同时把动作和未来预测得很好,却没有真正区分动作究竟对未来产生了什么独立影响。
ActEffect强调两个方面。第一是时序结构:先由策略提出完整动作,再由受控世界模型预测这个动作的后果。第二是反事实比较:保持当前状态一致,比较多个动作提案各自对应的未来结果,并把比较结果作为策略改进的训练信号。
从公开的LIBERO消融实验看,ActEffect 完整模型的平均成功率是98.8%。去掉后果反馈以后下降到97.0%;把独立的后果空间替换为与任务语义耦合的VLM表征空间后,下降到97.3%;去掉前馈动作提案后是98.2%;去掉反事实后果排序后是98.1%。这些结果表明,后果反馈、状态空间解耦和动作提案排序都在发挥作用。
左林右狸:您觉得现在这套方案,真的能实现最后的通用机器人吗?还是说未来也不排斥加入VLA的方案、跟VLA融合?
吕尧:我们认为物理原生智能有潜力成为通向通用具身智能的一条重要路径,但它从一开始就不是为了排斥VLA或者其他模型范式。
Phi是一个设计目标和技术体系,而不是规定所有模块必须采用某一种网络结构。只要一种方法能够帮助模型更好地理解状态、动作、后果和物理约束,都可以被吸收到体系中。
ActEffect本身已经是融合形态。动作生成部分可以理解为VLA式策略,训练阶段又加入了受控世界模型提供的后果反馈。部署时保留快速策略,训练时利用世界模型,这就是两条路线的一种结合。
左林右狸:未来在具身智能领域,VLA和世界模型会是什么样的关系?
吕尧:短期内一定会走向融合。
VLA是一种很有效的策略结构,能够把视觉、语言和机器人状态直接映射到动作,特别适合承担任务理解和动作生成。它的不足在于,如果训练主要依赖动作模仿,策略未必能得到关于自身动作后果的充分反馈。
世界模型可以负责学习状态转移和动作后果,并把这些信息作为训练反馈提供给策略。动作生成模块更多处理任务语义和目标,世界模型则尽量关注状态、动作与后果之间相对客观的关系。
ActEffect实际上已经体现了这种融合:训练阶段,世界模型评价策略提出的动作;部署阶段,世界模型相关的未来预测分支被移除,策略直接输出动作。因此,它在推理形态上很像VLA,但训练过程中吸收了世界模型提供的后果反馈。
左林右狸:现在AI圈其实有两派信仰:一派是像ChatGPT,相信足够多的数据、足够大的模型,智能自己会涌现出来;另一派是像Yann LeCun,结构要先想对、知识先装进去。从你们的路线看,你觉得你们是哪一派?
吕尧:我们并不认为这两派完全对立。
我们相信Scaling Law,相信数据、模型和算力规模扩大能够带来能力提升。但我们不认为,在物理世界中只依靠最朴素的规模扩张就足够了。
机器人有真实实体,错误会产生物理后果,而且很多危险状态不适合通过真实事故反复试错来学习。人类已经掌握的几何关系、动力学结构和安全边界,没有必要完全让模型从零猜测。
所以我们的判断是,在合理结构和物理约束下进行Scaling。结构提供归纳偏置和安全边界,数据负责学习人类无法完整建模的部分,两者共同发挥作用。
左林右狸:你们的路线主要靠在仿真里让机器人大量试错,真机数据你们披露的是只要几十个小时到100个小时之间。但仿真里面的摩擦接触、零件之间的缝隙和真实世界总有差别,在仿真里面把物理学得好,学到的会不会是仿真的物理?你们有测量过这个差距吗?
吕尧:首先需要澄清,几十个小时指的主要是已有基础模型迁移到一个新任务以后,用于真机闭环强化和适配的数据量,不是整个模型从零训练只使用几十个小时真机数据。
预训练阶段,我们仍然需要数万小时量级的多源真实机器人数据,为模型建立基本的视觉、语义和动作先验。之后再在仿真中进行大规模中训练,重点生成在相同状态下不同动作所对应的后果数据。最后迁移到具体任务时,通过十几个小时到几十个小时的真机交互完成校准和闭环微调。
关于Sim2Real gap,我们的思路是先做好Real2Sim:通过三维资产重构、机器人参数标定、执行延迟辨识、摩擦和接触参数校准,让仿真在任务实际访问的状态—动作范围内尽量接近真机;再通过域随机化覆盖无法精确辨识的变化。
仿真最重要的价值,是能够反复回到相同状态,以较低成本尝试不同动作,生成真机上很难大规模采集的反事实数据。同时只要仿真内部动力学自洽,模型就可以学习客观的状态转移规律。在这个基础上,我们最后再通过真机强化的方式校准无法准确建模的摩擦、时延、间隙和环境扰动等因素,使得模型可以适配至特定工位。
06 机器人运动会:整体运动能力提升
左林右狸:我们聊一聊机器人运动会吧。你担任清华大学乒乓球战队的技术领队参加了 2026 机器人运动会,对你来说从实验室调试到冰丝带的现场比赛,最大的意外和挑战是什么?
吕尧:这次最大的挑战主要出现在工程闭环和感知信号适配上。
我们的乒乓球方案使用动捕系统获得球和机器人在大地坐标系中的位置。但实验室内使用的动捕设备、标定条件和场馆现场存在较大差异。到了比赛场馆以后,动捕平台型号、灯光条件和空间反射特性都发生了变化,对信号质量产生了影响。
另外,机器人本体通过无线方式传输部分控制和感知信息,场馆内设备很多,无线信号干扰也比较明显。
这些问题并不是算法在仿真中表现好就会自动解决的。这次让我感受比较深的,也是具身智能最终考验的是一整套软硬件系统,而不是单独一个模型。
左林右狸:这一场机器人运动会,您看到的最翻车或者最惊艳的是什么?
吕尧:我不太愿意把比赛中机器人摔倒、故障甚至起火理解成“翻车”。机器人运动会本身就是一个高强度的公开压力测试,准备周期短,软硬件集成复杂。很多在实验室不容易暴露的问题,会在固定赛期和真实场馆中集中出现。
这些问题被暴露出来,反而能够帮助团队更快发现本体、控制、通信和系统的短板。
最惊艳的还是整体运动能力的提升。以百米项目为例,成绩从上一年的21.50秒提高到8.64秒,进步幅度非常大。它说明本体、电机和运控算法在快速迭代。机器人在一年内把高速稳定运动能力提升到了新的阶段。
这次运动会更多是强化了我们原有的判断:单点模型能力很重要,但真正决定现场效果的,仍然是感知、模型、控制、本体、通信和安全系统组成的完整工程闭环。
左林右狸:跑步速度的很大提升,你觉得是智能的提升吗?
吕尧:它首先体现的是本体和 Locomotion,也就是运动控制能力的提升。
高速奔跑需要更强的电机和本体结构,也需要更准确的状态估计、全身协调、落足控制和抗扰能力。这些都属于具身智能非常重要的基础能力。
这种能力可以迁移到工业和服务任务中。机器人要在真实环境中工作,首先需要稳定站立、移动和保持平衡,上肢操作也要建立在下肢和躯干稳定的基础上。所以它是“小脑”和身体能力的显著进步。
左林右狸:有一个现象,消防救援的赛事中,每台机器人需要在30分钟内完成三项任务:识别危险物质、关闭阀门和扑灭火源。12支比赛队伍只有3支完成了全部任务。这暴露了行业什么问题?
吕尧:它暴露的是长程任务下的系统可靠性问题。
消防救援不仅要求机器人完成一个动作,而是要连续感知、决策、控制。任何一个环节失败,整个任务都可能中断。
一方面,通用机器人本体未必已经适合所有专业救援任务,硬件能力、耐久性和环境适应性仍然有限;另一方面,模型和控制系统对长时域误差和失败恢复的处理也还不成熟。
所以这并不是某一个“大脑模型”或者“小脑控制器”单独的问题,而是本体、感知、规划、控制和工程可靠整条链条都需要继续提升。
左林右狸:当前的具身智能最大的短板,是在小脑(运动控制),还是在大脑(感知决策)?
吕尧:我会概括为:短期看小脑,长期看大脑,最终看大小脑和身体的协同。
短期内,机器人首先需要一个高稳定、高鲁棒、能够准确执行模型输出的底层系统。下肢要稳定,上肢要准确,传感器、执行器和控制延迟都要可靠。很多当前可见的问题,仍然来自运动控制和本体能力。
长期进入家庭和开放工业场景以后,更大的问题会转向大脑:怎样理解人的意图、拆解长程任务、处理陌生物体、预测动作后果并在失败后调整。
而最长远的问题,是上下层之间能否形成闭环。上层需要知道底层实际能做到什么,底层也需要根据任务语义调整控制。乒乓球就是一个典型例子,下肢稳定、球拍控制、击球时机和落点判断必须同时协调,任何一个环节出现偏差,都会影响最终结果。
后记
吕尧反复强调的一个朴素判断:预测得准,不等于真的懂。
这句话放在 AI 圈,其实挺扎心的。过去两年,大家习惯了用“大”来解决一切:数据要大、模型要大、算力要大。可到了物理世界里,“大”突然不够用了。机器人不是聊天窗口,它的一次误判,可能就是一个零件报废、一台设备停机,甚至一次安全事故。在这个赛道上,“看起来合理”一文不值,值钱的是“确定会发生”。
所以吕尧他们做了一件看起来反常识的事:让世界模型当老师,教完就把老师请走。世界模型在训练时反复推演动作的后果,把这种“因果直觉”蒸馏进策略权重,最后留在流水线上的,是一个靠肌肉记忆干活的轻量策略。这背后藏着一个很中国的、很工业的逻辑:技术再炫,最终都要落到“能不能上产线、能不能回本”上。
对正在往具身智能里冲的年轻研究者来说,吕尧身上最值得学的,或许是他没有选一条“看起来更性感”的路线,而是死磕那个最不性感、但最要命的问题:怎么让机器人的判断,经得起物理世界的检验。
我们欢迎所有能为左林右狸提供新观点新角度新信息的群友,加入我们的实名制社群,与左林右狸一路同行。管理员微信号:leiphonelinli,备注公司-职位-称呼通过更快。
相关视频
往期推荐
我所知道的胡峥楠
我所知道的闫俊杰
我所知道的代季峰:从微软亚研7万次引用,到盛大3亿美金风暴
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。


