SeeAct AI穆尧:具身智能终局,一定是从“被训练”走向“自我进化”|物理AI50人
机器人真正缺的,不是数据,而是经验。
作者:李秋悦
编辑:吴彤
那是具身智能最荒芜的时候。
没有成熟数据集,没有标准Benchmark,甚至没有一条被验证能走通的技术路线。
穆尧南下港大读博,开始研究具身智能。
2021年,穆尧进入HKUMMLab,成为该实验室创始人罗平教授和中国人工智能奠基人之一的汤晓鸥教授共同指导的学生。
“具身智能会是一个非常 Promising 的方向。”刚入组时导师们的这句话,穆尧一直记到今天。
四年后,这个方向的潜力,开始在穆尧自己的研究中得到印证。
穆尧主导的RoboTwin,成了中国具身智能圈的事实标准之一,GitHub斩获超过 2900 颗星,蚂蚁集团的LingBot-VA、生数科技的Motubrain都抢着在这个基准上刷新成绩。他本人入选国家级青年人才计划,成为上海交通大学长聘教轨助理教授,谷歌学术引用超过 5000 次。
2026年,穆尧做了一个更激进的选择:押注“具身自我进化”,创办SeeAct AI观行智能。他给出一个相当明确的判断:“具身的终局一定会迈向奖励驱动的自我进化。”
这个判断,和他2018年在清华读硕士时坚持的东西一脉相承。
那一年,自动驾驶行业还在把感知、规划、控制拆开做,穆尧坚持端到端Policy和奖励驱动。
后来,特斯拉FSD把整个行业收敛到了端到端,再也没人问他这是不是主流方案。
穆尧把这种坚持归结为一个词:taste。
这里我们理解不仅是技术品味,更是洞察技术发展的科学直觉。
那么穆尧为什么会有这样的直觉?
以下是左林右狸频道与穆尧的对话,在不改变原意的基础上做了部分编辑:
01 奖励驱动从未离场
左林右狸:你第一次系统接触强化学习是在什么时候?
穆尧:2017年。
当时David Silver在YouTube上有一套很好的强化学习课程,我也系统学习了图灵奖获得者Sutton的《Reinforcement Learning》。
那个时候爆发的是围棋智能,我看到Alpha Go通过奖励驱动、自我规划、自我推演,最后能够产生超越人类的智能。我当时觉得,这可能就是人工智能皇冠上的明珠。
左林右狸:到了清华做自动驾驶以后,这种判断怎么进入你的研究?
穆尧:2018年的时候,我比较笃信两件事情。
第一是端到端的Policy。
第二是奖励驱动,希望由神经网络来承载这个策略。
但是那个时候这个观点还比较超前。自动驾驶整体上分得比较开,感知、决策、规划、控制是分开的,甚至一个公司里面都会分成不同事业部。
我还是希望用神经网络来承Policy,希望直接由视觉反馈和奖励驱动来做这件事情。
后来做Mixed Reinforcement Learning,也是希望搭建Model-based RL和Model-free RL之间的桥。Model-free更多依赖真实数据,真实世界交互代价比较大;Model-based可以提高样本效率,但是模型自身会有预测误差。
所以我们希望根据不断得到的环境反馈,对模型和现实之间的误差进行建模,再不断更新决策系统。
左林右狸:为什么后来从自动驾驶转到具身智能?
穆尧:硕士阶段我有一个感觉,车虽然也是一个具身智能体,但是它的限制比较大。本质上就是四个轮子在道路上跑,不撞人、遵守交通规则,道路类型和动作空间都比较有限。
我就在想,有没有一个更广阔的领域,可以做更多有趣的探索。所以2021年,我去了香港大学MMLab罗平老师组里做具身智能。
具身智能的研究对象一下子打开了。末端执行器有夹爪、灵巧手,机器人有双足、四足、轮式、双臂、工业臂。
我当时觉得,这个领域太好玩了,有太多问题可以研究。
左林右狸:刚进入具身智能的时候,你首先在解决什么问题?
穆尧:2021年的时候,具身智能领域可以说非常空白。几乎没有成熟的数据集,也没有标准Benchmark。
到了2023年,大模型、ChatGPT 出现以后,机器人处理复杂长程任务的能力上限一下被推高了。我们那个时候做了EmbodiedGPT。
后来又做RoboCodex,通过上层大模型做任务拆解,再生成底层代码,调用具体接口,连接机器人执行器。我们当时比较强调视觉反馈,因为物理世界不是纯文字世界,一定需要视觉,甚至需要三维信息。
左林右狸:RoboTwin 是怎么从这条线上长出来的?
穆尧:后来我们把代码生成用于构建仿真合成数据。
那个时候很多仿真器还是比较笨重,我们希望做一个足够方便,学生在自己的游戏本上也能够跑起来的机器人引擎和仿真数据管线。所以有了RoboTwin 1.0,从场景生成、任务生成、数据生成,到对早期Policy Model做Benchmark,形成一套比较完整的流程。
RoboTwin 2.0 以后,又把任务Scale Up到50左右,同时升级了行为生成和代码生成,它的核心定位是Benchmark和数据生成器。
到了3.0,我们和摩尔线程合作,进一步支持国产显卡和国产物理引擎。当然也不是说只局限在国产,我们希望RoboTwin是一个更大的生态,不同显卡、不同引擎都能够接进来。
左林右狸:RoboTwin 2.0之后,为什么又开始做VLA?
穆尧:代码生成这条线做得比较完善以后,我们进一步思考它的瓶颈是什么。
本质上的瓶颈,是最底层API的可扩展性。最底层API还是工程师写的。那我们就在想,这些API能不能变成数据驱动?能不能是端到端形式?能不能由神经网络作为载体来承载?这其实又回应了我从硕士阶段开始的一些研究理念。所以从那个时候开始,我们进一步做具身基础模型。
到了后来,我的研究基本上形成了两类,一类是端到端策略基础模型;另外一类,是以代码生成为主的一套Agent System。
左林右狸:这两条线最后怎么合起来?
穆尧:我觉得一个历史机遇是,当端到端模型的成功率已经达到比较可用,或者至少展现出比较好的潜力以后,就可以把端到端模型作为一个Skill嵌入Agent System。
上层 Agent 负责复杂任务推理和任务拆解,底层端到端模型,则作为一个可扩展、泛化能力比较好的Skill被调用。所以后来我们进一步做了完整的Agent System,包括和智元合作发布的RoboClaw。
到RoboClaw这个阶段,我觉得基本上把我从2021年开始对整个系统的一些设想实现了。
今年9月10日教师节,穆尧和他的学生们(抱花者为穆尧)
02 具身智能scaling关键要经验规模化
左林右狸:你认为什么是真正的具身智能scaling?
穆尧:我这里定义了三层。
前两层,现在具身智能竞争得已经比较白热化,大家做得如火如荼。比较基础的是Scale up Data和Scale up Model,也就是数据量、模型规模都要继续扩大。
我觉得第三点是目前所有人都做得不够好的,叫Scale up Experience,经验规模化。
就像我们人一样,人就是一个很强的具身智能体。我们每天都在物理世界当中交互,从婴儿的时候不会走路,到会走路;从什么东西都不认识,到后来能够操作各种物体。比如一个人进电子厂,一开始可能一个仪器都不认识,最后变成熟练工。
我们找工作的时候,大家会看什么?工作经验。
所以我觉得经验的规模化,是真正把智能性继续推高非常重要的一步,也是真正能够推动具身智能走向落地化、实用化的关键一步。
左林右狸:为什么在Data Scaling和Model Scaling之外,还需要单独提出Experience Scaling?
穆尧:Data Scaling关注训练数据规模的扩大,Model Scaling关注模型规模的扩大。Experience Scaling更强调的是,机器人能不能在与环境的交互中,持续产生对自己有用的新经验。
如果数据主要来自人类演示,那么机器人学到的更多是“人在这些情况下会怎么做”。但机器人自己执行时会遇到什么问题、采取不同动作会有什么结果、失败以后应该怎么调整,这些情况还需要它自己去经历。
比如拧瓶盖,人演示的时候,可能抓住以后很顺利就拧开了。但机器人自己做,可能抓的位置偏了一点,也可能发生打滑。它需要根据实际反馈,判断下一步是重新抓、调整力度,还是换一种方法。
这些交互当然也可以记录成数据,用来训练模型。所以经验和数据并不是截然分开的。我强调Experience Scaling,是因为我们需要建立一种能够持续产生经验的机制:机器人遇到当前不会的问题,可以自主探索,把尝试的过程和结果积累下来,供后续学习复用。
而且随着能力提升,它应该能够接触更多场景、尝试更复杂的任务,获得更丰富的经验。所以这里要规模化的,既包括交互的数量,也包括经验覆盖的范围,以及这些经验对能力提升的价值。
左林右狸:具身自我进化和Experience Scaling之间的关系是什么?
穆尧:可以简单理解为,Experience Scaling解决经验从哪里来,自我进化解决这些经验怎么转化成能力。
机器人需要先持续产生足够丰富、有价值的交互经验,但经历得多,并不意味着能力一定会提高。中间还需要评价和学习的过程。
我们强调奖励驱动,就是希望通过任务结果和环境反馈,让系统判断哪些尝试更有效,再据此改进自己的策略。
这种改进可以发生在不同层面。底层是具体操作,比如怎么抓、怎么调整接触位置,可以通过训练更新策略模型;上层是任务规划和决策,比如什么情况下应该换一种方法、调用哪个Skill,也可以通过总结经验、更新记忆和技能来改善。
关键是,一次交互带来的收获能够被保留下来,并在后续任务中发挥作用。
左林右狸:那为什么还要专门提出“递归自我进化”?它和一般的自我进化有什么区别?
穆尧:递归自我进化,也就是Recursive Self-Improvement,是说我进行一轮提升以后,可以Rollout(自主执行)出更多经验,而且这些经验会比上一轮更好。
比如一个学生,一开始只能解决基础题60分。当他达到60分水平以后,再去做一些新的题,可能七八十分的题也能够做出来,于是就有一轮新的经验。在新一轮经验基础上,策略再继续往前演化,然后又可以Rollout出更新的经验。
所以这是一个递归的过程。能力提升以后,会产生新的、更高质量的经验;新的经验又继续推动能力提升。智能能够持续演化,优质经验能够不断 Scale Up,这就是具身的递归自我进化。
左林右狸:具身自我进化和强化学习是什么关系?
穆尧:强化学习是自我进化的工具之一,但不是唯一,因为需要进化的是长序任务推理、具体执行等多个维度。
强化学习可能更多驱动策略,也就是端到端策略的进化。但是对于一些经验总结,我完全可以以文档的形式存储下来,这相当于是智能体层面的进化。
所以本质上,具身自我进化需要的是策略基座,或者整套系统协同进化。
左林右狸:自我进化在预训练到后训练的整个流程上,是什么样的位置?
穆尧:我们希望自进化系统覆盖从预训练到后训练的完整流程。
首先在预训练阶段,需要给策略基座嵌入自主纠错的基因。也就是说,要汇聚来自不同机器人、不同场景、不同任务的自主纠错经验,把它统一训练进策略基座。这样到了一个新的场景做后训练的时候,它才能非常高效。
类似的道理,比如π₀.₅,大家对它的评价是视觉泛化性非常好,因为人家的预训练就嵌入这种视觉泛化。来了一个新场景,可能长得不一样,需要那几条数据fine-tune (微调)一下,但是很快就可以适应。
对应自主纠错,从运行skill level的角度来说,我们希望嵌入比较好的自主纠错经验。对应地,需要产生规模化的经验数据,也就是刚才讲的scaled experience data。这相当于预训练阶段干的事情。
后训练阶段则是面向用户真正的目标场景,是一个完全陌生的场景。策略需要真正执行,然后通过交互和反馈,快速达到用户满意的标准。
左林右狸:可以用一个具体任务,讲机器人如何完成从失败,到判断原因,再到探索新方法、学会新能力的过程吗?这种自主纠错是什么样的流程?
穆尧:我举一个比较适合自主纠错的例子,比如拧瓶盖。
预训练阶段,需要让模型见过各种各样的情况。因为专家数据只会提供:我按照这个角度去做,最后瓶盖顺利旋开。但是机器人自己执行的时候,可能拧一下没拧开。这个时候,它需要知道怎么继续尝试。
比如能不能感知静摩擦力、动摩擦力什么时候发生变化?什么时候能够判定瓶盖真正克服了静摩擦力,可以简单旋几下给它拧开?这种能力的引入非常重要。
所以预训练阶段要见过千奇百怪的情况:一开始没有按照预想的状态走,这种情况下怎么克服、怎么调整。这种经验会在预训练阶段沉淀下来。
到了后训练阶段,比如遇到一个完全没见过的物体:一个纯黑色的冰箱,也没有把手。机器人不知道是从左边开,还是从右边开。那就先试左边,发现使劲也打不开,再去试右边。
本质上是能够自主自发地尝试、自主试错,再根据试错以后的环境反馈做策略调整和更新。
同时这种试错不是无限制的。系统还需要能够分析奖励和反馈,知道哪些方向没有必要继续尝试。如果这个东西掰不开,还非要使一百牛的力去掰,那机器人可能就坏了。
左林右狸:你认为我们离真正的具身scaling还有多远?
穆尧:说远很远,说近也很近。
说远,整个技术在飞速发展。现在这些模型,比如大家觉得很惊艳的Generalist GEN-1.5,可能在完全没见过的场景下,给你一条数据,一个 in-context 的方式,就能有58%的成功率。这从学术上来说非常amazing,但58%,距离99.99%还有很远。
说近也很近,真正需要找到的是Scaling的杠杆。
以前大家觉得具身智能的数据很难Scale Up,2024年、2025年,很多具身智能的报告开篇都在讲数据短缺,但当大家找到像UMI、手持式夹爪这种比较合适的数据采集方式以后,你会发现到百万小时的速度比很多人的预期快。
所以重点就来了,怎么样找到Scale up Experience的方式?
如果完全依赖真机自主试错,当然真实世界的数据最优质,但要保证多样性、保证并行度,成本会非常高,而且比遥操作还高。
我们提出的方案,是在构建得足够好的虚拟空间里,由奖励驱动进行自主试错,通过这样的方式不断积累经验。
穆尧在世界机器人大赛WRC 2026
03 仿真是经验规模化的杠杆
左林右狸:经验的Scale Up,主要靠真实数据还是仿真数据?
穆尧:我们的思路是少量真机,加大量虚拟空间当中生成的数据。
真机数据,我指的是真机交互,即机器人真实的自主推理交互。把它扔在真实世界当中,rollout policy所产生的真机数据,类似于π₀.₆和π₀.₇所采用的这种数据。
大家对“仿真”的定义可能不完全一样。有人讲仿真数据,特指物理引擎。但是现在还有另外一种范式,就是用神经网络驱动一个通用、可扩展的World Engine。它本身也是根据真实数据训练出来的,所以生成的数据会越来越逼近真实世界。
在我的概念里面,由物理引擎产生的数据、由World Model或者World Engine 产生的数据,以及真实世界机器人自主交互的数据,可以看成来自三个不同的“平行宇宙”。
只要能够提供充分的自主决策经验,都可以汇聚在一起。预训练本来就是希望汇聚越来越多的经验。
左林右狸:为什么是少量真机?物理仿真引擎和真实世界的物理参数之间的差距(sim to real gap)怎么解决?
穆尧:来自真实世界的数据没有sim to real gap,这一点不可否认。
但如果真正要Scale Up Experience,就需要足够的多样性和并行度。纯靠真机自主试错,代价依然很大。所以现在很少有人还在讲纯写真机遥操数据。大家在做的可能是一些更廉价化的方案,比如UMI的数据,包括头戴式的egocentric human数据。
物理仿真引擎和真实世界的物理参数严格吻合,目前来讲还是悬而未决的一点。
但我的观点是,为什么一定要和真实世界吻合?本质上,我们可以认为仿真世界是真实世界的另外一个平行宇宙。
你说在这个世界上摩擦力是0.2,我在那个世界里面摩擦力是0.3,那我在这个世界学到的知识就不是知识吗?我觉得依然是知识。它的规模化依然可以带来模型智能的显著提升。
当然大家确实更关注如何迁移到真实世界。
但我觉得现在这个路线上已经有很多,比如苏度科技(Sudo),做了很好的验证。基于仿真世界里面,至少抓取这件事情,他们解决得非常好,要比无数“数采场“采出来的数据训出来的抓取的模型还要好。
这一点上,我还是充分相信仿真的力量。
左林右狸:虚拟空间靠什么搭起来?
穆尧:现在有两条路线,一条路线是把物理仿真引擎做得足够好;另外一条路线,是希望能够用World Model支撑一个可交互的物理世界。
World Model 目前在一些严格物理规律上还有能力边界,但它很有潜力的一点是可扩展性非常强。
物理引擎过去的问题,是扩展一个新的场景、新的任务,需要大量工程师投入。但现在有Coding Agent 以后,这部分也发生了很大变化。
所以现在相当于有两个很强的工具并驾齐驱。一边是生成式World Model,另外一边是由生成式AI辅助构建物理仿真。
最终都是希望得到一个足够好的虚拟空间,在里面低成本试错,让经验不断Scale Up。
左林右狸:那真实数据和仿真数据分别最适合提供什么?有没有一个最佳比例?
穆尧:没有一个固定答案。
真机和仿真数据的配比,会随着模型能力和模型结构不断变化。比如模型只是对背景的泛化能力不好,但操作本身已经比较好,那多补一些仿真生成的背景增广数据,可能非常有效。
但如果做钥匙开锁这种任务,对真实物理接触要求非常高,那来自真实机器的反馈可能就更重要。
所以数据的来源、数据的配比,需要和模型能力、模型评测结果匹配。
左林右狸:真实生产不能允许机器人无限试错。到了实际部署阶段,真实世界和虚拟世界怎么配合?
穆尧:大量试错一定要放到虚拟空间里,但真实世界仍然要不断提供反馈。
通过虚拟空间里的大量试错以及 Agent 的分析,要能够反过来发现:还有哪些东西是虚拟空间模拟不足的,需要补充真实世界的交互。
到了后训练阶段,面对一个完全分布外的新场景,真实机器的Rollout和虚拟空间里的试错可以并行进行。真实世界负责提供最关键的物理反馈,虚拟空间负责把这些问题进一步展开,做更大规模的探索。
穆尧在《无限演化》世界模型专场现场
04 模型要为奖励驱动而设计
左林右狸:如果最终目标是奖励驱动的自我进化,对策略基础模型本身有什么要求?
穆尧:这个也是我们做具身基础模型的时候一直在考虑的问题。
现在VLA、World Action Model很卷,可能一个星期出来很多篇。我们会想,我们投入这么大的精力做一个模型,目标到底是什么?差异化在哪里?
我个人的判断是,具身的终局一定会迈向奖励驱动的自我进化。
所以我们反过来问,有没有一个足够好的模型结构,既有足够强的性能,又足够高效,能够支撑后面的奖励驱动学习?这也是我们后来做离散扩散VLA的一个出发点。
左林右狸:为什么选择离散扩散?
穆尧:当时主流的一些路线,比如π系列,是连续扩散或者流匹配。这种方式对复杂动作轨迹的生成能力很强,但是拿去做强化学习的时候,策略优化比较复杂。
所以我们就在想,能不能继承这种对复杂动作轨迹的生成能力,同时让后面的奖励优化更加简单。我们后来总结,扩散模型生成复杂动作轨迹的能力主要来自两点:全局视野和迭代优化。
全局视野是说,在生成整条动作轨迹的时候,各个位置之间可以相互关注。比如前面正在接触物体的时候,就可以考虑最终希望到达的姿态。
迭代优化,就是一步一步把整条轨迹修得越来越精细。
后来我们发现,离散扩散同样具备这两个特点。同时它又是词元预测,模型输出的分数能够比较直接地计算,所以可以比较方便地适配PPO(近端策略优化)、GRPO(组相对策略优化)这些强化学习方法。
所以我们做了离散扩散VLA。
左林右狸:从离散扩散VLA到MM-ACT、dVLA-RL,后面的研究是在继续解决什么问题?
穆尧:进一步就会问,离散扩散能不能用来做世界模型?能不能把语言生成、视频生成和动作生成统一起来?所以后来做了MM-ACT,希望把这些合并成一个统一模型。
我根本不认为VLA和World Action Model最终是两条完全不同的路线。未来一定会是一个更加统一的模型,它既能够做语义理解和推理,也能够对未来进行视频或者隐藏视觉特征层面的推演,同时还能够生成Action。
再下一步,就是对训练得足够好的基础模型做强化学习。我们更关注的是,多任务、多场景能不能一起训练。
现在很多强化学习工作,是一个策略在一个单一场景里做后训练。训练完以后,换到另外一个场景,泛化能力可能又大打折扣。所以我们希望不同场景、不同任务的数据能够汇聚起来,进行更加高效的强化学习,后来就做了dVLA-RL。
归根结底,真正需要讨论的不是名字叫VLA 还是World Action Model,而是这个策略基座到底应该嵌入什么能力。
我们看到更大的问题,还是自主推理、自主纠错能力的缺失。
左林右狸:除了能不能自我进化,VLA 真正部署到机器人上还有什么现实限制?
穆尧:一个很现实的限制就是推理代价。
模型太小,没有足够的智能性和泛化性;模型做大了以后,自然会产生推理时延。比如World Action Model,把Video Generation和Action Generation 做联合。Video Model 为了让泛化性足够好,体量会比较大。体量一大,推理代价和推理时延都会比较长。
所以我们希望,它推理一次能够对应未来多个Action Plan,而不是每一个动作都重新跑一次大的视频模型。这就需要异步、异频处理。
但是异步以后又会出现另外一个问题,慢脑Video Generation 更新频率比较低,它推演的时候依据的是之前的观测,真正执行的时候,现实世界已经往前走了。
所以还需要具备实时更新能力的模块,根据最新观测不断修正,缓解这种Delay,把模型推演和真实世界之间的时间错位尽量消掉。
左林右狸:机器人不断自主试错之后,产生的这些经验最终怎么沉淀和复用?
穆尧:我觉得一个机器人连续工作以后,至少需要记住几块。一个是场景,一个是自己做过什么,第三个,也是最重要的,是自己产生的经验。
比如人进工厂也是要培训的。但是培训两天以后,后面还会在这个岗位上越做越熟练。本质上记住什么?
不是简单记住自己做了多少次,而是我在什么情况下会触发什么样的边界问题?遇到这些问题应该怎么解决?所以这是对过去探索、交互经验的总结,对知识的提炼、对技能的提升。
沉淀下来的东西形式可以很多。可以是一些文档,是对场景的文字描述或者图片;也可以沉淀成模型权重,作为一个Skill。上层Agent 需要知道什么时候去调用这些东西。
所以并不是把所有过去轨迹原封不动地存下来,而是要做动态的记忆维护。短时的信息,任务完成以后可以清除;但真正总结出来的知识和Skill,需要能够长期保存,在未来遇到类似问题的时候重新调用。
穆尧在中国计算机学会(CCF)秀湖会议上演讲
05 具身自我进化终结项目制
左林右狸:为什么这一轮具身智能里面,很多高校成为连接企业的重要节点?企业真正需要高校提供什么?
穆尧:我觉得有两个方面。
第一,具身智能整体来说学术前沿性非常强,非常需要科学家来定义。这个产业需要来自科学家更前沿的视野。如果缺少这样的判断,很容易沿着一条已有路线疯狂Scale Up,比如一直采真机遥操作数据。但这个范式是不是最后的主流?怎么样保证数据多样性?成本最终是多少?这些都需要更加前沿的技术判断。
第二,高校本身就是高质量年轻人才的蓄水池。现在真正走在人工智能最前沿的,很多都是非常年轻的学生。这一代年轻人是AI Native的一代,他们在学习、工作、编程的各个环节都已经大量使用 AI,所以在理解新的人工智能范式、构建新的研究方向时,可能会产生很多新的东西。
左林右狸:这一轮具身智能里的高校和企业分工,和上一轮自动驾驶时代有什么不同?
穆尧:我觉得完全不一样。
自动驾驶时代,高校获取真实数据非常依赖企业。车厂的大规模真实数据,高校很难拿到,同时高校也缺大规模算力,所以很多时候只能在公开数据集上研究。
具身智能不一样,很多具身数据的获取门槛没有自动驾驶那么高,企业和高校之间的数据也相对更开放。
所以高校可以更多提供前沿模型的Know-how、数据标准、数据清洗管线、新的模型结构,以及 Agent 和端到端模型结合的新范式。企业负责做真正的大规模化,数据Scale Up、模型 Scale Up、大规模训练,然后进入真实场景部署。
左林右狸:现在大家都围绕VLA、世界模型竞争,为什么选择在这个节点all in具身自我进化?
穆尧:我觉得现在真正缺的,不是再多一个模型名字,而是找到下一阶段的Scaling杠杆。
过去几年,人类演示数据的采集方式已经进步非常快,不管是手持设备、遥操作还是UMI,大家都在想办法把专家数据做得更多、更便宜。
但它们解决的主要还是“人会怎么做”。机器人自己执行时遇到失败怎么办,哪些动作看起来合理但实际不成立,怎样从反馈里找到新的解法,这类经验目前仍然非常不足。
这个时候,我觉得继续单纯放大人类演示数据的边际收益会越来越有限。下一步真正值得Scale的,是机器人自主产生的经验。
现在也已经开始出现一些信号。比如 Physical Intelligence 的 π*0.6 和 π0.7,都非常严肃地在讨论经验数据怎么进入模型。当然他们走的是纯真机路线,用真实机器直接收集自己推理产生的经验。
我们选择在这个节点出来创业,本质上是希望把这件事情从一个研究问题变成一套真正可以持续运行的系统:怎么产生经验、怎么评价经验、怎么把经验重新训练进模型,再让模型进入下一个场景继续进化。
左林右狸:SeeAct现在希望交付给客户的到底是什么?
穆尧:我们交付的是一整套东西。
包括端侧算力平台、基础模型。基础模型里面包括World Model、Policy Model、Reward Model,还有完整的Agent System。整个产品形态会结合硬件和软件,比如以工控机这样的形式交付。
最大的区别是,别人交付的是一个写死的Policy,我们希望交付的是一个能够持续进化的Policy。它不是交付完就结束,而是卖出去以后,还能够针对用户自己的场景自主进行定制化能力提升。
所以第一是可扩展,第二是能够持续自主进化。
左林右狸:如果策略基座真的具备很强的自主纠错能力,你觉得它首先会改变具身行业的什么?
穆尧:会改变整个具身行业的交付方式。
以前包括上一代AI,很多模式都是项目制。接一个单、接一个场景,可能20多个工程师在那里耗三个月,把这个场景交付掉。到了下一个场景,可能又不行。
我们希望达到的是,有一个具备很强自主纠错基因的模型,再配合一套自进化系统。到了一个新场景以后,它可以快速适应、不断提升。我们的目标,大概是一两天、48小时左右,自主提升到用户可用的状态。
这样同样一套系统、同样一种供给形式,就有机会变成一个标准化商品。客户的场景可以不一样,但把它买回去以后,可以通过自进化体系在自己的场景里达到想要的效果。
我觉得只有这样,具身企业才有可能产生足够的毛利率,真正靠产品活下去,而不是永远靠大量工程师做项目、靠融资。
左林右狸:具身自我进化的产业化,什么场景最适合先验证?
穆尧:不同场景都可以。工业、家庭,或者酒店、餐饮这些介于工业和家庭之间的场景,都可以验证。
但如果要产生规模化产业价值,我还是觉得工业场景会更合适。
第一,工业场景非常适合“进化”这件事情。工业有节拍要求,不是机器人能把任务完成就够了,还要越来越快。
人也是一样,小孩写作业、抄课文,会越写越快。你看100个人怎么抄课文,也不代表你自己就能抄得很快。最后还是要自己不断练习。而且这件事情非常适合奖励驱动,做得越快,得分越高。
第二,工业场景相对更标准。家庭里面需要进化的目标几乎是无穷无尽的。一个星期家里可能就会出现很多新东西、新衣服、新的外卖盒子,各种形状都有。这种非标准化,很难做规模化验证。
工业也需要很强的泛化能力,但是它的泛化目标是在一个相对圈定的范围里。所以作为Day One去验证整个系统有没有威力、有没有效果,我觉得工业更合适。
当然最终我们希望自进化系统能够进入整个人类社会,不局限在工业,也包括家庭、商超、餐饮、酒店。
写在最后
穆尧创业以后,听到过不少难听的话。
有人在社交媒体上质疑“具身RSI”,认为这不过是包装出来的新概念,自我进化太远、递归自我提升太虚。在一个VLA、世界模型已经足够拥挤的市场里,再造一个词,“本质骗钱”。
如果只看2026年,“具身自我进化”确实很像一个突然冒出来的创业故事。但把时间往回拨,会发现他其实围着同一个问题转了很多年。
2017年,他从AlphaGo里相信奖励驱动;2018年做自动驾驶,在行业还把感知、规划、控制拆开的时候,他坚持端到端Policy;后来到港大,从具身Agent做到RoboTwin,再做到VLA和强化学习。今天他说Experience Scaling,说机器人不能永远学习人类给出的正确答案,而应该自己试错、纠错、积累经验。
名词一直在变,穆尧想解决的问题没有变:让机器从“被教会”,走向“自己学会”。
(欢迎添加作者微信扩列:lqy4605)
我们欢迎所有能为左林右狸提供新观点新角度新信息的群友,加入我们的实名制社群,与左林右狸一路同行。管理员微信号:leiphonelinli,备注公司-职位-称呼通过更快。
相关视频
往期推荐
Xspark AI 丁文伯:触觉替代不了视觉,但机器人需要一套自己的“脊髓” |物理AI 50人
源升智能杨思成:具身模型能力突破之前,灵巧手要先卷性能|物理AI 50人
日冕开物肖中阳:把蔚来世界模型量产后,我兑现102周前的创业决定|物理AI 50人
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。


