英伟达没搞定的转笔,被银河通用攻克了:通用小脑的Scaling Law生效了?

创业邦08-21 18:42

整理丨狮子侠

编辑丨小龙

图源丨网络

2026世界机器人大会(WRC)现场,银河通用首款双足人形机器人Galbot ET1“星仔”以一段丝滑的街舞倒立惊艳全场,外界看到的不再是预设脚本的机械杂技,而是一个由通用小脑驱动的物理世界原生智能体。 

2026世界机器人大会·银河通用机器人叠衣服|创业邦实拍

此前,业界一直将银河通用视作“轮式务实派”——从G1到S1均采用轮式底盘,创始人兼CTO王鹤这位90后斯坦福博士、北大助理教授,是具身智能“大脑优先”路线的坚定布道者。

8月20日王鹤现身2026世界机器人大会主论坛,发表了主题为推动具身智能与人形机器人的核心突破时刻的演讲。以下为演讲全文,创业邦整理发布。Enjoy!

从仿真到物理世界

运动智能的“AlphaGo拐点” 

每一位在场的嘉宾和听众,都畅想着人形机器人走进千行百业、千家万户的那一刻。实现这一愿景,核心在于用模型驱动具身人形机器人走向通用

这必然涉及两个关键:一是机器人本体是否足够灵活自由;二是是否具备走向通用的人形机器人大脑,以及真正能够控制身体完成各种动作的小脑。大小脑是人形机器人的灵魂,也是具身智能产业中最有价值的部分。

今天我想谈谈银河通用走向通用的路线图。第一个里程碑,是在单一任务中证明人形身体的价值,并充分发挥这一价值。

今年3月,我们全球首次发布了人形机器人全自主打网球的工作。可以看到,该任务要求机器人全身维持平衡,同时精确控制腕部——既要击中球,确保球落在拍子的甜区,还要保证回球落点质量。

在这些控制之上,还需实现战略意图:通过前后调动和左右调动击败人类对手。低层级是全身操控,高层级是战略博弈,真正展现了人形机器人的能力。

成果一经发布,便在外网引发全球热议。埃隆·马斯克第一时间评论这是"inference"。随后,一位独立研究员称,这类工作的出现证实了"运动的AlphaGo时刻"已经到来,马斯克也立即评论表示认同。

当我们看到人形机器人以全场跑动、全身自主运动及操控能力展现其能力时,就像2016年DeepMind定义围棋一样,我们将人形机器人的自主能力释放了出来。这背后离不开银河通用长期积累的仿真及强化学习技术。

从基础回球学习,到第二阶段的策略自对抗学习,我们已在网球场景中积累了超越1万年的仿真对打训练时长。这比围棋更难——围棋在数字世界与物理世界是同一游戏,而我们的训练需从仿真器迁移到真实世界,这也是银河通用独有的世界领先技术。

近期即将举办的世界人形机器人开幕式上,我们将发布新一代网球对打技术。该技术将展示更强的拟人性,包括人机混双能力。

很多人说我们的网球拍只是握住了但手的价值,从来不只是握住,而是懂得何时握紧、何时松开。

今年春晚,我们自研的银河星脑大模型中的灵巧手脑区,已向全球展示了转核桃的能力。该核桃时松时紧,性状持续变化,无法用固定轨迹实现,否则会把核桃捏炸或使其掉落。这背后也是强化学习在真实世界回流数据、进一步训练模型能力的体现。

这块可与国际顶尖人形机器人团队对比。

左边Figure做灵巧手开瓶盖动作,是抓握后转松,动作不连贯——我不便替他们解释技术原理,但这类操作方式可通过遥控采集数据实现。

右边则是连贯配合,无法通过遥操采集数据,我们采用强化学习直接在仿真器中学习,实现高效的Sim-to-Real。

难度越高的手部精细操作,越无法通过遥控实现,越需要Sim-to-Real这类领先技术,才能将灵巧手的全部能力展示出来。

左边是英伟达2023年发布的转笔。其采用强化学习在仿真器中操作,但由于转笔过程中笔与手指频繁碰撞,仿真器难以完全保真。

右边是银河通用在全球首次实现的灵巧手转笔,包括高动态、空中飞旋后落回指尖等高难度操作。这些操作均无法通过遥操实现,完全依赖强化学习与Sim-to-Real技术。

下一步的关键,是如何从专用专精的模型走向通用。数字世界中,GPT定义了范式——什么是具身的GPT?如何让具身大模型吸纳各种任务与数据、走向通用?这是我们在高难度任务上取得突破后,业界最关心的问题。

这就要介绍银河星脑的框架。人形机器人既需要高层级的动作意图生成、轨迹规划,又需要全身控制与高频反馈。因此,我们像人一样为其搭建了大脑和小脑,中间通过脑桥连接——沟通慢的大脑与快的小脑。

这套仿生框架,就是银河星脑面向通用人形机器人的基座大模型。大脑和小脑均为大模型,各自寻找其GPT范式。

什么是大脑的GPT范式?谷歌提出了VLA,OpenAI提出了世界模型,两者各有优劣。

VLA能吸收大量动作数据,但仅限有动作标签的数据;世界模型能吸收海量视频数据,却无法学习机器人各关节该转多少度。

因此,真正融合VLA与世界模型——既能利用机器人有动作标签的数据,又能吸纳人类海量场景无动作标签的数据,学习人类操作经验——这样的范式就是世界动作模型。

今年英伟达具身智能的主任在红杉采访中提到,ONE是机器人的终身游戏。"机器人终局技术"由银河通用在全球首次提出。今天在网站上搜索"世界动作模型",全球第一篇文章即来自银河通用——2025年3月挂出,被2025年ICCV接受。这一范式今天正引领具身智能大模型、大脑的发展。

昨天我刚搜索,已有171篇世界动作模型论文。我们2025年发时仅一篇,第二篇直到12月才出现。

100万小时数据与视频即训练

机器人干活不再靠“人工喂饭”

天的银河星脑,我们提出在隐空间进行建模,真正实现了跨本体、跨任务、跨场景的操作。一个模型既能驱动无指手,也能驱动搬运机器人。该模型背后融合了仿真数据、真实世界数据与人类数据,形成了新的、统一的具身大模型数据范式。同时验证:仅用无标签人类数据,即可持续优化机器人动作预测的损失函数。

这些成果耦合了世界领先的真机强化学习技术。在我们的展台,大家可以亲自体验给机器人做早餐捣乱——无论是抽走面包,还是盖住瓶子阻止倒水,机器人全程均可自主应对。

我们即将发布的技术,将在全球首次展示十分钟级早餐制作全流程,包括水果、沙拉等材料的准备,最终完成三明治。该能力既体现机模能力,更是强大真实世界强化学习后训练能力的体现。

刚刚讲了大脑,小脑需要什么?小脑需要控制身体完成各种动作。

今天银河通用的全身控制脑区,是真正的通用小脑——基于上亿参数的大模型。在该模型控制下,可遥控人形机器人远程执行各类任务:家庭场景中照料宠物、铲猫砂;应急场景中提供支援;高动态的各类动作。均无需提前录制轨迹,可实时控制。这就是小脑:大脑发出意图,小脑将动作丝滑、抗干扰地执行。

过去的小脑,是对单条轨迹过拟合的专用小脑。今天银河通用打造的通用小脑,与国际顶尖团队英伟达对比:延迟更低、动作更精准,高难度动作的平衡稳定性也更优。我们验证,在十万小时人类数据下,通用小脑的损失曲线持续降低——这是通用小脑的Scaling Law。

通用小脑支持下,昨天我们在分论坛发布了自有小人形机器人银河·星仔Galbot ET1,可实现人类实时跳舞——实时抽取动作,并由通用小脑完成高难度舞蹈展示。智能体换形后,对人类舞蹈进行实时识别与抽取,包括倒立等地面动作。

当你拥有一颗真正通用的小脑,便可解锁更多实时产生的即兴动作,并支持机器人进一步与人智能交互。这就是物理世界原生智能体。我们已开始进行舞蹈引流——智能体自主产生舞蹈,吸引人流、形成互动、促进销售。

通用大小脑之后,大家最关心的无疑是:具身智能何时迎来ChatGPT时刻?首先要定义什么是具身智能的ChatGPT。我将其含义分为两层:一是机器人在人类无需特殊学习的任务上,达到70%—80%的成功率;二是通过极简后训练,让无专业技能的人将机模训练为场景中成功率100%的干活模型。

第一,如何在广泛任务上达到七八成成功率?这就是机模。今天,在通用小脑范式下,最重要的是进一步扩大数据规模、提升算力,实现Scaling Up——这是银河星树,即五级具身智能金字塔:从互联网数据、人类数据、合成数据,到真机遥操数据和真机回流数据,每一层均发挥自身作用。

人类数据自2022年起打造,迄今仍是规模最大的含标签人手操作数据。2022年,我们率先让人戴上头盔采集双手操作。

8月20日,我们发布了Astra Set自研头戴及双手UMI数据采集装置,可实现高精UMI数据采集,极大推动机模进展。

在此硬件支撑下,我们已有上千个头戴双手UAI采集源在各行各业运行。背后是在线数据管理、标注与筛选系统。依托这套完备的数据基建,我们现有高精UMI数据50万小时,无手持机械装置的人手数据50万小时——共计100万小时,让机器人充分学习人类动作。

机器人动作首先来源于合成数据。银河通用搭建了银河星防全套仿真管线:涵盖仿真资产、动作生成、仿真验证及Sim-to-Real管线。该管线创下全球多项领先——

一是最难仿真。我们今天可实现柔性物体、灵巧手仿真,连洗牌这类最难场景也能做到。

二是Sim-to-Real技术。转笔等全球首次突破的背后,均依托引领级的仿真器。

仿真数据之外,还需真机遥操数据,成本较高。今天,银河通用已在6个省市建立训练场,持续采集各行各业应用数据。

同时,在各行各业部署机器人——银河太空仓覆盖45个城市200个点位,智慧药房落地100家,宁德时代等车场、工厂、医疗康养场景累计回收8万小时真实世界数据。这些数据让机器人知晓自身优劣,持续成长。

具身智能的ChatGPT时刻

何时到来?

在银河星树支撑下,我们判断行业数据正蓬勃发展。从银河视角,即将快速进入ChatGPT水平的机模阶段,唯一条件是机模能否快速落地。为此,我们打造了银河星脑WAM-TTT技术——客户只需拍摄视频,无需任何遥操数据采集,即可后训练模型。

这意味着,无需专业背景的场景使用方,头戴摄像机记录干活过程,我们的后训练仅需视频损失,无需标签、无需动作数据,即可完成。模型落地场景的速度极快、门槛极低,千行百业皆可将机模用起来。

今天,我们判断:具身智能的ChatGPT时刻何时到来?在数据积累与后训练技术持续突破下,银河通用将于2028年问鼎这一目标。一旦到达该节点,行业落地规模与速度将大幅跃升。"十五五"结束时,银河通用将落地数十万台人形机器人于各行业——真正走向多场景应用,以及轮式、双足、灵巧手等多元形态的未来。

建设千行百业应用生态、服务客户只是第一步。未来将进一步开放二开生态——以我们的机模、硬件、数采设备及整套数据管理、后训练能力,帮助更多企业建立具身智能团队,研发自有技能、落地自有场景。

同时,通过世界国际奥林匹克人工智能竞赛等顶级赛事,培育具身智能领域的青年人才,推动全行业共赴具身智能AGI时刻。

最终实现"手机的量、汽车的价、大模型的增益",打开十万亿市场,迎接第四次工业革命。

免责声明:本文观点仅代表作者个人观点,不构成本平台的投资建议,本平台不对文章信息准确性、完整性和及时性做出任何保证,亦不对因使用或信赖文章信息引发的任何损失承担责任。

精彩评论

我们需要你的真知灼见来填补这片空白
发表看法