跨过百万小时数据规模,硅谷具身公司宣布验证具身的Scaling Law

大蒜粒机研所
08-18 20:19

作者 |肖恩

编辑 |德新

如果训练数据规模达到100万小时,具身模型的表现会发生什么样的变化?

过去一年,将训练数据推进到100万小时,是全行业密切关注的关键目标。

本周,首个使用百万小时人类操作视频完成预训练、并系统验证具身Scaling Law的模型Dyna-2正式发布。

如果说过去具身智能的Scaling Law还停留在猜测和假设阶段,那么现在,Dyna-2可以正式宣告:Scaling Law已经得到验证。不仅如此,Dyna-2在世界动作模型和VLA的路线选择上,也给出了自己的答案。

这会是今年至少到目前为止具身智能领域最有分量的技术报告之一,毫无疑问也会影响接下来行业其他公司的路线选择。

下面我们就来看看,Dyna-2到底做了什么?

一、具身模型的Scaling Law得到验证,100万小时只是开始

Dyna-2在超过100万小时的人类第一视角视频上完成预训练。按照每天16小时的清醒时间计算,相当于连续学习了大约170年。

这些视频大多由头戴设备拍摄,记录人在厨房、车间和居住空间里做饭、整理、折叠和组装物品。

Dyna从视频中提取双手的3D姿态,把手腕轨迹转换为动作信号,再用拇指和食指之间的距离表示抓取与松开。这样一来,普通的人类操作视频也能转化为具身模型可以使用的训练数据。

为了观察数据量本身带来的变化,Dyna设置了1000小时、1万小时、10万小时和100万小时四档训练数据规模。

四个数据集采用嵌套结构,每一档都保持相同的数据来源比例。数据规模扩大时,只增加新的数据,不替换原有数据。模型架构、训练方式和评测方法保持不变,唯一变化的就是数据规模。

测试结果呈现出一条清晰的增长曲线。

在一套独立的100小时人类验证集上,Dyna-2的四项动作预测指标都随着数据增加而持续改善,并且能够拟合出明显的幂律曲线。

从1000小时增加到100万小时,严格精度指标Accuracy@0.1提高了51%。它统计的是预测动作落在0.1误差阈值以内的比例,数值越高,说明动作预测越精确。均方误差MSE下降了12%,这一指标衡量预测动作与真实动作之间的平均偏差,数值越低越好。到了100万小时,各项指标仍在继续改善。

由此,Dyna-2把真实世界操作数据的Scaling曲线推进到了100万小时。在这个规模上,模型还没有出现平台期。

不过,人类数据最终还是要用到机器人身上。人手与机器人在关节结构、夹爪形态和动作空间上都有很大差异。只在人类数据上表现变好,并不能说明具身模型真的变强了。

Dyna随后把四档模型直接放到一套机器人数据上测试。

这套数据包含39项任务,来自两种固定式双臂机器人,覆盖布料处理、打结、包装、清洁、餐饮和组装等操作。四档模型在预训练阶段都没有看过任何机器人轨迹,也没有针对机器人进行适配和微调。

随着人类视频从1000小时增加到100万小时,模型在机器人数据上的各项预测指标同样持续改善。

也就是说,模型只看过人类操作,但人类数据越多,它对机器人下一步动作的预测也越准确。其中,从1万小时增加到10万小时,跨本体迁移出现了一次比较明显的性能跃升。

Dyna将这一现象称为“人类到机器人的迁移Scaling Law”。

这也是这次报告最重要的结果之一:人类数据上的Scaling Law,第一次跨过人与机器人之间的本体差异,在机器人数据上重新出现。

二、从离线曲线到真实机器人

离线预测变好以后,Dyna又把四档模型部署到真实机器人上。

实验包含14项任务,涉及精细抓取、绳结操作、柔性物体处理、开锁、组装、多指灵巧手和语言指令跟随,分布在三种机器人形态上。

每项任务使用的机器人示范数据最多不超过10小时,四档模型采用完全相同的后训练方法,不做人类与机器人数据对齐。这样,实验中的主要变量仍然只有一个:预训练阶段使用了多少人类视频。

由于14项任务的计分方式不同,Dyna先把每项得分折算成最高可得分的比例,再计算平均值。结果依次为:

从10万小时增加到100万小时,综合得分从45%提高到53%,增加了8个百分点。100万小时模型在14项任务中的9项取得最好成绩。

一些任务的变化尤其明显。

比如用钥匙打开锁箱,10万小时及以下的模型没有一次成功;到了100万小时,成功率直接达到90%。双五指灵巧手拧瓶盖只使用了大约13分钟的机器人遥操作数据,模型的成功率随着预训练规模扩大,从早期数据档位的10%提高到40%,最终达到50%。在根据文字指令从冰箱中拿取指定饮料的任务中,成功率也从58%提高到83%。

这些结果说明,大规模人类视频并没有取代机器人数据。

Dyna-2先通过人类视频学习物体、动作和环境之间的关系,再用少量机器人数据把这些知识映射到具体的机械臂、夹爪和灵巧手上。

预训练数据越充分,后训练阶段需要从头学习的内容就越少。

三、真正产生迁移的,是对世界变化的预测

人类视频为什么能够教会不同形态的机器人?要回答这个问题,需要先看Dyna-2与上一代模型在技术路线上的变化。

Dyna-1采用的是VLA路线。模型看到当前画面,理解语言指令,然后直接预测下一步动作。

Dyna-2则转向了以世界建模为核心的WAM,英文名称是World-Action Model,也就是世界动作模型。同一个生成模型既预测未来动作,也预测动作发生以后,画面和环境会怎样变化。

简单来说,Dyna-1关注的是“接下来应该怎么做”,Dyna-2还要理解“这样做以后,世界会变成什么样”。Dyna把人类经验向机器人迁移的关键,也指向了这种对世界变化的预测。

未来视频预测主要是一项训练目标,机器人执行任务时,并不需要先生成一段视频再采取行动。

为了验证视频预测到底有没有作用,Dyna在5000小时、5万小时和10万小时三档数据上,设置了三种训练方式:

  • 只预测动作;

  • 使用同一批数据,同时预测动作和未来视频;

  • 在联合预测的基础上,再加入没有动作标注的视频进行协同训练。

三组模型采用相同的架构,之后都在前面的39项机器人任务上做零样本离线评测。

在三档数据规模上,同时预测动作和视频的模型都胜过只预测动作的模型。

只预测动作时,模型会越来越擅长模仿人类双手的运动方式,但随着数据增加,也出现了明显而且不稳定的过拟合。加入未来视频预测以后,跨本体表现更好;再加入大量无动作标注的视频,模型在机器人数据上的泛化能力才随着数据规模稳定增长。

Dyna又做了两组实验,把动作数据量固定下来,只增加视频数据。

第一组固定5万小时带动作标注的数据,额外视频从0增加到1000小时、1万小时和5万小时;第二组固定25万小时动作数据,再分别加入0、25万和75万小时纯视频。两组实验中,机器人评测结果都随着视频增加而持续提高。

有意思的是,这些额外视频对人类动作预测几乎没有帮助,部分指标甚至略有下降。它们改善的主要是模型从人类向机器人迁移的能力。

两种训练方式的差别可以这样理解。只预测动作,模型学习的是“这双手接下来应该怎样移动”。但人的手腕轨迹、手指开合方式和机器人的动作空间并不相同,换一种身体,原来的动作模式很难直接照搬。

预测未来视频时,模型必须理解动作会带来什么结果:杯子被推以后会移向哪里,布料受力以后会怎样变形,瓶盖旋转以后会不会松开,物体在接触和移动中会发生什么变化。手和夹爪的形态可以不同,但物理世界的变化规律是相通的。

因此,从人类迁移到机器人身上的,并不是一套固定动作,而是模型对“动作如何改变世界”的理解。Dyna-2也由此确认,视频本身可以成为具身智能新的Scaling维度:即使不增加动作标注,只增加用于世界建模的视频,机器人上的泛化能力仍然会继续提高。

四、世界动作模型,为什么胜过VLA?

前面的实验说明,未来视频预测是人类经验向机器人迁移的关键。为了直接比较WAM与VLA两条路线,Dyna又把Dyna-2和Dyna-1放在相同条件下进行了测试。

Dyna使用相同的预训练数据、后训练数据和训练参数,对两种路线进行了7项机器人任务的对照实验。参加测试的还是早期版本Dyna-2:当时它既没有使用100万小时数据,也没有采用完整版的视频协同训练。

即便如此,早期Dyna-2的任务成功率仍然达到Dyna-1的1.55倍,完成质量评分达到1.12倍。在逐项对比中,Dyna-2胜出65%,Dyna-1胜出29%,其余6%持平。随着预训练继续进行,WAM的优势也变得更加明显。

切芹菜是其中一个很直观的案例。两代模型使用相同的数据完成后训练,Dyna-2切出的芹菜更薄、更均匀,也更接近专家示范。Dyna改变工作区的光照、调暗环境,甚至短暂遮挡摄像头,Dyna-2仍然能够继续完成任务。

左为Dyna-1,右为Dyna-2

工作人员还做了一次更极端的干扰:不断把已经切好的芹菜重新放回砧板,相当于反复撤销机器人的工作。Dyna-2没有机械地执行固定次数,而是继续清理,直到砧板真正变空。它判断的是任务是否完成,而不是动作是否执行完毕。

这种差异在真实现场更加明显。

在公司内部测试中,Dyna-1和Dyna-2都接近100%通过;部署到没有见过数据的客户环境后,按照质量、吞吐量和可靠性综合计算,Dyna-1的现场通过率为46%,Dyna-2达到87%。两者使用相同的后训练数据和训练步数,差别主要来自预训练模型本身。

Dyna也测试了世界建模对语言指令的影响。测试包括推拉积木、从五个物体中拿取指定物体、按照颜色要求堆叠零件,以及对餐巾执行拾取、旋转、翻转和折叠等操作。

只预测动作时,早期Dyna-2的语言跟随得分为35%;加入视频协同训练后提高到67%;使用完整Dyna-2数据继续训练,得分进一步达到96%。

对于VLA来说,语言通常直接对应动作。对于WAM来说,“推”“拉”“旋转”和“折叠”还对应一种可以在视频里观察到的状态变化。

模型不仅要听懂指令,还要知道执行这条指令以后,画面会如何变化。

五、从预测动作,到理解世界

Dyna-2把1000小时、1万小时、10万小时和100万小时放在同一条实验曲线上,结果证明,人类操作数据扩大到百万小时后仍然有效,而且这种增长可以跨过人与机器人之间的本体差异,一直延伸到真实机器人任务。

进一步的对照实验也找到了迁移发生的原因:模型不只是在模仿人类动作,还通过视频预测学习动作会怎样改变世界。

在此基础上,Dyna-2还把语言跟随得分提高到96%,并把三秒、三视角机器人视频的采样时间从10.2秒缩短到110毫秒,速度提升约93倍。

Dyna在报告结尾写道,100万小时不是Scaling的终点,而是一个新时代的开始。

Dyna-2让具身智能行业关于Scaling Law的讨论,第一次有了百万小时级别的实验支撑。也证明了大规模人类视频作为机器人预训练数据的价值。

与此同时,WAM也不再只是VLA之外的一种尝试,而会成为接下来值得行业重点验证的技术路线。

科技核心圈
讨论半导体公司和行业动态,寻找投资机会
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。

精彩评论

我们需要你的真知灼见来填补这片空白
发表看法