小米主张,先扩展机器人数据,再扩展机器人模型

小米发布了一款新的机器人模型 Xiaomi-Robotics-1,其核心论点可能会影响下一代机器人系统的训练方式:在让机器在现实世界中操控物体这件事上,更多数据也许比更大的模型更重要。

这一结论呼应了大型语言模型中的一个熟悉规律,即随着训练数据和算力增加,性能通常会提升。但机器人领域有不同的瓶颈。文本模型可以从庞大的公开互联网中汲取信息,而机器人模型不行。用于抓取、搬运、放置以及适应陌生空间的数据更难收集,标注成本更高,而且通常只适用于狭窄的硬件设置。

小米的方法之所以引人注意,是因为它试图在不主要依赖昂贵实体机器人车队的情况下打破这一瓶颈。相反,公司表示,它使用配备摄像头的便携式手持夹爪收集了大部分预训练数据。人们直接在真实环境中手持操作这些工具,记录了厨房、办公室、商店、工厂地面以及户外场景中的操作任务。

据公司称,最终得到的数据集包含超过10万小时的运动记录,覆盖了1700多个不同环境。这个规模很重要,因为机器人学习系统往往难以泛化到它们在狭窄、脚本化采集过程中见过的布局、物体和流程之外。小米认为,在最初的数据采集阶段使用手持设备而不是完整机器人平台,可以更快、更低成本地收集更广泛的经验。

应对机器人数据短缺的另一种方案

收集机器人操作数据的标准方法很慢。一个人远程引导机器人逐步完成任务,每次只做一个动作,从而生成针对该机器的传感器、关节和夹爪定制的示范。这个方法有效,但不容易规模化,而且通常只能得到来自相似环境的重复样本。

预训练数据集概览,展示了来自家庭、办公室、工业场所、餐厅、商业空间和户外场景的摄像画面,并标注了关键数字:10万小时、1700个场景、240万段episode和260多个任务,以及物体和动词的词云。
预训练数据来自大约10万小时的 UMI 录制,覆盖了1700多个不同环境。| 图片:小米

小米的手持方案旨在绕开这一限制。由于人们只需把夹爪带到不同空间并直接使用,就能从远多于机器人车队通常覆盖的场景中收集样本。不过,这并不能消除迁移问题。手持夹爪并不等同于轮式机器人或双臂系统。模型仍然必须学会,将人类操作工具记录下来的运动模式映射到真实机器人的物理约束和控制系统上。

小米表示,它通过在后续阶段将预训练系统迁移到实体机器人上来解决这一问题,其中包括轮式平台和双臂系统。在后训练阶段,公司把自己从真实公寓中录制的数据,与开源机器人数据集和标注过的 UMI 数据结合起来。由此呈现的是一条分层流水线:广泛且低成本地收集操作经验,规模化标注,然后将其适配到实际执行任务的硬件上。

这对更广泛的机器人行业可能意义重大,因为该领域长期面临一个令人不舒服的错配。研究人员希望获得通用型机器人行为,但用于训练它的数据基础设施往往仍然是本地化、定制化且昂贵的。小米实际上是在主张,机器人 AI 的进步路径可能更像基础模型开发,而不像传统机器人工程,也就是预训练语料的质量、规模和多样性成为战略资产。

自动标注让大规模采集变得可行

收集10万小时的操作数据只是问题的一半。这些录制内容还需要能让模型学习的描述。小米表示,在这个规模上进行人工标注并不可行,因此它使用了另一套 AI 系统为每个动作片段生成文本描述。公司称,它在大约两周内完成了整套数据集的标注。

这一步很重要,因为设计用于跟随口头或书面指令的机器人模型,需要在运动和语言之间建立桥梁。如果标注质量足够高,模型就能开始把文本目标与物理动作和场景变化联系起来。如果标注质量较弱或不一致,仅靠规模并不能挽救性能。小米所披露的时间表表明,自动化标注正成为机器人领域的核心环节,不只是为了方便,更是构建足够大、足以支撑广泛泛化的数据集的前提。

该模型本身旨在无需事先接触陌生环境,就能遵循口头或书面指令,并在额外训练有限的情况下适应新任务。这是一个雄心勃勃的目标,但它与整个行业更广泛的趋势一致,即从面向特定任务的机器人策略转向能够在不同场景和指令之间迁移知识的系统。

后训练数据的三部分概览,展示了内部机器人录制、移动操作机器人和双臂机器人的渲染图、开源机器人数据,以及带指令标签的 UMI 数据。
在后训练阶段,小米将来自真实公寓的自有录制数据,与开源机器人数据集和标注过的 UMI 数据结合。| 图片:小米

为什么小米的结果不只关乎某一个模型发布

在小米的测试中,扩大模型规模确实提升了性能,但增加训练数据带来的提升要大得多。这就是核心结论。如果这一结果在小米的内部评估之外也站得住脚,那就意味着,提升机器人操作能力的最快路径可能并不只是不断扩大架构。它也可能是更有能力收集更丰富、更多样的物理经验,并以规模化方式将其与语言连接起来。

这对公司如何配置资本有现实影响。更大的模型需要更多算力,但更大且更多样的数据集则需要采集系统、标注流程、存储、整理,以及能够吸收现实世界复杂变化的迁移方法。能够解决这些运营问题的公司,可能会获得仅靠模型扩张难以复制的优势。

这也重新定义了机器人领域的一个关键问题:不仅是模型抽象意义上的智能程度,还有它实际上“见过”多少物理世界。对于语言模型,互联网提供了这种广度。对于机器人,则没有现成的对应语料。小米的工作表明,这个行业可能需要通过新工具和新流程去“制造”这份语料,而不是等待它自然出现。

仍然存在一些未解问题。所提供材料没有包含独立基准测试细节、部署结果,或在特定任务上的失败率。它也没有展示该模型在迁移到差异很大的机器人形态之间时表现如何。不过,即便有这些保留,这一发布仍然引人注目,因为它把注意力从抢眼的模型规模转向了不那么光鲜但更关键的数据生成问题。

对于一个渴望打造能够在家庭、工作场所和公共空间中运作的机器人的行业来说,这或许是更具决定性的转变。小米展示的不只是一个机器人模型,而是在阐述机器人 AI 下一阶段进步可能来自哪里:更多、更广地接触物理世界,并以足够大的数量和多样性记录下来,让机器人开始像现代 AI 一样,从经验中学习。

本文基于 The Decoder 的报道。阅读原文

Originally published on the-decoder.com