新技术助力人形机器人通过单一控制实现跑、跳及任务处理
发布于:

正文
本文由新莱福 - MIM(Newlife - MIM)转载。所有版权归原始出版商所有;请参阅下方来源。
该运动生成器能够接收人类遥操作、文本、视频和音乐输入,并将其直接转换为全身人形机器人控制信号。 研究人员设计了一个大规模框架,利用从遥操作、视频到文本和音乐的多种输入来控制人形机器人。 该系统名为 SONIC,使机器人能够执行自然的全身动作,包括跑步、跳跃、抓取,并在不同动作之间平滑过渡。 与许多针对特定任务构建的现有控制器不同,SONIC 旨在通过单一策略支持广泛的运动。 NVIDIA 的研究人员在仿真环境和实体人形机器人上演示了该框架,展示了其执行多样化动作和日常任务的能力。
可扩展的人形机器人控制 SONIC 是一个大规模人形机器人控制框架,以运动追踪为基础来生成自然的全身机器人动作。SONIC 并未为单项技能训练独立的控制器,而是采用单一策略,基于超过 1 亿帧动作数据进行训练,使机器人能够复现多样化动作,同时提升对训练未见动作的泛化能力。 该系统解决了人形机器人领域的一个主要局限:现有的控制策略通常是围绕特定任务设计的相对较小的神经网络,新行为往往需要单独设计目标并进行训练。SONIC 则将运动追踪视为一个可扩展的学习问题,利用来自人类动作数据的密集逐帧监督,为庞大且多样的行为集合提供一致的训练信号。
研究人员从三个维度对 SONIC 进行了扩展:训练数据、模型容量和算力。训练数据集包含从约 700 小时动作捕捉数据中提取的超过 1 亿帧画面,最大模型包含 4200 万个参数。训练最多使用了 128 块 GPU,耗时约 21,000 GPU 小时。实验表明,随着数据量、模型规模和算力的增加,系统的追踪能力和泛化能力逐步提升。 SONIC 的核心组件是其通用令牌空间,它允许将不同类型的运动输入转换为共享表示。专用编码器处理机器人运动、人类运动和混合指令,然后将其转换为量化令牌,输入通用的机器人控制解码器。该架构使同一控制策略能够将运动追踪与 VR 遥操作、基于视频的控制、文本指令、音乐驱动的动作生成以及视觉-语言-动作模型连接起来。 研究团队在声明中表示:“我们期望 SONIC 能够作为一个实用的基础,在此基础上构建更高级的感知与推理能力,从而推动通用人形机器人的自主性发展。”
全身机器人控制 该框架还包含一个实时运动学规划器,可在关键帧之间生成短动作片段。规划器可根据传入指令持续重新规划,无需重新训练底层策略即可实现方向、速度和运动风格的交互式调整。这赋予了 SONIC 一个控制层,能够将高层运动意图转化为连续的全身动作。 在多模态控制方面,SONIC 可接收由视频生成的人类动作、自然语言指令或音乐,并将这些动作输入其追踪策略。视频输入可来自预录片段或实时网络摄像头流,文本提示可指定行走或踢腿等动作。基于音乐的控制则根据节奏和旋律信息生成舞蹈动作,系统能够在不同输入模态之间切换。 研究人员将 SONIC 部署在宇树 G1 人形机器人上,并展示了其在现实世界中追踪多样化动作的能力。该系统在 123 个现实世界动作序列中实现了 99.2% 的成功率,而在仿真环境中为 100%,显示出较小的仿真到现实性能差距。 SONIC 还通过其通用令牌接口与视觉-语言-动作模型相连。在五项全身任务中,该系统平均成功率达到 75%,包括拾取物体、用脚踏板打开垃圾桶,以及协调手脚动作将易拉罐移入垃圾桶。 研究人员认为,这种共享的动作表示将使更高级的 AI 系统更容易控制整个人形机器人身体,而不是将移动和操作视为独立的问题。
资讯来源
- interestingengineering.com (2026-08-12) - 原文:New tech helps humanoids run, jump and handle tasks with one control