伯克利等发布 TANGO:首个面向杂乱环境的人形机器人全身VLA导航框架
首个用于杂乱环境中语言条件化的人形穿越的全身VLA框架——TANGO目录01 TANGO整套系统设计数据管线、模型架构、真机部署PETPlan‑Edit‑Track仿真数据生成管线三系统VLA模型架构真实机器人云‑边部署架构02 实验仿真基准 杂乱场景 真机零样本测试03 结语传统人形机器人导航大多沿用轮式机器人的老思路把导航简化成二维平面路径规划。但现实室内充满沙发、桌椅、低矮障碍物、狭窄过道、头顶悬挂物体机器人不是一个质点胳膊、躯干、腿部都会发生碰撞。就算规划出一条看起来可行的路径机器人庞大的躯体可能根本挤不过去。这也是很多人形机器人在真实家庭、办公场景行动笨拙的根源。伯克利联合北大、清华、港大、普林斯顿最新研究 TANGO提出了一套面向杂乱室内环境的全身视觉‑语言‑动作(VLA)导航框架。它不输出二维航点直接输出29自由度全身关节动作整套模型完全在仿真中训练不需要任何真实世界导航数据把人形导航从“找路”推进到“全身协同穿行”的阶段。01 TANGO整套系统设计数据管线、模型架构、真机部署TANGO 采用端到端根据语言指令 第一视角RGB图像直接输出完整全身关节目标角度把导航决策和全身运动生成合并成一个统一模型。整套工作可以拆成三块PET仿真自动数据生成管线、三系统VLA模型架构、云‑边分离真机部署系统。其中PET自动生成大规模高质量仿真轨迹是这套方案能够跑通的重要前提。▲图TANGO架构以及PET计划‑编辑‑跟踪数据生成管线总览PETPlan‑Edit‑Track仿真数据生成管线训练全身VLA最大的阻碍就是数据。动捕采集全身穿行轨迹成本极高很难大批量生成大量“侧身走、下蹲、跨障碍”带语言标注的样本。TANGO没有依赖真人动捕提出PET离线自动合成管线自动生成无碰撞全身导航轨迹。Plan规划阶段在增强后的室内场景使用A*算法做平面路径搜索代价函数加入障碍物距离惩罚。检测到狭窄通道时自动修改机器人朝向生成螃蟹式侧步行走参考轨迹把路径转为速度指令交给SONIC运动规划器生成基础人形行走步态。Edit编辑阶段这是产生避障全身行为的核心。利用三维符号距离场SDF通过伪力软约束修改全身IK逆运动学结果。遇到头顶障碍物触发下蹲地面低矮障碍物修改落脚点实现跨步越障狭窄通道推动躯干、手臂远离墙体。这个阶段只修改姿态保留原始步态节奏不会破坏行走节律。Track跟踪过滤阶段把编辑后的轨迹丢进仿真运动跟踪器做可行性校验会发生碰撞、动力学不可行的轨迹直接丢弃保留编辑阶段的参考运动作为监督信号而不是跟踪之后的轨迹保证运动的拟人化。整套管线产出64633条完整轨迹消耗211个RTX PRO 6000 GPU小时。数据集包含三类典型障碍地面障碍需要跨步、侧向障碍需要侧身、上方障碍需要下蹲。▲图环境增强生成的三类障碍物场景示例图三系统VLA模型架构TANGO采用经典三系统划分System‑2感知推理、System‑1动作专家、System‑0底层运动跟踪器。System‑2感知骨干使用Qwen2.5‑VL‑7B使用InternVLA‑N1权重做热启动。处理前后双相机RGB图像借助BATS预算感知token采样压缩长视频历史把图像token与语言指令融合输出隐式上下文向量z。System‑1动作专家基于流匹配的MM‑DiT扩散Transformer。以感知输出隐向量、机器人本体关节状态作为输入一次性预测未来一段窗口的29维关节角度 基座6D姿态的动作块。训练时引入RTC训练时动作分块条件模拟在线流式推理解决动作块之间的运动不连续问题。System‑0执行层SONIC运动跟踪器接收预测的参考关节轨迹输出高频低级别电机控制指令。模型本身不需要学习底层电机控制专注输出参考运动轨迹。联合损失由VideoQA跨熵损失、流匹配损失两部分组成在保留通用视觉语言能力的同时学习全身动作生成。这里需要区分模型输出的不是电机力矩是期望关节参考角度真正的动力学稳定由SONIC跟踪器负责。这种设计的好处是模型不用处理复杂的电机控制细节代价是最终性能会被底层跟踪器的上限约束。▲图杂乱环境下人形全身导航示意图真实机器人云‑边部署架构硬件为Unitree G1人形机器人采用云‑边缘分离架构云端服务器RTX PRO 6000运行算力消耗大的VLA模型0.5秒做一次推理输出30Hz频率的动作块。机器人机载Jetson Orin NX只跑SONIC跟踪器闭环控制频率200Hz。传感器RealSense D455、D435i获取前视、下视RGB图像图像与本体状态通过网络传到服务器往返延迟大约20ms。配套网页控制面板下发语言指令可视化观测和机器人预测运动。▲图TANGO真实世界部署系统示意图推理得到的动作块会重采样到50Hz下发到机器人。这种分离方案把大模型沉重计算放到服务器机载只负责高频控制但同时引入网络延迟依赖。02 实验仿真基准 杂乱场景 真机零样本测试实验分为VLNVerse标准导航基准、杂乱仿真环境评估、真实机器人测试、消融实验。指标除导航常用SR、SPL、NE之外新增碰撞率CR统计发生至少一次碰撞的episode占比专门衡量全身穿行安全性。很多基线方案是“传送模式”评测也就是不考虑物理执行直接把理想路径拿出来算指标只有TANGO是完整跑在物理仿真存在摔倒、碰撞等物理失败两者指标不能直接简单对比。▲表VLNVerse基准结果在VLNVerse基准测试集上TANGO取得最优成功率SR最低导航误差NESPL指标接近SOTA基线。SPL没有做到第一研究给出的解释是底层跟踪器为安全选择保守运动绕行障碍物路径更长牺牲一部分路径效率换取安全性。▲表增强杂乱仿真环境评估结果在布满障碍物的增强场景对比InternVLA‑N1搭配不同底层控制器的模块化方案。TANGO碰撞率CR降低到9.90%值得一提对比基线HumanoidPF还额外使用激光雷达感知而TANGO仅使用RGB图像输入在感知信息更少的前提下实现更低碰撞。▲表真实世界导航定量实验结果真机实验设置三类场景短距离二维导航、长距离二维导航、带障碍物三维杂乱场景。每类场景15次试验统计成功次数、每轮平均碰撞次数。TANGO在全部三类场景中任务成功率更高平均碰撞次数显著低于InternVLA‑N1 Unitree官方控制器基线。▲图TANGO真实世界部署定性结果图真机演示场景包括30米长距离办公环境导航、窄通道侧身通过、下蹲躲避头顶障碍物、跨步越过地面障碍。全程没有使用任何真机导航数据训练属于零样本迁移。消融实验验证几个关键组件价值去掉RTC实时分块机制成功率暴跌碰撞率显著上升。说明动作块之间连续性对人形连续运动至关重要。移除motion‑editing运动编辑模块碰撞率大幅上涨证明仿真阶段生成带避障行为的监督数据是关键。替换SONIC为另一个通用全身控制器ScaleBFM性能小幅下降依旧可用说明整套VLA模型具备对接不同底层跟踪器的兼容性。▲表动作空间消融实验结果其中2D变体Ours‑2D只预测平面导航不输出全身关节。一旦开启真实物理执行性能直接断崖下跌。这在一定程度上说明只做二维路径规划在人形机器人的杂乱环境中是行不通的。03 结语TANGO代表人形机器人导航一个重要转向导航不只是找到一条地图上的路径而是要考虑机器人整个身体如何穿过环境。过去大家更多关注人形机器人的操作、跑跳能力而家庭、办公室的真实落地恰恰大量需要这种“挤过窄过道、低头避开悬挂物、抬脚跨过地上杂物”的日常穿行能力。当然这套方案也留下不少开放方向如何把深度、激光融合进VLA模型如何压缩VLA模型摆脱对云端服务器依赖如何把全身导航和操作任务结合一边穿行一边完成物体交互目前还是研究原型距离消费级人形机器人成熟产品还有距离但TANGO证明全身VLA模型结合大规模仿真数据可以让机器人听懂语言指令自主调整全身姿态穿行在人类的杂乱环境。Ref论文标题TANGO : Humanoid Navigation in Cluttered Environments with a Whole‑Body Vision‑Language‑Action Model