别再让机器人死记动作了机器人要走进真实环境关键不只是“学会更多动作”而是能不能把自己的判断讲清楚。过去许多视觉-语言-动作系统的路径很直接给模型看大量人类演示让它从画面和指令中学习“应该怎么动”。这条路有效但也有一个很现实的问题一旦桌面换了、物体换了、任务表述变了系统为什么会成功或失败往往很难说清。更麻烦的是补一次新场景常常意味着重新收集数据、重新训练。我更看好另一种思路不要把感知、理解、推理和执行揉成一个黑盒而是让每一步都交出一份可读的“账本”。一我理解的关键把世界翻译成可推理的数值这套方法把机器人处理任务的过程拆成四段1. 看见什么相机识别桌面上的物体并给出类别、三维位置和朝向。2. 这些信息代表什么把视觉结果转成带明确物理含义的数值描述例如物体中心点、三维包围盒、可抓取位姿。3. 下一步该做什么大语言模型读取用户指令和这些数值生成一串可检查的操作计划。4. 如何真正完成动作抓取模块给出六自由度位姿路径规划器把计划变成机械臂轨迹。这与“端到端地从图像直接预测动作”有本质区别。机器人不再只给出一个动作而是能展示我识别到了哪些物体、我为什么要先移动哪个、目标位置如何计算、接下来会执行什么。比如面对“把桌上的物品分类”这句话系统先从场景中得到苹果、桃子、玩偶、网球和两个篮子的几何信息随后利用常识判断水果与玩具再结合篮子的位置形成按顺序抓取、搬运、释放的计划。每一个判断都能回溯到具体输入而不是藏在一个难以解释的向量里。二数值信号是我觉得最聪明的连接方式我最喜欢的设计不是用了多大的模型而是模块之间传递的内容足够“具体”。对于语言模型而言纯视觉特征很像一团压缩过的感受而像 [x, y, z, α, β, γ, width] 这样的抓取描述则是带坐标、方向和夹爪开度的明确动作候选。前者需要从演示中反复学习“这团特征意味着什么”后者可以直接进入空间、数学和常识推理。一个极简的计划数据结构大致可以写成这样pythonscene {apple: {center: [0.18, -0.12, 0.04]},toy: {center: [-0.20, 0.10, 0.06]},fruit_basket: {center: [0.38, -0.16, 0.10]},}plan [{pick: apple, place: fruit_basket, release: True},]这当然还不是控制器可以直接执行的完整代码却已经让错误定位变得非常直观识别错了物体抓取位姿不可靠目标点越出工作空间还是推理顺序错了每一种问题都对应不同模块不必在一个巨大的策略网络里盲猜。三不训练也能泛化吗我认为要谨慎地说“有条件地能”真实机械臂试验覆盖了定量移动、重排、按模糊需求取物、分类、倒水和放进抽屉等六类任务共 240 次操作平均成功率达到 **91.67%**。在没有针对性演示数据的陌生桌面设置中两个对比系统没有形成有效动作这一点很能说明问题真正昂贵的不是一次推理而是为每个新环境重新准备示范数据。不过我不会因此把“无需训练”理解成万能钥匙。这里的能力建立在几个前提之上- 视觉模块要能稳定识别物体和姿态- 抓取模块必须为目标物体提供可执行的位姿- 语言模型要能在给定格式内做可靠规划- 环境不能在计划执行过程中发生太大的变化。测试也把短板暴露得很清楚。碰撞是最主要的失败来源之一因为系统尚未把障碍规避、力控和触觉反馈完整纳入闭环语言模型推理大约需要 15 秒也不适合高频操作当前视觉只在任务开始时读取一次物体中途移动就可能让原计划失效。它对刚性、清晰、桌面上的日常物品更友好遇到透明、反光、柔软或关节型物体难度会迅速上升。四我从中得到的启发可靠性来自“可替换、可验证、可闭环”我不认为未来的具身智能会只剩下一种路线。端到端策略依然擅长高速、连续、反射式控制显式推理则特别适合多步骤、需要解释、需要临时适配的任务。更有希望的组合是让前者负责动作的灵巧性让后者负责任务层的逻辑与审计。真正值得继续推进的是把这条显式链路做成闭环每执行一步就重新观察一次发现物体偏移就重算目标遇到接触就引入力觉和触觉约束再把通用大模型压缩成专注机器人规划的小模型以降低延迟。当机器人能够说清“我看到了什么、我为什么这样做、如果失败该查哪里”它才更像一个可以进入工厂、家庭和公共空间的协作者而不只是会复现训练数据的机械臂。我最看重的不是让机器人看起来更像人而是让它在行动前后都能留下人能读懂、也能复核的理由。参考资料Gui, S., Gui, K., Luximon, Y. Explicit task reasoning empowering robotic manipulation. npj Artif. Intell. (2026)
