1. 具身智能数据采集的路线之争为什么采集方案比模型本身更值得关注做具身智能这行的人都有一个共识模型架构可以复现算力可以堆但高质量的真实世界操作数据是花钱都不一定买得到的稀缺资源。我过去一年多先后参与了三个不同规模的具身智能项目从桌面级机械臂抓取到移动操作平台踩过最大的坑几乎都不在训练环节而是在数据采集这一步。采集方案选错了后面标注、训练、评测全都要推倒重来。目前业内主流的采集路线大致分成三派以第一人称视角为核心的Ego类方案、以手持夹爪设备为代表的UMI方案以及把视觉、触觉、力觉、位姿等多路信号统一汇聚的多模态采集平台。这三者不是简单的谁替代谁的关系而是对应着不同的任务复杂度、预算规模和团队工程能力。Ego方案轻、快、便宜适合快速验证和规模化铺量UMI方案精度高、操作直觉强适合精细操作任务多模态平台则是冲着工业级落地去的成本高但数据维度最全。这篇文章面向的是正在选型或已经踩坑的具身智能从业者包括机器人算法工程师、数据采集负责人、以及想从传统自动化转过来的团队。我会把三种方案的核心原理、硬件选型逻辑、时间同步这个最容易被忽视的坑、以及实测中遇到的典型问题全部拆开讲。读完你应该能判断你的任务到底该用哪套方案以及怎么用最低的成本把它跑通。2. 三条技术路线的整体设计与选型逻辑2.1 Ego方案第一人称视角的规模化采集思路Ego这个词在具身智能语境下指的是以操作者自身视角记录操作过程的数据采集范式。它的核心逻辑非常朴素人类做操作任务时眼睛看到的就是最自然的观测视角手部动作就是最直接的执行信号。所以Ego方案通常由头戴式或胸挂式相机模组加上手部追踪设备组成采集的是我看到什么、我的手怎么动这一对映射关系。为什么Ego方案在近两年突然火起来根本原因是数据规模焦虑。具身智能模型对数据量的需求是传统机器人学习的几十倍甚至上百倍靠遥操作一台一台机器人采集效率低到令人绝望。Ego方案把采集设备从昂贵的机器人本体上剥离出来变成一套可以批量复制、普通人就能穿戴的采集套件采集效率直接提升一个数量级。从技术实现上看Ego方案的关键在于手部姿态的还原精度。常见做法有两种一种是基于视觉的手部关键点检测用单目或双目相机加算法推断手部21个关节点另一种是佩戴带IMU的动捕手套直接读取关节角度。前者成本低但精度受遮挡影响大后者精度高但手套的标定和漂移问题很烦人。我实测下来视觉方案在快速操作时关节抖动明显动捕手套在长时间采集后会有累积漂移比较稳妥的做法是两者融合用视觉做校正、用IMU做高频补充。Ego方案的另一个设计要点是相机的外参标定。头戴设备和手部之间的相对位置在每次穿戴时都会变化如果不做在线标定采集到的数据里手部位置就是错的。业内常见的做法是在采集开始前做一个简单的标定动作比如让手在相机视野内做几个已知轨迹的运动用这段数据反解外参。这个步骤看起来简单但实际采集时经常被忽略导致整批数据报废。2.2 UMI方案手持夹爪的精度优势与操作直觉UMI是Universal Manipulation Interface的缩写核心思路是把一个带相机的夹爪作为采集终端操作者手持这个夹爪完成操作任务夹爪上的相机记录下操作过程中的视觉信息和夹爪的开合状态。相比Ego方案UMI最大的优势是采集到的动作可以直接映射到机器人的夹爪上中间不需要复杂的手到夹爪的映射转换。这个优势为什么重要因为人手和机器人夹爪的运动学结构完全不同。人手有多个手指、自由度极高而大多数机器人夹爪只有开合一个自由度。Ego方案采集的手部数据要转换成夹爪控制信号需要做降维和映射这个过程中会丢失大量信息而且映射关系很难标定准确。UMI直接用夹爪采集采集的就是夹爪的开合轨迹部署到机器人上时几乎可以零转换。UMI方案的硬件设计有几个关键点。第一是夹爪上相机的安装位置通常采用腕部视角也就是相机跟着夹爪一起运动这样采集到的视觉信息和机器人部署时的腕部相机视角一致。第二是夹爪开合状态的编码方式常见的是用霍尔传感器或者电位器读取开合度精度要求不高但稳定性要好。第三是整个设备的重量和重心太重会影响操作者的操作自然度太轻又容易在快速操作时晃动。我实测UMI方案时最大的感受是操作直觉非常好基本上拿起来就能用不需要太多训练。但它的局限也很明显只能采集夹爪级别的操作对于需要多指灵巧操作的任务无能为力。另外手持采集的重复精度受操作者影响很大同一个任务不同人采集的数据分布差异明显这对后续训练的一致性有影响。2.3 多模态采集平台工业级落地的必然选择多模态采集平台是三种方案里最重的一类通常由固定安装的多路相机、力/力矩传感器、触觉传感器、以及高精度位姿追踪系统组成。它的目标不是快速铺量而是采集高保真、多维度、时间严格对齐的数据用于训练对精度和鲁棒性要求极高的模型。为什么工业场景必须用多模态平台因为工业任务对失败率的容忍度极低。一个抓取任务在实验室里90%成功率可能就算不错了但在产线上99.9%都不一定够。要提升这最后几个百分点模型必须能感知到力的大小、触觉的分布、以及微小的位姿偏差这些信息只有多模态平台能提供。多模态平台的核心技术难点在于时间同步。视觉、力觉、触觉、位姿这些信号的采样率不同相机可能是30Hz或60Hz力传感器可能是1kHz位姿追踪可能是100Hz以上。如果这些信号的时间戳没有对齐到同一个时钟基准融合出来的数据就是错的。业内常见的做法是用硬件触发同步也就是用一个主时钟源同时触发所有传感器的采样确保每个采样点的时间戳严格一致。软件同步虽然成本低但在高动态任务中误差会累积到不可接受的程度。另一个难点是标定。多路相机之间的外参、相机与力传感器之间的坐标变换、触觉传感器在夹爪上的安装位置这些都需要精确标定。标定误差会直接传递到采集数据里而且很难在后期修正。我的经验是标定环节至少要留出整个项目20%的时间预算而且每次设备移动或碰撞后都要重新标定。2.4 三种方案的选型决策框架选型不是选最好的而是选最合适的。我整理了一个决策框架从任务复杂度、精度要求、预算、团队工程能力四个维度来判断。维度Ego方案UMI方案多模态平台适用任务粗粒度操作、移动操作夹爪级精细操作工业级高精度任务数据维度视觉手部姿态视觉夹爪状态视觉力触觉位姿单套成本低中高采集效率高中低时间同步要求低中极高团队工程门槛低中高数据可直接部署性低高高如果你的任务是快速验证算法可行性或者需要大规模铺量采集Ego方案是首选。如果任务是夹爪级的精细操作且希望采集的数据能直接部署到机器人上UMI方案性价比最高。如果任务是工业级落地对成功率和数据维度有硬性要求那就只能上多模态平台没有捷径。3. 核心细节解析与实操要点3.1 Ego方案的手部姿态还原与标定实操Ego方案里最核心的技术环节是手部姿态的还原。我试过三种主流做法分别说说实测感受。第一种是纯视觉方案用单目RGB相机加手部关键点检测模型。优点是硬件简单一个普通摄像头就能跑。缺点是深度信息丢失手部前后移动时关键点的尺度变化会被误判为手的大小变化导致姿态估计不准。而且手部自遮挡在抓取动作中非常常见一旦遮挡关键点就丢失数据出现空洞。第二种是双目视觉方案用两个相机做立体匹配来恢复深度。精度比单目好很多但计算量大而且两个相机的同步和标定要做好。我实测下来双目方案在光线充足、手部无遮挡时精度可以做到毫米级但一旦进入阴影区域或者手部快速运动匹配失败率明显上升。第三种是动捕手套方案直接读取手部关节角度。精度最高不受遮挡影响但手套的标定很麻烦。每根手指的关节零位、关节之间的耦合关系、手套在手上的滑动都会影响精度。我的做法是每次采集前做一个标准标定动作让操作者做握拳、张开、对指等动作用这些数据在线校正手套的零位和耦合参数。标定环节还有一个容易被忽视的点头戴相机和手部之间的外参。这个外参在每次穿戴时都会变必须在线标定。我的做法是在采集开始前让操作者在相机视野内做一个已知轨迹的运动比如在桌面上画一个已知大小的矩形用这段数据反解外参。这个步骤只需要30秒但能避免整批数据报废。注意Ego方案采集的数据在用于训练前一定要做手部姿态的平滑处理。视觉方案的关键点抖动和动捕手套的高频噪声都会影响训练效果。我通常用滑动平均加卡尔曼滤波的组合窗口大小根据操作速度调整快速操作时窗口小一些慢速操作时窗口大一些。3.2 UMI方案的夹爪设计与数据映射UMI方案的核心硬件是手持夹爪。我拆过市面上几款常见的UMI夹爪设计思路大同小异但细节差异对采集质量影响很大。夹爪的开合度检测常见的有三种方案霍尔传感器、电位器、以及视觉测量。霍尔传感器非接触、寿命长但精度受磁场干扰电位器精度高、成本低但机械磨损后会有噪声视觉测量用相机看夹爪上的标记点精度最高但计算量大。我实测下来霍尔传感器在大多数场景下够用精度可以做到开合范围的1%以内而且稳定性最好。夹爪上相机的安装位置很关键。常见的有两种一种是安装在夹爪根部视角覆盖夹爪前方另一种是安装在夹爪侧面视角偏向一侧。前者适合抓取任务能看到夹爪和目标物体的相对位置后者适合操作任务能看到夹爪与环境的交互。我的建议是根据任务类型选择如果任务以抓取为主选根部安装如果任务以操作比如插拔、按压为主选侧面安装。数据映射是UMI方案的关键环节。采集到的夹爪开合轨迹要映射到机器人的夹爪控制信号上这个映射看起来简单实际上要考虑几个问题。第一是夹爪的动力学差异手持夹爪是轻载的机器人夹爪可能有重力负载同样的开合信号在机器人上响应不同。第二是夹爪的机械间隙手持夹爪和机器人夹爪的间隙不同映射时要考虑这个偏差。第三是操作者的手部抖动手持采集时手会不自觉地抖动这些抖动如果直接映射到机器人上会导致动作不平滑。我的做法是在映射前先对采集的轨迹做低通滤波滤掉手部抖动的高频成分。然后在机器人上做几次空载测试测量实际响应与期望响应的偏差用这个偏差做补偿。这个补偿系数不是固定的不同负载下会变化所以最好在部署时在线估计。3.3 多模态平台的时间同步实现细节时间同步是多模态平台最核心也最容易出问题的环节。我踩过的坑包括相机和力传感器的时间戳差了20毫秒导致力觉信号和视觉信号对不上位姿追踪系统的时钟和采集主机的时钟不同步长时间采集后累积误差达到几百毫秒。硬件触发同步是目前最可靠的方案。具体做法是选一个主时钟源通常是采集卡或者专用的同步控制器用它产生周期性的触发信号同时触发所有传感器的采样。这样每个采样点的时间戳都来自同一个时钟不存在累积误差。我用的方案是用FPGA产生触发信号精度可以做到微秒级。如果传感器不支持硬件触发那就只能退而求其次用软件同步。软件同步的做法是每个传感器独立采样但在采样时记录主机的时间戳后期用时间戳做对齐。这种方案的误差主要来自操作系统调度延迟和网络传输延迟通常在毫秒级。对于低速任务可能够用但对于高动态任务就不行了。还有一个容易被忽视的点是传感器的启动延迟。不同传感器从上电到开始稳定输出数据的时间不同相机可能需要几百毫秒力传感器可能只需要几十毫秒。如果采集开始时没有等所有传感器都稳定前几帧数据就是不可用的。我的做法是在采集开始前先让所有传感器空跑几秒确认数据稳定后再开始正式采集。提示时间同步的验证不能只看时间戳还要看实际信号的相关性。我的做法是让操作者做一个已知的冲击动作比如用手拍一下力传感器同时相机记录下这个动作。如果力觉信号和视觉信号的时间对齐正确力信号的峰值应该和视觉中手接触传感器的帧对齐。这个测试能直观地发现同步问题。3.4 多模态平台的标定流程与精度控制标定是多模态平台另一个耗时但必须做好的环节。我通常把标定分成三步内参标定、外参标定、以及手眼标定。内参标定是每个传感器单独做的相机的焦距、畸变系数力传感器的零偏和灵敏度触觉传感器的响应曲线。这些参数在传感器出厂时通常有标称值但实际使用中会有偏差需要重新标定。相机内参用棋盘格标定板力传感器用已知重量的砝码触觉传感器用已知压力的气囊。外参标定是确定多个传感器之间的坐标变换关系。多路相机之间的外参用共同视野中的标定板来标定相机和力传感器之间的外参用已知位姿的标定物来标定。这个环节的精度直接影响数据融合的质量我的经验是外参标定的重投影误差要控制在0.5像素以内否则融合后的数据会有明显的错位。手眼标定是确定相机和机器人末端之间的变换关系。这个标定在采集阶段可能不需要但在部署阶段是必须的。常见的做法是让机器人末端带着标定板做几个已知位姿的运动用相机拍摄标定板反解手眼变换。这个标定的精度要求很高通常要控制在毫米级。标定的频率取决于设备的稳定性。如果设备固定安装不动标定一次可以用很久。但如果设备经常移动或者有碰撞每次移动后都要重新标定。我的做法是每天采集开始前做一次快速标定检查用已知位姿的标定物验证外参是否漂移如果漂移超过阈值就重新标定。4. 实操过程与核心环节实现4.1 Ego方案从硬件搭建到数据落盘的完整流程我以最近做的一个移动操作采集项目为例完整走一遍Ego方案的实操流程。项目需求是采集人在家庭环境中做整理任务的双手操作数据用于训练移动操作机器人。硬件选型上头戴相机用的是双目全局快门相机分辨率1280x720帧率60Hz。选全局快门是因为卷帘快门在快速运动时会有果冻效应影响视觉精度。手部追踪用的是视觉加IMU融合的方案视觉用腕部相机IMU用九轴模组。采集主机用的是小型工控机背在操作者腰上通过USB和相机、IMU连接。搭建流程是这样的先把头戴相机固定在帽子上调整角度让双手都在视野内。然后把腕部相机固定在手腕上IMU固定在手臂上。接着连接采集主机确认所有设备都能正常通信。最后做标定包括相机内参标定、头戴相机与腕部相机的外参标定、以及IMU的零偏标定。标定完成后开始采集。采集时操作者按照任务脚本做整理动作比如把桌上的物品分类放进抽屉。每个任务重复采集20次每次采集前做一次快速标定检查。采集过程中采集主机实时记录所有传感器的数据包括双目图像、腕部图像、IMU数据、以及时间戳。数据落盘时要注意存储格式。我用的格式是每个采集序列一个文件夹里面包含图像序列、IMU数据文件、以及元数据文件。图像用无损压缩格式存储IMU数据用二进制格式存储元数据用JSON格式记录采集时间、操作者、任务类型、标定参数等信息。注意Ego方案采集的数据量很大双目60Hz采集一小时大约产生200GB数据。存储和传输都要提前规划好我通常用外置SSD做采集存储采集完成后立即备份到NAS避免数据丢失。4.2 UMI方案的夹爪标定与轨迹采集实操UMI方案的实操流程和Ego方案有相似之处但夹爪的标定和轨迹采集是它特有的环节。夹爪标定包括开合度标定和相机标定。开合度标定是确定夹爪开合传感器读数与实际开合距离的对应关系。我的做法是用塞尺测量几个已知开合距离下的传感器读数拟合出线性关系。相机标定是确定夹爪相机的内参和外参内参用棋盘格标定外参用已知位姿的标定物标定。轨迹采集时操作者手持夹爪完成任务。采集前先做一次快速标定检查确认夹爪相机的外参没有漂移。采集时夹爪相机以30Hz记录图像开合传感器以100Hz记录开合度。采集主机实时记录这些数据和时间戳。采集完成后要做轨迹后处理。第一步是滤波滤掉手部抖动的高频成分。第二步是分割把连续采集的数据分割成单个任务片段。第三步是标注给每个片段打上任务类型标签。第四步是映射把夹爪开合轨迹映射到目标机器人的夹爪控制信号上。映射环节我重点说一下。映射不是简单的线性缩放因为手持夹爪和机器人夹爪的动力学特性不同。我的做法是先做线性缩放把开合范围映射到机器人夹爪的开合范围。然后做动力学补偿用机器人夹爪的动力学模型预测实际响应用这个预测做前馈补偿。最后做闭环校正在机器人上实际运行几次测量跟踪误差用这个误差做反馈校正。4.3 多模态平台的数据采集与融合实现多模态平台的实操流程最复杂我以工业装配任务为例走一遍。硬件配置上用了四路工业相机两路全局快门做视觉两路做位姿追踪、一个六维力传感器、一个触觉传感器阵列、以及一个高精度位姿追踪系统。所有传感器都支持硬件触发用FPGA产生同步触发信号。搭建流程先把相机固定在工位周围调整角度覆盖操作区域。然后把力传感器安装在机器人末端和夹爪之间触觉传感器安装在夹爪指尖。接着连接所有传感器到采集主机配置硬件触发同步。最后做标定包括相机内参、相机外参、力传感器零偏、触觉传感器响应曲线、以及手眼标定。采集时机器人执行装配任务所有传感器同步采集。相机以60Hz采集图像力传感器以1kHz采集力信号触觉传感器以100Hz采集触觉信号位姿追踪以200Hz采集位姿。采集主机实时记录所有数据和时间戳。数据融合是采集后的关键环节。融合的目标是把不同采样率、不同维度的信号对齐到统一的时间基准上。我的做法是先做时间对齐用硬件触发的时间戳把所有信号插值到统一的时间网格上。然后做空间对齐用标定参数把不同传感器的数据变换到统一的坐标系下。最后做特征融合把视觉特征、力觉特征、触觉特征拼接成统一的状态表示。提示多模态数据融合时要注意信号的因果性。力觉信号和触觉信号通常滞后于视觉信号因为力是接触后才产生的。融合时要考虑这个滞后不能简单地把同一时刻的信号拼在一起。我的做法是用视觉信号做触发力觉和触觉信号取触发后一段时间窗口内的数据。4.4 三种方案的数据质量评估与对比数据质量评估是选型和优化的依据。我通常从四个维度评估完整性、准确性、一致性、以及可用性。完整性看数据是否有缺失。Ego方案的主要问题是手部遮挡导致的关键点丢失UMI方案的主要问题是夹爪相机在快速运动时的运动模糊多模态平台的主要问题是传感器故障导致的数据中断。准确性看数据是否准确。Ego方案的手部姿态精度受标定和算法影响UMI方案的夹爪开合精度受传感器精度影响多模态平台的精度受标定精度影响。一致性看多次采集的数据分布是否一致。Ego方案的一致性受操作者影响大不同操作者的手部动作差异明显。UMI方案的一致性也受操作者影响但比Ego方案好一些。多模态平台的一致性最好因为机器人执行任务的动作是重复的。可用性看数据是否能直接用于训练。Ego方案的数据需要做手到夹爪的映射可用性最低。UMI方案的数据可以直接映射到夹爪可用性较高。多模态平台的数据维度最全可用性最高但需要做融合处理。评估维度Ego方案UMI方案多模态平台完整性中遮挡问题中运动模糊高传感器冗余准确性中高高一致性低中高可用性低高高采集效率高中低单条数据成本低中高5. 常见问题与排查技巧实录5.1 Ego方案的手部遮挡与漂移问题排查手部遮挡是Ego方案最常见的问题。表现是采集数据中手部关键点突然丢失或跳变。排查思路是先用可视化工具看关键点的时间序列找到丢失或跳变的时刻然后回看对应时刻的图像确认是遮挡还是算法问题。如果是遮挡解决方案有两个一是增加相机数量用多视角覆盖减少遮挡二是用IMU数据做补充遮挡时用IMU积分推算手部姿态。我通常两个方案一起用多视角做主要观测IMU做短时补充。漂移是动捕手套的常见问题。表现是长时间采集后手部姿态逐渐偏离真实值。排查方法是定期做标定检查用已知姿态验证手套读数。如果漂移超过阈值就重新标定。我的做法是每采集30分钟做一次快速标定检查漂移超过2度就重新标定。还有一个容易被忽视的问题是头戴相机的晃动。头戴设备在操作者走动时会晃动导致相机外参变化。排查方法是看采集数据中静止物体的位置是否稳定如果静止物体在图像中移动说明相机外参在变。解决方案是用更紧的固定方式或者在算法中做在线外参估计。5.2 UMI方案的夹爪开合噪声与映射误差夹爪开合噪声是UMI方案的常见问题。表现是开合度读数有高频抖动。排查方法是看开合度的时间序列分析噪声的频率成分。如果是高频噪声通常是传感器本身的问题可以用低通滤波解决。如果是低频漂移通常是传感器温漂或机械间隙需要重新标定或更换传感器。映射误差是UMI方案部署时的常见问题。表现是机器人夹爪的响应与期望不符。排查方法是先在机器人上做空载测试测量实际响应与期望响应的偏差。如果偏差是线性的说明映射系数不对重新拟合即可。如果偏差是非线性的说明动力学补偿不够需要更精细的模型。还有一个问题是操作者的操作习惯差异。不同操作者做同一个任务的动作差异很大导致采集的数据分布不一致。解决方案是制定标准的操作流程让所有操作者按照同样的流程操作。我通常会给操作者做培训让他们熟悉任务脚本和操作规范。5.3 多模态平台的时间同步与标定漂移排查时间同步问题排查的第一步是看时间戳。把所有传感器的时间戳画出来看是否有明显的偏移或跳变。如果时间戳有偏移说明时钟不同步如果时间戳有跳变说明触发信号有问题。时间戳正常但数据对不齐通常是启动延迟的问题。排查方法是看采集开始时的数据确认所有传感器是否都稳定了。如果某个传感器的前几帧数据异常说明启动延迟没处理好。解决方案是在采集开始前让所有传感器空跑几秒。标定漂移是多模态平台的常见问题。表现是采集数据中不同传感器的数据在空间上对不齐。排查方法是定期做标定检查用已知位姿的标定物验证外参。如果漂移超过阈值就重新标定。我的做法是每天采集开始前做一次标定检查采集过程中每两小时做一次快速检查。注意多模态平台的标定漂移往往不是渐变的而是突变的。设备碰撞或温度剧烈变化都可能导致标定参数突变。所以标定检查不能只看趋势还要看突变。我的做法是设置一个突变检测如果相邻两次检查的标定参数差异超过阈值立即重新标定。5.4 三种方案的数据存储与传输问题数据存储是三种方案都面临的问题但严重程度不同。Ego方案的数据量最大多模态平台的数据维度最多UMI方案介于两者之间。Ego方案的存储问题是数据量大。双目60Hz采集一小时200GB如果采集一整天就是几个TB。解决方案是用无损压缩减少存储空间用外置SSD做采集存储采集完成后立即备份到NAS。UMI方案的存储问题是数据格式复杂。图像、开合度、时间戳的格式不同存储时要统一管理。我的做法是用一个元数据文件记录所有数据文件的信息包括文件名、格式、采样率、时间戳范围等。多模态平台的存储问题是数据维度多。视觉、力觉、触觉、位姿的数据要分别存储还要记录它们之间的对应关系。我的做法是用一个统一的数据格式把所有传感器的数据打包成一个文件用时间戳做索引。传输问题是采集主机和存储设备之间的带宽。Ego方案和多模态平台的带宽需求最高通常需要USB 3.0或千兆网。UMI方案的带宽需求较低USB 2.0通常够用。我的做法是采集时用本地存储采集完成后用高速网络传输到服务器。5.5 常见问题速查表问题现象可能原因排查方法解决方案手部关键点丢失遮挡回看图像确认多视角IMU补充手部姿态漂移手套标定漂移定期标定检查重新标定夹爪开合噪声传感器噪声分析噪声频率低通滤波映射误差大动力学差异空载测试动力学补偿时间戳偏移时钟不同步看时间戳序列硬件触发同步数据对不齐启动延迟看采集开始数据空跑几秒标定漂移设备碰撞定期标定检查重新标定存储空间不足数据量大估算数据量压缩外置存储6. 实操心得与方案扩展建议6.1 从零搭建采集方案的最小可行路径如果你是从零开始预算有限团队工程能力一般我的建议是从Ego方案入手。原因很简单Ego方案的硬件成本最低搭建最快而且采集效率最高。你可以用一套Ego方案快速采集一批数据验证算法可行性然后再决定是否升级到更复杂的方案。最小可行路径是这样的先买一个双目相机和一个IMU模组总成本控制在几千块。然后用开源的手部姿态检测模型做视觉追踪用IMU做补充。采集主机用普通笔记本就行不需要工控机。标定用简单的棋盘格和已知轨迹运动。这套方案虽然精度不如专业方案但足够验证算法可行性。验证通过后再考虑升级。升级的方向有两个一是提升精度换更好的相机和IMU用更精细的标定二是提升数据维度加力传感器和触觉传感器升级到多模态平台。升级的节奏取决于你的任务需求和预算。6.2 多方案融合的采集策略三种方案不是互斥的可以融合使用。我最近做的一个项目就是Ego方案和UMI方案融合用Ego方案采集大范围的移动操作数据用UMI方案采集精细的夹爪操作数据。两种数据在训练时分别使用Ego数据用于训练移动和粗操作UMI数据用于训练精细操作。融合的关键是数据格式的统一。两种方案采集的数据格式不同要统一到同一个数据格式才能一起训练。我的做法是定义一个统一的数据schema包含视觉、动作、时间戳等字段两种方案的数据都转换成这个schema。融合的另一个关键是任务的分割。一个完整的任务可能包含移动、粗操作、精细操作多个阶段不同阶段用不同的采集方案。我的做法是在任务脚本中标注每个阶段的类型采集时根据阶段类型切换采集方案。6.3 采集方案的可扩展性与未来演进采集方案不是一成不变的随着任务复杂度和精度要求的提升方案也要演进。我看到的几个演进方向第一个方向是采集设备的轻量化和集成化。现在的Ego方案还需要背一个采集主机未来可能集成到一个小型设备上甚至直接用手机采集。这会进一步降低采集门槛让更多人能参与数据采集。第二个方向是采集过程的自动化。现在的采集还需要人工操作未来可能用机器人自主采集或者用人机协作的方式采集。这会提升采集效率减少人为因素对数据质量的影响。第三个方向是数据质量的在线评估。现在的数据质量评估是采集后做的未来可能在采集过程中实时评估及时发现和纠正问题。这会减少无效采集提升采集效率。第四个方向是多模态融合的深化。现在的多模态融合主要是视觉、力觉、触觉的融合未来可能加入更多模态比如温度、声音、气味等。这会提升模型对环境的感知能力。我在实际项目中的体会是采集方案的选择没有绝对的对错关键是要匹配任务需求和团队能力。Ego方案适合快速验证和规模化铺量UMI方案适合夹爪级精细操作多模态平台适合工业级高精度任务。三种方案可以融合使用根据任务阶段切换。最重要的是采集方案的设计要从数据使用端倒推先想清楚数据怎么用再决定怎么采。
