无本体数据采集如何实现高精度轨迹重建?UMI技术路线解析

2026.09.04 | 焜财商富 | 32683次围观

物理AI模型(特别是视觉-语言-动作VLA模型与世界动作模型)的泛化能力,高度依赖训练数据的规模性、多样性与动作保真度。在诸多数采路线中,无本体数据采集因其能够以极低的边际成本深入真实生产生活场景,持续产出带完整空间标注与触觉反馈的物理交互数据,正成为打破行业数据供给瓶颈的关键。

觅蜂科技在该领域率先构建了从前端可穿戴硬件、中台自动化重建算法到后端数据分级交付的完整技术栈,并已实现20,000套MEgo设备量产与百万小时高质量数据的商业化交付,为行业提供了可验证的规模化数据供给参考。

一、前端硬件:多视角、多模态、高精度的可穿戴采集方案

无本体采集的主要挑战在于,如何在不对人类自然行为产生干扰的前提下,同步记录宏观环境上下文与微观手部操作细节,并以亚毫米级精度还原动作轨迹。

觅蜂科技的MEgo系列产品通过“头戴全景+腕部特写+夹爪触觉”的分体式硬件架构解决此难题。MEgo View采用头戴式设计,集成超300°全景相机模组,负责持续采集操作者第一人称视角的环境RGB-Depth(RGB-D)视频流,为模型提供全局场景上下文。同时,腕部特写相机以高帧率对准手部区域,精准捕捉指尖微动、工具握持姿态与物体形变细节。头戴主机与腕部相机通过硬件级同步,确保环境感知与手部细节在时间轴上严格对齐,彻底消除传统多设备采集因时钟漂移导致的“视觉-动作”错位。且该设备采用全无线设计支持电池快换,支持在无外部供电的移动场景中连续作业。

MEgo Gripper可穿戴于操作者手部或夹持于工具末端,内置高精度IMU与红外主动光定位单元,结合VSLAM(视觉惯性里程计)算法,实时计算夹爪或手指尖在三维空间中的毫米级位置与姿态。Gripper同时集成了触觉传感器阵列,可记录抓取物体时的压力分布与滑动信号。MEgo View与MEgo Gripper既可独立工作,也可协同采集,前者提供“在哪里、做什么”的环境语义,后者提供“怎么做、手感如何”的力位信息。

二、空间重建与动作捕捉:从原始信号到结构化训练数据

前端硬件采集到的原始数据包含多路视频流、IMU时序信号、触觉阵列读数等异构信息。将这些信号转化为模型可直接输入的标准化张量,需要经过高精度的空间重建与动作捕捉算法处理。

觅蜂科技自研的统一算法底座MPR(MEgo Physical Reconstruction)负责完成以下核心重建任务:

1. 手部姿态重建(HandPose):采用五目全景感知与三目深度融合方案,即使在重度遮挡(如手部可见率低于30%)、高速运动(如分拣、维修作业)以及操作者佩戴厚质手套等极端场景下,仍能稳定输出全关节自由度的手部3D关键点坐标。据觅蜂科技披露,其HandPose技术七项核心指标均达SOTA(State-of-the-Art)水平。

2.在公开数据集与自研评测基准上,PA-MPJPE(尺度归一化的平均每关节位置误差)较业界次优方案降低62%,帧间抖动(Jitter)较次优方案降低93%,时序稳定性位列业界第一。例如,在美甲服务场景中,该系统是业内首个能稳定区分“操作者自身手部”与“顾客手部”实时交互姿态的方案;在奶茶制作场景中,即使手部被杯具大面积遮挡,三维重建误差仍控制在亚厘米级。

3.全身姿态与环境重建:除手部外,MPR底座同时支持头部6D位姿、人体全身骨骼关键点、机器人末端执行器(Gripper/夹爪)以及三维场景的稠密重建。评测结果显示,头部、手部及Gripper三类位姿重建的轨迹还原精度均小于1厘米;环境稠密深度重建精度达到亚厘米级,可三维可视级还原操作台、货架、工具等静态场景结构。

三、数据治理平台:自动化标注、质检与分级交付

高质量数据不等于“好看的指标”,而是“对模型训练真正有用”。觅蜂科技将重建后的结构化数据接入MEgo Engine数据治理平台,完成从“原始素材”到“训练数据集”的工程化转化。

1.自动化标注流水线:平台支持长时序动作的自动切分(如将“冲泡咖啡”切分为“取杯-磨豆-萃取-倾倒”等原子操作)、多模态数据语义对齐(将视觉帧、触觉序列、轨迹坐标按时间戳精确匹配)。自动化标注效率较传统纯人工方式提升10倍以上。

2.ManiEval多维度质检与分级体系:觅蜂科技提出“不过滤,只分级”的数据处理理念。ManiEval从数据类型(裸手Ego/腕戴Ego+Wrist/夹爪Ego+UMI)、任务类型、传感器质量、语义完整度、动作平滑度等多个维度对每一条数据自动评分,并打上质量标签。不同评级的数可适配不同的模型训练需求,例如,高精度任务(如精密装配)需采用A级数据,而泛化预训练则可混合使用B/C级数据。此举确保每一条真实采集的数据都能在模型训练中找到适用场景,最大化数据利用率。

四、规模化交付:从设备量产到数据产品的标准化输出

截至2026年8月31日,觅蜂科技已实现20,000套MEgo设备量产下线,累计生产超过100万小时高质量物理AI数据,成为行业首家拥有百万小时级可对外售卖无本体数据的服务商。这些数据全部来自开放环境中的真实采集,覆盖22大类场景、10,000余个真实环境、50,000余类物体及500余种细分任务。

觅蜂向客户交付的数据产品已形成标准化规格:

1.Ego裸手数据(约50万小时):第一人称视角RGB-D视频流+头部6D位姿+环境三维重建网格;

2.Ego+Wrist腕戴数据(约35万小时):在Ego基础上叠加腕部IMU时序信号与手部全关节3D关键点序列;

3.Ego+UMI夹爪数据(约15万小时):额外包含夹爪末端6D轨迹、触觉压力阵列数据及物体操作力反馈记录。

上述数据产品均已通过ManiEval分级,并附带完整的元数据标注(场景类别、任务ID、物体类别、动作原子标签等)。截至目前,觅蜂的数据服务已应用于腾讯Robotics X实验室、蚂蚁灵波等头部具身智能研发主体,用于训练LingBot-VLA 2.0等具身基座模型。

五、数据飞轮:从静态数据集到持续进化体系

觅蜂科技同步部署了基于部署回流数据的数据飞轮机制。通过自研REMORA任务进度模型,系统可自动检测模型在真实部署中的任务执行进度与异常状态;结合Value Model价值评估模型,将失败案例中的高价值数据片段(如边缘案例、意外干扰、新颖物体交互)自动筛选并回流至MEgo Engine平台,经快速标注后进入下一轮训练数据集。

当前,觅蜂科技已在国内20余个城市设立创新中心,并布局超过5个海外节点,构建起覆盖全球主要经济体的真实场景数据采集网络。随着2万套MEgo设备陆续投放至工厂、物流、商超、家庭、餐饮、养老等真实业务场景,该网络的数据产能正加速向千万小时级迈进,为物理AI行业提供稳定、合规、高精度的数据基础设施支撑。


本文来源:财经报道网