机器人训练数据包含什么?图像、视频、深度、点云、状态与动作
机器人训练数据不仅是视频,还包括深度、点云、关节状态、末端位姿、动作、任务指令、时间戳和结果标记。本文解释各类数据的作用、同步关系、Episode组织与存储压力。
- Slug
robot-training-data-modalities- 更新
- 2026-08-20
- 来源
- 5
- 关系
- 4
机器人训练数据不是“视频加标签”。完整样本通常由视觉或其他传感器观察、机器人自身状态、执行动作、任务条件、时间戳和结果信息共同组成。对训练而言,关键不仅是每类数据是否存在,还包括它们能否在同一时间轴和坐标体系中对应,以及能否按Episode、任务和版本稳定读取。
概述
同一段机器人操作可以有多种数据表达:外部相机记录全局画面,腕部相机观察抓取区域,编码器给出关节状态,控制系统记录动作指令,力传感器描述接触,任务系统保存自然语言或任务ID。缺少其中某些数据不一定无法训练,但会限制模型能够学习的能力。
规划数据平台前,应先根据目标模型列出必需字段,再计算采集带宽、容量和训练读取。不能先买存储,再让数据格式适应硬件。
一、图像与视频数据记录什么
RGB图像提供颜色、纹理、对象和场景信息。连续视频还包含运动过程和动作前后变化。机器人项目可能同时使用固定相机、头部相机、腕部相机或多目相机。
- 需要保留:相机标识、分辨率、帧率、编码、采集时间、曝光参数和标定版本。
- 影响容量:真实码率由编码、帧率、画面复杂度和压缩参数决定,不能只按分辨率估算。
- 影响训练:多相机和历史帧会增加视频解码、数据读取、视觉Token与激活规模。
ROS的Image消息用于未压缩图像,CompressedImage用于压缩图像。训练数据平台可以转为MP4或其他格式,但必须保留时间映射和转换来源。
二、深度数据与RGB有什么不同
深度图为每个像素提供距离或深度信息,有助于几何理解、避障、姿态估计和抓取。它可以来自结构光、ToF、双目或仿真传感器,不同设备的有效范围、噪声和无效值不同。
深度不能只当作普通灰度图保存。需要记录单位、尺度、无效值、相机内参与深度到彩色图的外参。若训练只保留可视化后的伪彩色深度图,可能丢失原始数值意义。
三、点云数据包含什么
点云表示一组二维或三维点,可以附带强度、法向、颜色或其他字段。ROS PointCloud2允许按字段描述N维点,因此实际每点字节数并不固定。
点云容量受点数、字段、数据类型、频率和压缩方式影响。训练前还要明确点云坐标系、传感器位姿、时间戳、裁剪范围和是否经过下采样。多个传感器融合时,外参和时间同步通常比单纯存储格式更重要。
四、机器人状态数据有哪些
| 状态类别 | 常见字段 | 需要说明 |
|---|---|---|
| 关节状态 | 位置、速度、力矩或估计值 | 关节名称、单位、顺序和采样时间 |
| 末端状态 | 位置、姿态、速度和夹爪状态 | 参考坐标系、姿态表示和转换关系 |
| 移动底盘 | 里程计、速度、姿态和定位结果 | 地图/里程计/机体坐标系与协方差 |
| 接触与力觉 | 力、力矩、触觉或接触标记 | 传感器量程、滤波、安装位姿和频率 |
| 设备状态 | 模式、错误码、电量、温度和安全状态 | 状态枚举、固件版本和异常语义 |
ROS JointState消息可以记录一组关节的位置、速度和作用量;其中作用量对转动关节通常表示力矩,对移动关节通常表示力。项目也可以使用其他协议,但无论格式如何,都要保证字段语义、单位和机器人本体版本对应。
五、动作数据为什么最容易产生歧义
动作可以是关节位置、速度、力矩、末端位姿增量、底盘速度、夹爪开合,或者由多个控制量组成的动作块。同一数值在不同机器人和控制接口中含义可能完全不同。
动作类型、维度、单位、坐标系、控制频率、绝对值或增量、归一化方式、限幅规则、发送时间,以及执行后的机器人状态。若只有动作值而没有这些上下文,跨设备复用和问题追溯会非常困难。
还要区分“下发命令”和“实际执行结果”。控制器可能限幅、延迟或拒绝动作,训练数据应根据任务目标决定保留哪一种或同时保留两种。
六、任务、语言与目标条件
单任务策略可以使用固定任务ID,多任务或VLA模型则可能使用自然语言指令、目标图像、对象类别或技能标识。Open X-Embodiment的示例将工作区RGB图像和任务字符串作为输入,并输出机器人动作。
自然语言也需要版本和规范。意思相近的指令可能采用不同表达,错误或含糊指令会影响训练。任务文本应与Episode、场景、对象和成功结果关联。
七、结果、奖励和质量标记
- 成功/失败:用于任务评测、筛选与奖励建模。
- 阶段标记:描述长任务中抓取、移动、放置等进度。
- 奖励信号:用于强化学习,可以是人工定义、环境计算或学习得到。
- 人工干预:标记自动执行与人工接管区间,保留恢复动作。
- 质量状态:区分原始、待审、通过、拒绝和可训练数据。
成功标记必须与任务定义一致。仅靠文件存在或轨迹完整不能证明任务成功。
八、时间同步与标定为什么是数据骨架
训练样本需要回答:某一帧图像对应哪个机器人状态,动作在何时下发,动作后观察怎样变化。相机、控制器和传感器若使用不同时间源,需要记录同步方法、偏差和重采样规则。
空间对齐同样重要。相机内参描述成像,外参描述相机与机器人或世界坐标系关系。标定发生变化时,应生成新版本,不能只覆盖旧参数。
九、Episode和元数据怎样组织
Episode是逻辑任务轨迹,元数据至少应关联任务、机器人、场景、开始结束、数据位置、帧数、质量状态和版本。LeRobotDataset v3将低维时序数据组织在Parquet中,将视觉数据编码为MP4,并通过元数据解析Episode边界。
一个Episode不必对应一个文件。数据量增大后,将多个Episode聚合到分块文件通常能减少文件系统压力,但分块大小应结合随机读取、恢复和对象存储请求方式验证。
十、怎样估算容量与读取压力
各路相机真实平均码率 × 有效采集时长,再加入索引、元数据、版本副本和备份。使用真实样本测量平均与峰值码率。
每帧字段字节数 × 采样频率 × 有效时长,再加入序列化、索引和Episode元数据。状态动作容量通常小于视频,但读取频率和对齐要求更高。
训练读取压力不能只用文件拷贝速度判断。视频解码、随机抽样、DataLoader Worker、本地缓存和多任务并发共同决定GPU是否等待数据。
十一、常见数据格式怎样选择
| 格式类型 | 适合内容 | 主要关注 |
|---|---|---|
| ROS 2 bag/MCAP | 多Topic原始消息、回放和问题追溯 | 分块、索引、压缩、恢复和版本 |
| MP4等视频容器 | 连续相机数据 | 编码、随机定位、解码负载和时间映射 |
| Parquet等列式格式 | 状态、动作、时间戳和元数据 | Schema、分块、筛选和训练读取 |
| 项目训练格式 | 模型直接使用的样本 | 转换脚本、来源、版本和可复现性 |
十二、赋创如何协助规划机器人数据算力平台
赋创可基于客户提供的传感器规格、采集频率、数据字段、Episode结构、训练读取方式和保留周期,协助测算采集写入、活跃训练和归档容量,规划NVMe、共享存储、网络与训练节点,并使用代表数据验证端到端吞吐。
数据采集方案、标注规则、动作定义、坐标体系和数据质量由项目团队或相应专业方负责。赋创重点解决存储、网络和计算平台能否稳定承载数据流转。
FAQ:机器人训练数据常见问题
1. 只有视频能否训练机器人动作模型?
取决于模型和任务,但多数可执行策略还需要动作或其他监督信号。仅有视频可以用于表征、预测或部分预训练,不等同于具备可执行动作标签。
2. 有深度图后是否还要保存点云?
不一定。点云可以由深度和标定信息生成,但若处理流程、融合结果或原始传感器字段有价值,应按复现和训练需求决定。
3. 转成训练格式后是否可以删除原始数据?
应根据合规、成本和重新处理需求决定。若后续可能重新标定、重切Episode或更换训练格式,保留可追溯的原始数据更有价值。
4. RAID是否等于数据已经备份?
不是。RAID主要降低部分磁盘故障造成的中断,不能替代版本、误删除保护和独立恢复副本。
方案咨询
需要把方案落到实际配置?
联系赋创获取算力、软件栈和交付路径建议。