1,042段6目第一人称视角具身智能数据集

本数据集含1042段、每段35秒的6目ego-centric采集数据,覆盖家居、办公、家装、零售、学校、仓库等6大类场景34个场所。硬件采用自研VSLAM,毫米级定位,多传感器硬触发同步(≤1ms),RGB达60fps高帧率。数据含6路视频、标定、点云、SLAM轨迹及手势识别结果,格式标准,可直接用于具身智能、空间感知与3D重建等模型训练,具备高精度、多场景、即用性强的核心优势。

数据规格

数据内容
1042段多场景ego centric采集数据,每条数据35秒左右,动作完整。每条数据包含:6目视频,相关参数,重建点云,slam后处理的轨迹,手势关键点识别效果视频。
1042段多场景ego centric采集数据,每条数据35秒左右,动作完整。每条数据包含:6目视频,相关参数,重建点云,slam后处理的轨迹,手势关键点识别效果视频。
数据分布
家居场景:293条;办公场景:217条;家装场景:52条;零售场景:299条;学校场景:114条;仓库场景:49条。
数据质量
RGB相机分辨率:1600*1200帧率:60 fps,黑白鱼眼相机:640*480 帧率:30fps,相机通过硬触发同步曝光。

样例展示