03 // CHAPTER ROUTE

教机器人 干活

具身智能 · 第三章

把人的一次操作,录成机器可以学习的“观测 → 动作”序列。第三章从遥操作出发,走完整条硬件数据采集流水线。

SECTION 01 / 阅读地图

小节一 · 遥操作真正生产的是 训练数据

本节要回答

小节一 · 遥操作真正生产的是 训练数据

从“遥操作真正生产的是 训练数据”出发,逐页推进到“不碰机器人,也能把人的动作 采下来”;每张卡都写明本页应抓住的机制或边界。

01

遥操作真正生产的是 训练数据

在具身智能中,遥操作的核心价值是把人的示范转成可训练的观测—动作序列。

机制线索主端 Master从端 Slave数据记录Oₜ → Aₜ
02

三种主端,没有一种 通吃所有任务

选遥操作方案要同时权衡成本、精度、力反馈和任务工作空间。

机制线索ALOHA LEADER ARMS主从异构臂 HAPTIC MAST…VR 手柄 SPATIAL TRA…
03

不碰机器人,也能把人的动作 采下来

无本体采集不需要机器人实体,但仍需要摄像头和后期处理来恢复人的动作。

机制线索第一人称固定视角多视角融合

阅读顺序:遥操作真正生产的是… → 三种主端 → 不碰机器人

本节按“遥操作真正生产的是… → 三种主端 → 不碰机器人”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

遥操作真正生产的是 训练数据

遥操作的价值在于把人的示范转为可训练的观测—动作数据。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节一 · 遥操作真正生产的是 训练数据”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节一 · 遥操作真正生产的是 训练数据

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

01 // TELEOPERATION

遥操作真正生产的是训练数据

核心目的:记录“观测 → 动作”

主端 Master

操作者输入设备
领导臂 / VR 手柄

从端 Slave

复现操作者动作
机械臂 / 夹爪

数据记录

Oₜ → Aₜ
每次操作生成一条轨迹

在具身智能中,遥操作的核心价值是把人的示范转成可训练的观测—动作序列。

02 // OPTIONS

三种主端,没有一种通吃所有任务

选遥操作方案要同时权衡成本、精度、力反馈和任务工作空间。

03 // BODYLESS

不碰机器人,也能把人的动作采下来

第一人称 / HEAD CAM固定视角OUTPUT: 3D HAND TRAJECTORY
1P

第一人称

视角自然,与操作者看到的画面一致。

3P

固定视角

部署简单,不干扰正常操作。

3D

多视角融合

头戴 + 多个固定相机,重建手部轨迹。

操作者徒手完成取放动作,第一人称与固定相机从多个视角采集
照片 3.2 不接触机器人也能记录人的动作示范

无本体采集不需要机器人实体,但仍需要摄像头和后期处理来恢复人的动作。

SECTION 02 / 阅读地图

小节二 · 遥操作求 精 ,无本体求 多

本节要回答

小节二 · 遥操作求 精 ,无本体求 多

从“遥操作求 精 ,无本体求 多”出发,逐页推进到“清晰度和时间精度,都不是 越大越好”;每张卡都写明本页应抓住的机制或边界。

01

遥操作求 精 ,无本体求 多

两种路线不是二选一:规模数据与高精度示范组合使用,才能彼此补位。

机制线索选型对照
02

一条轨迹,就是完整的 观测—动作序列

模型学习的不是孤立视频或关节值,而是每个时间步“看到什么、做了什么”。

机制线索T0 / STARTT1T2TN / END
03

LeRobot 把异构数据装进一个 标准包

统一目录、字段和时间戳,让数据能够直接进入存储、版本管理和训练管道。

机制线索一个 episode 的关键字段
04

清晰度和时间精度,都不是 越大越好

参数选择要服务任务:画面足够辨识、时间采样足够跟上动作,同时控制存储开销。

机制线索分辨率:细节与存储的拉锯帧率:先问动作有多快

阅读顺序:遥操作求 精 → 一条轨迹 → LeRobot 把… → … → 清晰度和时间精度

本节按“遥操作求 精 → 一条轨迹 → LeRobot 把… → … → 清晰度和时间精度”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

遥操作求 精 ,无本体求 多

精确示范与多样示范各有作用,应按数据缺口组合。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节二 · 遥操作求 精 ,无本体求 多”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节二 · 遥操作求 精 ,无本体求 多

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

04 // DECISION

遥操作求,无本体求

数据精度 ↑采集规模与效率 →
遥操作精确关节角度
有力反馈
无本体采集融入工作流
规模更大

两种路线不是二选一:规模数据与高精度示范组合使用,才能彼此补位。

05 // EPISODE

一条轨迹,就是完整的观测—动作序列

T0 / START

OBSERVATION
图像、角度、力
ACTION
目标角度 / 速度

T1

看到物体更近
机械臂继续前伸

T2

夹爪到达目标
闭合夹爪

TN / END

任务完成状态
停止并保存
EPISODE一次完整操作过程,由连续 Timestep 组成。

模型学习的不是孤立视频或关节值,而是每个时间步“看到什么、做了什么”。

06 // FORMAT

LeRobot 把异构数据装进一个标准包

├─data/
├─episode_000000.parquet
├─videos/
├─cam01/episode_000000.mp4
└─meta/
├─info.json
├─episodes.jsonl
└─stats.json

统一目录、字段和时间戳,让数据能够直接进入存储、版本管理和训练管道。

07 // RESOLUTION + FPS

清晰度和时间精度,都不是越大越好

分辨率:细节与存储的拉锯

320×240
640×480
4K
细节不足清晰度 / 开销平衡存储与显存压力大
DEFAULT 640×480 @ 30fps

帧率:先问动作有多快

FPS ≥ 2 × 动作最高频率
慢 10–15中 20–30快 50+

参数选择要服务任务:画面足够辨识、时间采样足够跟上动作,同时控制存储开销。

SECTION 03 / 阅读地图

小节三 · 同步误差会把正确数据配成 错误因果

本节要回答

小节三 · 同步误差会把正确数据配成 错误因果

从“同步误差会把正确数据配成 错误因果”出发,逐页推进到“好数据靠 质检 + 重采 炼成”;每张卡都写明本页应抓住的机制或边界。

01

同步误差会把正确数据配成 错误因果

观测和动作必须对齐到同一时刻,否则模型会学习不存在的动作因果关系。

机制线索问题:相机晚了 50ms硬件同步最可靠软件同步
02

数采工厂:把一次示范走成 六步流水线

可靠采集不是按下录制键,而是从连接、配置、操作到质检和导出的完整流程。

机制线索进入模块检查硬件创建任务执行采集
03

好数据靠 质检 + 重采 炼成

质量门槛保证每条轨迹可信,轻微改变初始条件则让数据覆盖更多情况。

机制线索DATA QA / CHECKLI…VISIBLESTABLESYNCED

阅读顺序:同步误差会把正确数… → 数采工厂 → 好数据靠 质检 +…

本节按“同步误差会把正确数… → 数采工厂 → 好数据靠 质检 +…”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

同步误差会把正确数据配成 错误因果

相机、动作和时间戳不同步,会把正确动作配到错误观察上。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节三 · 同步误差会把正确数据配成 错误因果”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节三 · 同步误差会把正确数据配成 错误因果

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

08 // TIMESTAMP

同步误差会把正确数据配成错误因果

问题:相机晚了 50ms,图像与关节状态错位

CAMERA
JOINT
FRAME 10 图像 ≠ FRAME 10 动作

硬件同步

外部触发,同一时钟工作。

最可靠

软件同步

采集后按时间戳匹配最近帧。

次选

平台模块

内置硬件同步。

误差 < 5ms

观测和动作必须对齐到同一时刻,否则模型会学习不存在的动作因果关系。

09 // WORKFLOW

数采工厂:把一次示范走成六步流水线

1

进入模块

登录平台,打开数采工厂。

2

检查硬件

绿正常、黄待校准、红未连接。

3

创建任务

名称、类型、30fps、640×480。

4

执行采集

动作匀速连贯,异常及时标记。

5

预览质检

视频、关节曲线、帧率与同步。

6

导出数据

LeRobot 或 CSV,本地或云端。

可靠采集不是按下录制键,而是从连接、配置、操作到质检和导出的完整流程。

10 // QUALITY GATE

好数据靠质检 + 重采炼成

DATA QA / CHECKLIST

图像清晰,无运动模糊VISIBLE
实际帧率波动 < 10%STABLE
时间戳误差 < 10msSYNCED
轨迹完整,无中断跳帧COMPLETE
!同类物体标注保持一致REVIEW

倒水任务 / 15 秒动作拆解

0–3s
到杯上方
3–5s
下降抓取
5–8s
抬起移动
8–11s
倾斜倒水
11–13s
回正放回
13–15s
回初始位
重复 10–20 次,每次位置微调 ±2cm;记录备注,增加多样性。
质检员把失败样本放入红色托盘并重新执行抓取
照片 3.5B 失败样本被退回后立即重采,形成质量闭环

质量门槛保证每条轨迹可信,轻微改变初始条件则让数据覆盖更多情况。

RECAP // 第三章

采集链路的五个 质量关口

01

遥操作真正生产的是 训练数据

在具身智能中

02

不碰机器人,也能把人的动作 采下来

无本体采集不需要机器人实体

03

一条轨迹,就是完整的 观测—动作序列

模型学习的不是孤立视频或关节值

04

同步误差会把正确数据配成 错误因果

观测和动作必须对齐到同一时刻

05

好数据靠 质检 + 重采 炼成

质量门槛保证每条轨迹可信

SOURCE QUIZ // 10

单选题:采集链路压力测试

题目 1 / 10
得分 0 / 10

1. 遥操作(Teleoperation)在具身智能领域的主要目的是什么?

2. 以下哪个不是遥操作系统的三要素之一?

3. ALOHA 方案的主要特点是什么?

4. “无本体采集”的含义是?

5. LeRobot 数据格式中,一条轨迹(episode)的核心结构是什么?

6. 教学实训平台推荐的默认图像分辨率和帧率是多少?

7. 多传感器同步误差会导致什么问题?

8. 在数采工厂中,如果硬件状态显示黄色 🟡,表示什么?

9. 采集“倒水任务”时,建议重复采集多少次?

10. 以下关于采集质量标准的描述,哪个是正确的?

先作答,再查看讲义解析
SOURCE PRACTICAL // 1

实操一:完成一次数据采集

讲义原始任务要求

  1. 登录具身智能教学实训平台,进入数采工厂。
  2. 创建一个新的采集任务,任务名格式为 {你的动作}_{你的姓名}_v1(如 抓取_张三_v1)。
  3. 检查硬件连接状态,确保所有设备为绿色。
  4. 执行采集操作,完成一个简单的抓取-放置动作(抓取桌面物体,移动到另一个位置放下)。
  5. 采集时长不少于 10 秒。
  6. 导出数据为 LeRobot 格式,保存到本地。

提交要求

提交导出的 .zip 文件 + 一张数采工厂数据预览页面的截图(包含关节角度曲线)。
SOURCE PRACTICAL // 2

实操二:写一份数据质量报告

讲义原始任务要求

基于你采集的数据,撰写一份简短的数据质量分析报告(200-300 字),包含以下内容:

  • 采集任务的基本信息(任务名、时长、总帧数、文件大小)。
  • 帧率稳定性分析(查看平台提供的帧率统计)。
  • 同步精度检查结果。
  • 是否有异常帧?如有,描述异常表现并分析可能原因。
  • 改进建议(如果重新采集,你会做哪些调整?)。

提交要求

提交 Markdown 或 Word 格式的报告文件。
01 / 18