10 // CHAPTER ROUTE

教会机器人 安全到达

具身智能 · 第十章

输入视觉、深度与目标位置,输出线速度和角速度,让机器人绕过障碍到达终点。

00 // THREE LOOPS

导航不是一步,而是感知—规划—执行

01感知摄像头 + 深度图障碍在哪里?有多远?PERCEPTION02规划路径算法 + 策略模型应该怎样绕过去?PLANNING03执行轮式 / 腿式运动控制怎样把方案走出来?EXECUTION位置改变 → 环境反馈 → 重新感知

感知定位障碍,规划决定绕行,执行落实运动;位置变化后再次进入感知。

VISUAL RECAP

本节场景补充

READ THE SCENE

导航不是一步,而是 感知—规划—执行

导航由感知、规划和执行组成连续闭环,而不是一次性走到终点。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“导航不是一步,而是 感知—规划—执行”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 导航不是一步,而是 感知—规划—执行

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

01 // PROBLEM

从起点到终点,路径必须零碰撞

INPUTRGB 图像深度图目标位置NAVIGATIONPOLICYOUTPUT线速度角速度

给定观测、目标与障碍物,模型输出线速度和角速度,形成无碰撞路径。

02 // METRICS

不是会走,而是走得好

成功率 ↑碰撞率 ↓SPL → 1

成功率衡量能否到达,碰撞率衡量安全,SPL 衡量路径是否高效。

03 // TRAINING SAMPLE

每个样本,都把观察连到动作

RGB640 × 480DEPTH640 × 480目标位置dx, dy相对机器人EXPERT ACTION线速度 v角速度 ω

训练样本用 RGB、深度和目标位置作为输入,以专家速度指令作为标签。

04 // SOURCE & SPLIT

专家动作,两条来源;数据按场景切分

遥操作操作者每一步动作人类专家数据 · 质量高A* / RRT已知地图上规划路径自动生成 · 成本低训练样本RGB + DEPTH + GOAL→ ( v , ω )TRAIN · 80%训练场景VAL · 10%验证场景TEST · 10%测试场景SCENE FIREWALL场景不可重叠

专家动作可来自遥操作或 A*、RRT;形成样本后按不同场景切成 80%、10%、10%。

VISUAL RECAP

本节场景补充

READ THE SCENE

专家动作,两条来源;数据按 场景切分

场景隔离能避免训练数据和评估数据相互泄露。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“专家动作,两条来源;数据按 场景切分”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 专家动作,两条来源;数据按 场景切分

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

04 // DATA SPLIT

场景必须隔离,不能让模型偷看答案

TRAIN · 80%场景 01场景 02场景 03SCENE FIREWALLVAL · 10%场景 04TEST · 10%场景 05

训练、验证和测试必须按场景隔离,否则模型可能记住布局而非学会导航。

05 // AUGMENTATION

翻转图像,也要翻转转向标签

原图:左转ω = +0.4H-FLIPMIRROR翻转:右转ω = −0.4

水平翻转后必须将角速度取反,否则增强会制造互相矛盾的错误标签。

06 // BEHAVIOR CLONING

把专家动作当作标准答案

专家数据观测 → 动作模型预测v̂ · ω̂MSE预测 − 专家平方误差更新参数学会模仿专家

行为克隆用观测到专家动作的监督配对,通过动作误差训练模型模仿专家。

07 // MODEL INPUTS

三路特征融合,输出两个速度

RGB · 640×480×3CNN 提取特征DEPTH · 640×480×1CNN 提取特征GOAL · 2DFC 提取特征CONCAT→ FC 融合线速度 v范围 [−1, 1]角速度 ω范围 [−1, 1]

RGB、深度和二维目标分别编码,拼接后经全连接层回归线速度与角速度。

VISUAL RECAP

本节场景补充

READ THE SCENE

三路特征融合,输出 两个速度

行为克隆把观察与专家动作配对,再以损失反馈更新策略。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“三路特征融合,输出 两个速度”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 三路特征融合,输出 两个速度

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

08 // BC LOOP

预测、算损失、更新,再测试

样本观测 + 专家动作前向预测v̂ · ω̂MSE(v̂−v)² + (ω̂−ω)²反向传播更新参数循环 epochsTEST成功 / 碰撞SPL

每批样本前向预测两种速度,用两项平方误差反传更新,训练后再测成功、碰撞与 SPL。

08 // DISTRIBUTION SHIFT

偏一步,就进入没见过的世界

未知状态错误继续累积纠错轨迹 / DAgger收集犯错状态再标注

行为克隆一旦偏离专家分布会错误累积,纠错轨迹与 DAgger 用犯错状态补课。

10 // EVALUATE

先看曲线,再读场景报告

TRAIN / VALIDATION训练损失下降:正常 · 平台:收敛验证损失上升:过拟合 → 加数据/正则20 SCENES · 100 TESTS成功 87% · 碰撞 8% · 超时 5%SPL 1.28 · 平均 12.3 秒场景 7 · 窄通道 · 成功 60%场景 14 · 多障碍 · 碰撞 25%

曲线判断收敛与过拟合,测试报告再把总体指标下钻到窄通道和多障碍场景。

11 // DIAGNOSE

指标先定位,方法才对症下药

成功率低 < 70%补失败场景 · 查目标归一化更深 CNN · 失败数据进阶:BC + RLBC + RL碰撞率高 > 10%补临界避障 · 强化深度收集犯错状态进阶:DAgger + 安全层DAgger路径过长SPL > 1.5优化专家路径加入路径长度惩罚RL

先分清成功率、碰撞率或路径效率异常,再匹配 DAgger、RL、BC+RL 与安全层。

12 // PLATFORM CONFIG

数据、模型、训练参数,一次锁定

任务与数据navigation_v1warehouse_render_v1 或 LeRobot输入 RGB+深度+目标 · 输出两速度模型行为克隆CNN / ResNet监督学习动作回归训练50 epochs · batch 32 · lr 0.001Adam · 80/10/10随机裁剪 + 颜色抖动评估自动评估开启成功率 · 碰撞率 · 超时SPL + 场景明细

平台配置同时确定数据源、输入输出、网络、优化器、场景划分、增强与自动评估。

13 // TRAIN

启动训练后,双曲线一起看

EPOCH 23 / 50PROGRESS · 46%已用 4m12s剩余 4m55s持续观察差距LOSS CURVES训练 0.0234 ↓ · 验证 0.0312 ↓TRAIN / VAL

训练到 23/50 时训练与验证损失都下降;若验证反向上升,应转入过拟合诊断。

14 // REPORT

总体成绩之外,还要看场景差异

10 场景 × 10 次成功 85 · 碰撞 7 · 超时 8 · SPL 1.31简单场景100%单障碍95%窄通道72%多障碍80%

总体成功率 85% 不能替代分场景诊断;窄通道 72% 是最先需要补强的短板。

15 // VISUAL TEST

俯视回放,定位失败发生处

机器人 · 蓝点目标 · 绿虚线碰撞路径进入障碍犹豫 / 超时原地反复调整绕行过远SPL 偏高

选择场景并播放俯视回放,分别定位碰撞、犹豫超时和绕行过远的轨迹证据。

16 // EXPORT

训练完成,按部署端选格式

已训练模型通过评估ONNX · 推荐通用部署格式PyTorch · .pth继续训练TensorRTNVIDIA 部署

通用部署优先 ONNX,继续训练保留 PyTorch,NVIDIA 部署可选择 TensorRT。

17 // COMPETITION TASKS

五类任务,难点逐级变化

已知地图基础导航静态障碍避障动态障碍需要 RL窄通道高风险未知场景域随机化BASE → OBSTACLE → DYNAMIC → NARROW → GENERALIZATION

静态避障、动态障碍、窄通道与未知场景风险不同,未知场景要借助第九章域随机化。

18 // DATA STRATEGY

多模态看障碍,多样性补极端

多模态RGB · 语义与外观DEPTH · 障碍距离数据多样性窄通道密集障碍暗光环境

RGB 与深度互补,训练数据还要主动覆盖窄通道、密集障碍和暗光等极端条件。

19 // ROBUSTNESS

集成提高稳定性,安全层最后把关

模型 A · 初始化 1模型 B · 初始化 2模型 C · 不同增强投票 / 平均成功率通常 +3–5%安全层深度检测碰撞风险覆盖危险动作停止 / 转向

不同初始化与增强的模型可投票或平均;执行前再由深度安全层覆盖危险动作。

20 // CHECKLIST

六项齐备,才进入竞赛验证

01 · 三个不同场景每个 1000+ 帧02 · BC 成功率> 80%03 · 泛化域随机化04 · 安全层代码碰撞检测 + 紧急停止05 · 演示视频完整导航过程06 · 技术文档模型 / 数据 / 评估DATA ✓ · MODEL ✓ · SAFETY ✓ · EVIDENCE ✓

场景数据、成功率、泛化、安全代码、演示视频和技术文档共同构成参赛检查线。

RECAP // CHAPTER 10

从 BC 训练,到 竞赛安全

01

导航三环

感知、规划、执行持续闭环

02

数据与场景隔离

专家样本按场景切成 80/10/10

03

BC 与评估

两项 MSE 训练,再看成功、碰撞与 SPL

04

平台训练与导出

配置、监控、回放、评估与模型导出

05

竞赛与安全

多模态、多样性、集成和安全层

可靠导航贯通数据、行为克隆、平台评估、竞赛泛化与执行前安全过滤。

SOURCE QUIZ // 10 MCQ

单选题 · 10题

第 1 / 10 题原讲义题库
得分 0 / 10
SOURCE QUIZ // 5 TRUE-FALSE

判断题 · 5题

第 1 / 5 题原讲义题库
得分 0 / 5
SOURCE PRACTICE 01

实操 · 训练导航避障模型

训练并评估一个导航避障模型

任务要求

  • 使用实训平台模块 B 的渲染数据(至少 2 个场景,每个场景 500+ 帧)
  • 在模型训练模块中创建一个行为克隆训练任务
  • 配置训练参数:50 轮、批次大小 32、学习率 0.001
  • 启动训练,等待完成
  • 查看评估结果,记录成功率和碰撞率
  • 使用可视化测试功能,观察模型在 3 个不同场景中的表现

提交要求

  • 提交训练评估结果截图(包含成功率、碰撞率、SPL)
  • 提交一段模型导航的可视化录屏(至少 30 秒,展示 2 个场景)
  • 撰写一份训练报告(200-300 字),包含:
  • 训练数据描述(场景数量、总帧数)
  • 模型表现分析(成功率、碰撞率、哪些场景表现好/差)
  • 改进方向(至少提出 2 条具体改进措施)
评分标准:
  • 模型训练成功并完成评估(30%)
  • 成功率 ≥ 75%(30%)
  • 训练报告分析深入、改进建议具体(40%)