从起点到终点,路径必须 零碰撞
给定观测、目标与障碍物
输入视觉、深度与目标位置,输出线速度和角速度,让机器人绕过障碍到达终点。
给定观测、目标与障碍物
训练样本用 RGB、深度和目标位置作为输入
水平翻转后必须将角速度取反
RGB、深度和目标特征先独立提取
用成功率、碰撞率和 SPL 评估策略
感知定位障碍,规划决定绕行,执行落实运动;位置变化后再次进入感知。
READ THE SCENE
导航由感知、规划和执行组成连续闭环,而不是一次性走到终点。
读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。
给定观测、目标与障碍物,模型输出线速度和角速度,形成无碰撞路径。
成功率衡量能否到达,碰撞率衡量安全,SPL 衡量路径是否高效。
训练样本用 RGB、深度和目标位置作为输入,以专家速度指令作为标签。
专家动作可来自遥操作或 A*、RRT;形成样本后按不同场景切成 80%、10%、10%。
READ THE SCENE
场景隔离能避免训练数据和评估数据相互泄露。
读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。
训练、验证和测试必须按场景隔离,否则模型可能记住布局而非学会导航。
水平翻转后必须将角速度取反,否则增强会制造互相矛盾的错误标签。
行为克隆用观测到专家动作的监督配对,通过动作误差训练模型模仿专家。
RGB、深度和二维目标分别编码,拼接后经全连接层回归线速度与角速度。
READ THE SCENE
行为克隆把观察与专家动作配对,再以损失反馈更新策略。
读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。
每批样本前向预测两种速度,用两项平方误差反传更新,训练后再测成功、碰撞与 SPL。
行为克隆一旦偏离专家分布会错误累积,纠错轨迹与 DAgger 用犯错状态补课。
曲线判断收敛与过拟合,测试报告再把总体指标下钻到窄通道和多障碍场景。
先分清成功率、碰撞率或路径效率异常,再匹配 DAgger、RL、BC+RL 与安全层。
平台配置同时确定数据源、输入输出、网络、优化器、场景划分、增强与自动评估。
训练到 23/50 时训练与验证损失都下降;若验证反向上升,应转入过拟合诊断。
总体成功率 85% 不能替代分场景诊断;窄通道 72% 是最先需要补强的短板。
选择场景并播放俯视回放,分别定位碰撞、犹豫超时和绕行过远的轨迹证据。
通用部署优先 ONNX,继续训练保留 PyTorch,NVIDIA 部署可选择 TensorRT。
静态避障、动态障碍、窄通道与未知场景风险不同,未知场景要借助第九章域随机化。
RGB 与深度互补,训练数据还要主动覆盖窄通道、密集障碍和暗光等极端条件。
不同初始化与增强的模型可投票或平均;执行前再由深度安全层覆盖危险动作。
场景数据、成功率、泛化、安全代码、演示视频和技术文档共同构成参赛检查线。
感知、规划、执行持续闭环
专家样本按场景切成 80/10/10
两项 MSE 训练,再看成功、碰撞与 SPL
配置、监控、回放、评估与模型导出
多模态、多样性、集成和安全层
可靠导航贯通数据、行为克隆、平台评估、竞赛泛化与执行前安全过滤。