从“会说”到 真的会做
具身智能让 AI 获得感知与行动通道
从屏幕里的“聊天 AI”,走向能够感知、决策、行动并从物理交互中学习的“做事 AI”。
具身智能让 AI 获得感知与行动通道
规则世界适合计算
模块化便于独立开发和排错,代价是接口复杂与误差累积。
越结构化的环境越容易落地,家庭与农业等开放场景仍更具挑战。
真机、仿真和自动标注协同
从“从“会说”到 真的会做”出发,逐页推进到“为什么走路 比下棋更难?”;每张卡都写明本页应抓住的机制或边界。
具身智能让 AI 获得感知与行动通道,进入真实或仿真的物理世界。
机器人每执行一次,环境就可能变化,因此必须重新感知并持续修正。
规则世界适合计算,真实世界却要求 AI 随时处理噪声、变化和意外。
阅读顺序:从“会说”到 真的… → 感知、决策、执行 … → 为什么走路 比下棋…
本节按“从“会说”到 真的… → 感知、决策、执行 … → 为什么走路 比下棋…”推进:先定位问题,再读机制,最后用页面结论校验理解。
READ THE SCENE
从语言意图到物理动作,需要感知、决策和执行共同闭环。
读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。
具身智能让 AI 获得感知与行动通道,进入真实或仿真的物理世界。
机器人每执行一次,环境就可能变化,因此必须重新感知并持续修正。
规则世界适合计算,真实世界却要求 AI 随时处理噪声、变化和意外。
从“精确菜谱,还是 见多识广?”出发,逐页推进到“两条路线, 同一块地基”;每张卡都写明本页应抓住的机制或边界。
结构化高精度任务仍适合传统机器人;具身智能拓展的是变化更大的场景。
模块化便于独立开发和排错,代价是接口复杂与误差累积。
VLA 省掉人工模块拆分,但依赖海量轨迹、强算力与额外安全机制。
路线可以并行,数据却是两者共同的训练燃料和评估依据。
阅读顺序:精确菜谱 → 模块化: 逐站接力 → VLA → … → 两条路线
本节按“精确菜谱 → 模块化: 逐站接力 → VLA → … → 两条路线”推进:先定位问题,再读机制,最后用页面结论校验理解。
READ THE SCENE
泛化能力来自持续观察环境并依据反馈修正动作。
读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。
结构化高精度任务仍适合传统机器人;具身智能拓展的是变化更大的场景。
模块化便于独立开发和排错,代价是接口复杂与误差累积。
VLA 省掉人工模块拆分,但依赖海量轨迹、强算力与额外安全机制。
路线可以并行,数据却是两者共同的训练燃料和评估依据。
从“机器人正在走进 哪些现场?”出发,逐页推进到“平台如何 拆掉数据瓶颈?”;每张卡都写明本页应抓住的机制或边界。
越结构化的环境越容易落地,家庭与农业等开放场景仍更具挑战。
机器人轨迹必须真实操作或高质量仿真采集,时间与硬件成本远高于文本。
真机、仿真和自动标注协同,目标是降低高质量具身数据的采集成本。
阅读顺序:机器人正在走进 哪… → 为什么“身体数据”… → 平台如何 拆掉数据…
本节按“机器人正在走进 哪… → 为什么“身体数据”… → 平台如何 拆掉数据…”推进:先定位问题,再读机制,最后用页面结论校验理解。
READ THE SCENE
仓储、农业等现场会把感知、动作和安全约束同时带进任务。
读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。
越结构化的环境越容易落地,家庭与农业等开放场景仍更具挑战。
机器人轨迹必须真实操作或高质量仿真采集,时间与硬件成本远高于文本。
真机、仿真和自动标注协同,目标是降低高质量具身数据的采集成本。
具身智能让 AI 获得感知与行动通道
规则世界适合计算
模块化便于独立开发和排错,代价是接口复杂与误差累积。
越结构化的环境越容易落地,家庭与农业等开放场景仍更具挑战。
真机、仿真和自动标注协同
理解具身智能,要同时看身体闭环、技术路线与数据来源。
先依据闭环、路线或数据逻辑作答,再查看讲义解析。