+ +
07 // CHAPTER ROUTE

AI 先标 人来验

具身智能 · 第七章

VLM 把“从零画标签”改造成“检查并修正”,但最终质量仍由人工审核与统一标准负责。

相机拍摄台上物体,显示器给出候选框,人类审核者在样本上复核并修正标注
图 7.1 · VLM 候选标注经过人工核验与修正
SECTION 01 / 阅读地图

小节一 · 没有答案的图, 教不会模型

本节要回答

小节一 · 没有答案的图, 教不会模型

从“没有答案的图, 教不会模型”出发,逐页推进到“从零作业,变成 批改作业”;每张卡都写明本页应抓住的机制或边界。

01

没有答案的图, 教不会模型

标注把像素转成可监督的语义,让模型知道“什么答案才算正确”。

机制线索RAW IMAGE只有像素箱子 · 塑料 · 可抓取ADD LABELS
02

同一个物体, 六种答案

类别回答“是什么”,掩码回答“每个像素属于谁”,属性补充“它有什么特征”。

机制线索类别CLASSBOXMASK
03

从零作业,变成 批改作业

效率提升来自工作重心变化:机器先给候选答案,人负责检查与纠正。

机制线索纯人工 / 从零VLM + 人工找物体 → 画框描边 → 填属性

阅读顺序:没有答案的图 → 同一个物体 → 从零作业

本节按“没有答案的图 → 同一个物体 → 从零作业”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

没有答案的图, 教不会模型

没有与任务对应的标签,原始图像无法直接成为监督信号。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节一 · 没有答案的图, 教不会模型”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节一 · 没有答案的图, 教不会模型

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

01 // WHY LABEL

没有答案的图,教不会模型

RAW IMAGE只有像素箱子 · 塑料 · 可抓取ADD LABELS

标注把像素转成可监督的语义,让模型知道“什么答案才算正确”。

02 // LABEL TYPES

同一个物体,六种答案

类别CLASSBOXMASKKEYPOINTTRAJECTORY属性材质质量

类别回答“是什么”,掩码回答“每个像素属于谁”,属性补充“它有什么特征”。

03 // ASSISTED LABELING

从零作业,变成批改作业

纯人工 / 从零VLM + 人工找物体 → 画框描边 → 填属性逐张重复VLM 预标注类别 · 掩码 · 材质人工校验修错 · 补漏 · 确认讲义:效率提升约 8–10 倍

效率提升来自工作重心变化:机器先给候选答案,人负责检查与纠正。

SECTION 02 / 阅读地图

小节二 · 图像 + 指令,输出 候选标签

本节要回答

小节二 · 图像 + 指令,输出 候选标签

从“图像 + 指令,输出 候选标签”出发,逐页推进到“预标注之后,必须过 三道门”;每张卡都写明本页应抓住的机制或边界。

01

图像 + 指令,输出 候选标签

VLM 输出先被转换为结构化标注,再叠加到视口等待人工确认。

机制线索场景图像MAIN CAMERA标注指令PROMPT
02

会看大概, 不会精确测量

精确质量和尺寸应读取 3D/物理参数,不能把视觉猜测当测量值。

机制线索VLM 擅长常见物体类别大致材质与颜色空间关系描述
03

预标注之后,必须过 三道门

标准流程是预标注、人工修正、确认保存;任何一步都不能直接跳过审核。

机制线索VLM自动预标注人工校验类别正确

阅读顺序:图像 + 指令 → 会看大概 → 预标注之后

本节按“图像 + 指令 → 会看大概 → 预标注之后”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

图像 + 指令,输出 候选标签

图像与指令可先产出候选标签,但不能代替人工核对。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节二 · 图像 + 指令,输出 候选标签”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节二 · 图像 + 指令,输出 候选标签

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

04 // VLM FLOW

图像 + 指令,输出候选标签

场景图像MAIN CAMERA标注指令PROMPTVLMSEE + READ候选输出类别框 / 掩码材质属性推断FORMAT叠加显示人工审核CONFIRM

VLM 输出先被转换为结构化标注,再叠加到视口等待人工确认。

05 // BOUNDARY

会看大概,不会精确测量

VLM 擅长常见物体类别大致材质与颜色空间关系描述VLM 不擅长精确质量与尺寸被遮挡对象的细边界READ FROM 3D / HUMAN

精确质量和尺寸应读取 3D/物理参数,不能把视觉猜测当测量值。

06 // HUMAN REVIEW

预标注之后,必须过三道门

VLM自动预标注人工校验类别正确?掩码贴边?属性可信?FIX / ADD / DELETE确认统一标准保存USD 属性EXPORT

标准流程是预标注、人工修正、确认保存;任何一步都不能直接跳过审核。

SECTION 03 / 阅读地图

小节三 · 错在哪里,就 修哪里

本节要回答

小节三 · 错在哪里,就 修哪里

从“错在哪里,就 修哪里”出发,逐页推进到“确认一次,写入 两类出口”;每张卡都写明本页应抓住的机制或边界。

01

错在哪里,就 修哪里

类别错就改标签,边界错就修掩码,漏标要补,物理属性要回到场景参数核对。

机制线索REVIEWDIAGNOSE类别错误下拉框改为正确类别
02

高质量标注, 四项同时过关

完整、准确、精确、一致缺一不可;数据量不能补偿系统性错标。

机制线索完整性NO MISSING准确性类别与属性正确
03

确认一次,写入 两类出口

标注既可留在 USD Prim 属性中,也可导出标准格式进入训练管线。

机制线索CONFIRMEDLABEL SETSAVESYNC

阅读顺序:错在哪里,就 修哪里 → 高质量标注 → 确认一次

本节按“错在哪里,就 修哪里 → 高质量标注 → 确认一次”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

错在哪里,就 修哪里

错误类型被定位后,才知道应修改类别、边界还是属性。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节三 · 错在哪里,就 修哪里”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节三 · 错在哪里,就 修哪里

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

07 // ERROR CLINIC

错在哪里,就修哪里

REVIEWDIAGNOSE类别错误下拉框改为正确类别掩码偏差笔刷添加 · 橡皮擦删除漏标物体手动新增标签属性缺失读取场景参数后补齐

类别错就改标签,边界错就修掩码,漏标要补,物理属性要回到场景参数核对。

08 // QUALITY

高质量标注,四项同时过关

完整性NO MISSING准确性类别与属性正确精确性掩码贴边 · IoU ≥ 90%一致性同类同标准ONE RULESET

完整、准确、精确、一致缺一不可;数据量不能补偿系统性错标。

09 // SAVE & EXPORT

确认一次,写入两类出口

CONFIRMEDLABEL SETSAVESYNCUSD PRIM自定义属性EXPORTCOCO · YOLO · JSON

标注既可留在 USD Prim 属性中,也可导出标准格式进入训练管线。

RECAP // CHAPTER 07

机器提速, 人工保质

01

没有答案的图, 教不会模型

标注把像素转成可监督的语义

02

从零作业,变成 批改作业

效率提升来自工作重心变化:机器先给候选答案

03

会看大概, 不会精确测量

精确质量和尺寸应读取 3D/物理参数

04

错在哪里,就 修哪里

类别错就改标签

05

确认一次,写入 两类出口

标注既可留在 USD Prim 属性中

可靠的自动标注系统不是“全自动”,而是高效的人机协同质量流程。

SOURCE QUIZ // 10 MCQ

单选题 · 10题

第 1 / 10 题原讲义题库
得分 0 / 10
SOURCE PRACTICE 01

实操一 · 单物体全流程

VLM 自动标注 + 人工修正一个物体

任务描述:对场景中一个箱子完成从自动标注到人工确认的完整流程。

操作要求

  1. 打开上一章搭建的仓储场景
  2. 进入标注模式
  3. 运行 VLM 自动标注
  4. 选中红箱子,检查并修正类别、材质、颜色、质量、可抓取性
  5. 调整分割掩码使其精确贴合物体边缘
  6. 确认标注
  7. 截图保存标注结果(能看到彩色掩码和标签)
评分标准:VLM 预标注成功(20%)、属性填写正确(30%)、掩码精确(30%)、截图清晰(20%)。
SOURCE PRACTICE 02

实操二 · 三物体标注

完整标注 3 个物体

任务描述:对场景中 3 个待操作物体(2 个箱子 + 1 个托盘)完成全部标注。

操作要求

  1. 参照讲义步骤 3-5,完成所有 3 个物体的标注和审核
  2. 每个物体必须标注:类别、材质、颜色、质量、可抓取性
  3. 检查并修正所有分割掩码
  4. 确保没有漏标和错标
  5. 保存标注数据
  6. 验证:悬停物体显示正确的标注信息

提交要求

  • 场景文件(含标注数据)
  • 截图:标注模式下的整体场景截图(所有物体有彩色掩码)
  • 导出的 JSON 标注文件
评分标准:所有物体标注完整(30%)、属性正确(30%)、掩码精确(20%)、保存导出成功(20%)。
SOURCE PRACTICE 03

实操三 · 错误排查

标注错误排查

任务描述:老师提供一个有故意标注错误的场景文件,你需要找出并修正所有错误。

错误类型包括(至少 3 个错误)

  • 1 个漏标物体
  • 1 个类别错误
  • 1 个掩码边界不精确
  • 1 个物理属性缺失

操作要求

  1. 打开老师提供的"有错误"场景
  2. 逐一检查每个物体的标注
  3. 找出所有错误并修正
  4. 保存修正后的场景
  5. 提交一份错误报告:列出发现的错误类型、位置、修正方法
评分标准:找出所有错误(40%)、修正方法正确(40%)、错误报告清晰(20%)。