没有答案的图, 教不会模型
标注把像素转成可监督的语义
+ +
VLM 把“从零画标签”改造成“检查并修正”,但最终质量仍由人工审核与统一标准负责。
标注把像素转成可监督的语义
效率提升来自工作重心变化:机器先给候选答案
精确质量和尺寸应读取 3D/物理参数
类别错就改标签
标注既可留在 USD Prim 属性中
从“没有答案的图, 教不会模型”出发,逐页推进到“从零作业,变成 批改作业”;每张卡都写明本页应抓住的机制或边界。
标注把像素转成可监督的语义,让模型知道“什么答案才算正确”。
类别回答“是什么”,掩码回答“每个像素属于谁”,属性补充“它有什么特征”。
效率提升来自工作重心变化:机器先给候选答案,人负责检查与纠正。
阅读顺序:没有答案的图 → 同一个物体 → 从零作业
本节按“没有答案的图 → 同一个物体 → 从零作业”推进:先定位问题,再读机制,最后用页面结论校验理解。
READ THE SCENE
没有与任务对应的标签,原始图像无法直接成为监督信号。
读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。
标注把像素转成可监督的语义,让模型知道“什么答案才算正确”。
类别回答“是什么”,掩码回答“每个像素属于谁”,属性补充“它有什么特征”。
效率提升来自工作重心变化:机器先给候选答案,人负责检查与纠正。
从“图像 + 指令,输出 候选标签”出发,逐页推进到“预标注之后,必须过 三道门”;每张卡都写明本页应抓住的机制或边界。
VLM 输出先被转换为结构化标注,再叠加到视口等待人工确认。
精确质量和尺寸应读取 3D/物理参数,不能把视觉猜测当测量值。
标准流程是预标注、人工修正、确认保存;任何一步都不能直接跳过审核。
阅读顺序:图像 + 指令 → 会看大概 → 预标注之后
本节按“图像 + 指令 → 会看大概 → 预标注之后”推进:先定位问题,再读机制,最后用页面结论校验理解。
READ THE SCENE
图像与指令可先产出候选标签,但不能代替人工核对。
读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。
VLM 输出先被转换为结构化标注,再叠加到视口等待人工确认。
精确质量和尺寸应读取 3D/物理参数,不能把视觉猜测当测量值。
标准流程是预标注、人工修正、确认保存;任何一步都不能直接跳过审核。
从“错在哪里,就 修哪里”出发,逐页推进到“确认一次,写入 两类出口”;每张卡都写明本页应抓住的机制或边界。
类别错就改标签,边界错就修掩码,漏标要补,物理属性要回到场景参数核对。
完整、准确、精确、一致缺一不可;数据量不能补偿系统性错标。
标注既可留在 USD Prim 属性中,也可导出标准格式进入训练管线。
阅读顺序:错在哪里,就 修哪里 → 高质量标注 → 确认一次
本节按“错在哪里,就 修哪里 → 高质量标注 → 确认一次”推进:先定位问题,再读机制,最后用页面结论校验理解。
READ THE SCENE
错误类型被定位后,才知道应修改类别、边界还是属性。
读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。
类别错就改标签,边界错就修掩码,漏标要补,物理属性要回到场景参数核对。
完整、准确、精确、一致缺一不可;数据量不能补偿系统性错标。
标注既可留在 USD Prim 属性中,也可导出标准格式进入训练管线。
标注把像素转成可监督的语义
效率提升来自工作重心变化:机器先给候选答案
精确质量和尺寸应读取 3D/物理参数
类别错就改标签
标注既可留在 USD Prim 属性中
可靠的自动标注系统不是“全自动”,而是高效的人机协同质量流程。
任务描述:对场景中一个箱子完成从自动标注到人工确认的完整流程。
任务描述:对场景中 3 个待操作物体(2 个箱子 + 1 个托盘)完成全部标注。
任务描述:老师提供一个有故意标注错误的场景文件,你需要找出并修正所有错误。