版本:2026-08-14
主题:CV foundation model 中的 数据飞轮、自动化标注、无监督数据筛选、curation 设计理念
核心问题:为什么 SAM 系列能把 dense annotation 做到规模化,为什么 DINO 系列能把无标注图像变成可 scaling 的视觉表征数据?
写在最前面
写在最前面。笔者希望通过几个CV foundation model中具有代表性的几个工作,回顾一下CV中的scaling是怎么实现的,特别是站在LLM的视角下,重新审视和思考CV中的scaling。
视觉模型scaling的一条线是SAM系列,对于一些特定的视觉任务(图像分割、物体跟踪分割、3D重建),我们可以通过什么样的方式去构建data engine,然后实现scaling。但是对比LLM的scaling,这样的方式显然存在着一些差异:
-
任务范式窄:不同版本的SAM几乎只针对一个视觉任务,并没有统一的promptability去实现广泛的下游统一范式。
-
scaling缺少涌现:scaling之后,更多的数据和更大的模型,我们仍然只是在这个任务上的bench上获得了一些收益,可是之后呢?多大的数据和模型够达到100分?大模型和小模型本质区别在哪里?
答案里似乎埋藏着CV的本质,悲观地视角来看,传统的CV范式通过scaling不能实现智能,也不会有智能涌现。LLM的scaling,智能涌现的本质是抽象化的符号系统+data synergy,多种任务统一在语言空间中,使模型学会举一反三,触类旁通,从而实现泛化。例如,数学推理可以帮助coding任务,因为coding背后的算法和数学推理是强相关的,模型学习数学推理能够更好地从coding中抽象出算法。
那么CV任务中是否也存在着类似的现象呢?试想我们将SAM系列做一个统一,从图像、视频到3D,所有估计任务放在一起,模型学习图像的mask估计,有助于做视频的mask估计;模型学习人体pose的估计,也有助于做人体的mask估计。显然在视觉任务中,也存在类似的data synergy。这应当是CV foundation model需要重视的地方。
但是,存在data synergy不等于存在智能涌现,CV模型更偏向感知,传统CV任务(不包括多模态的理解或生成)输出的空间都是预先定义好的一些固定格式,用于表示一些特定含义。而语言空间本身纳入了数学、coding,这些高度抽象化和符号化的东西能够高效地产生逻辑推理,一定程度上代表了智能本身。
另一条线,是DINO系列的自监督。DINO的问题和SAM不同,不需要人类标注的知识,自动从数据中学习概念。从scaling的角度来看,DINO在下游任务的提升依赖于retrieval,这是一个严重的问题。很可能说明data synergy这件事在视觉自监督中更加困难,下游任务之外的数据对下游任务可能没有帮助。
再往更深的层次思考,SAM/DINO之类的视觉基础模型怎么和语言模型建立连接,或者是否需要建立连接,都是很难处理的问题。从视觉基础模型到真正具备视觉能力的智能还有很大gap。
总而言之,我们或许不应当对CV foundation model在智能方面报以过高的期许,它的使命,可能就是在感知任务上作为智能的基础。但是笔者也相信,好的scaling范式是相通的,SAM/DINO系列的实践经验,可以给后续工作带来启发,例如在多模态任务的scaling中可以借鉴。
SAM / SAM2 / SAM3D 与 DINOv2 / DINOv3 的 Data Engine 与 Data Curation
0. 摘要
SAM 与 DINO 系列都在回答同一个 CV scaling 问题:图像/视频/3D 数据不像文本 token 那样天然带有密集、廉价、可自动获取的监督信号,那么如何把 raw visual data 变成 effective training data?
但它们的答案不同:
-
SAM 系列走的是 data engine 路线:用当前模型帮助人类或自动系统产生更便宜、更密集、更结构化的标注,再用新数据训练更强模型,形成“模型改进数据、数据改进模型”的闭环。
-
DINO 系列走的是 curation engine 路线:不依赖人工标签或文本 caption,而是在视觉 embedding 空间中进行过滤、去重、检索、聚类、平衡采样,让自监督学习看到更有代表性、更少冗余、更覆盖长尾的图像分布。
一句话总结:
SAM 的核心是“让标注可 scaling”;DINO 的核心是“让无标注图像的有效信息可 scaling”。
1. 总览:两类视觉数据引擎
1.1 SAM-style data engine:生成结构化标注
SAM、SAM2、SAM3D 的共同逻辑是:先定义一个可提示、可交互、可验证的任务接口,然后让模型参与数据生产。
在 SAM 系列中,数据不是被动收集的,而是被“制造”出来的:
-
SAM 制造 image masks;
-
SAM2 制造 video masklets;
-
SAM3D 制造 image-grounded 3D shape / texture / pose / layout supervision;
-
SAM3D Body 制造 human mesh recovery supervision。
这里的关键不是“标注员画得更快”这么简单,而是 把人类角色从逐像素生产者转变为纠错者、验证者、排序者、偏好提供者。这使得标注成本从“人类直接创作结构化标签”变成“模型生成候选,人类选择/校正/过滤”。
1.2 DINO-style curation engine:选择有效无标注数据
DINOv2、DINOv3 的目标不是创建显式标签,而是提高自监督预训练数据的有效性。
DINO 系列的核心判断是:
自监督不是“任何无标注图像都行”。如果 raw data 充满重复、低质量、分布偏置或长尾缺失,模型会浪费容量在冗余模式上;curation 的作用是让每个 batch 的视觉信息密度更高。
2. SAM:从交互式分割到 SA-1B
2.1 目标:把 segmentation 变成 promptable foundation task
SAM 的贡献不是简单训练了一个更大的分割模型,而是同时定义了三件事:
-
Promptable segmentation task:输入点、框、mask、文本等 prompt,输出一个合法 mask。
-
SAM 模型:图像编码器 + prompt 编码器 + 轻量 mask decoder,支持交互式预测。
-
SA-1B data engine:通过模型参与标注,构建大规模 mask 数据集。
SAM 论文明确指出,SA-1B 包含 11M licensed and privacy-preserving images 和 1.1B masks;这些 masks 通过 data engine 收集,其中最终发布的 SA-1B 只包含自动生成的 masks。1
2.2 三阶段 data engine
SAM 的 data engine 有三个阶段:assisted-manual、semi-automatic、fully automatic。其本质是逐步减少人类参与,同时逐步扩大 mask 覆盖。
| 阶段 | 人类角色 | 模型角色 | 数据价值 |
|---|---|---|---|
| Assisted-manual | 画/修 mask | 交互式辅助 | 建立高质量初始数据 |
| Semi-automatic | 补充未覆盖对象 | 自动生成部分对象 masks | 增加 diversity,减少 saliency bias |
| Fully automatic | 主要做验证与质量评估 | 网格点自动生成 masks | 扩展到 1B+ masks |
2.3 质量控制:为什么自动 mask 可以用?
SAM 不是盲目相信自动标注。论文中对自动 mask 做了质量估计:随机采样 500 张图约 50K masks,让专业标注员修正;自动 mask 与修正 mask 的 IoU 中,94% 超过 90%,97% 超过 75%。2
这说明 SAM data engine 的核心设计并不是“自动标注就够了”,而是:
先通过人类辅助阶段把模型推到足够强,再让模型自动生成密集候选,最后用人类评估确认自动标注质量达到可训练阈值。
2.4 SAM curation 的核心思想
SAM 的 curation 不主要发生在“选哪些图片”,而发生在“同一张图里选择哪些 objects / parts / stuff 被 mask 化”。它在单张图内部增加监督密度。
SAM 背后的设计理念可以总结为:
-
把任务接口做成 promptable:prompt 既是推理接口,也是数据生产接口。
-
把模型部署到标注系统里:模型不是训练结束才用,而是从数据生产阶段就开始用。
-
从 saliency-driven 标注转向 grid-driven 覆盖:人工标注通常偏向显著前景物体;规则网格点可以覆盖背景、小物体、部件和 stuff。
-
接受语义开放性:SAM 不强迫类别标签,因此避开了 closed-vocabulary classification 的瓶颈。
-
用 ambiguity-aware 训练降低 prompt 不确定性:单点 prompt 可能对应局部、整体、遮挡对象;SAM 输出多个候选 mask 以处理歧义。
3. SAM2:从 image mask 到 video masklet
3.1 目标:把“任意图像分割”扩展到“任意视频分割”
SAM2 解决的是 promptable visual segmentation in images and videos。相比 SAM,视频数据有两个额外难点:
-
每个对象不再是单帧 mask,而是跨时间的 masklet;
-
标注成本随帧数线性增长,且需要 temporal consistency。
SAM2 因此引入 streaming memory:模型记住目标对象在过去帧的空间特征和高层 object pointers,让用户用少量点击或 mask prompt 就能持续跟踪目标。3
3.2 SAM2 data engine 的三阶段
SAM2 的 data engine 同样是三阶段,但每一阶段针对的是视频标注成本。
SAM2 论文报告:
-
Phase 1:SAM per-frame,37.8 秒/帧,收集 16K masklets / 1.4K videos;
-
Phase 2:SAM + SAM2 Mask,7.4 秒/帧,收集 63.5K masklets;
-
Phase 3:full SAM2,4.5 秒/帧,收集 197K masklets;
-
SA-V 数据集包含 50.9K videos 和 642.6K masklets,其中包含 190.9K manual masklets 和 451.7K automatic masklets。4
3.3 SAM2 的 auto masklet:不只是扩大数量,也收集 failure cases
SAM2 自动 masklet 生成使用第一帧规则网格点 prompt 生成候选 masklets,然后进入验证流程:
-
satisfactory 的自动 masklet 加入 SA-V;
-
unsatisfactory 的 masklet 被当作 failure case,送回人工 + SAM2 交互流程 refinement。
这一步非常关键。它不是“过滤掉错误样本”而已,而是构建了一个 hard-example mining loop:
3.4 SAM2 curation 的设计理念
SAM2 的 curation 有三个层次:
-
时间一致性优先:masklet 不是独立 masks 的集合,而是同一对象跨帧的轨迹。数据质量标准从 “boundary quality” 扩展到 “tracking consistency”。
-
用 memory 降低人工编辑频率:SAM 是单帧工具;SAM2 的 memory 让用户不必逐帧从零开始。
-
自动生成覆盖非显著对象:人类倾向标注中心显著对象;grid prompt 可以挖出背景、小目标、边缘区域对象。
SAM2 最有启发的一点是:
当任务从 image 扩展到 video,data engine 的核心瓶颈从“画 mask”变成了“维护 object identity over time”。模型结构中的 memory 不是单纯为推理设计的,也是为数据生产设计的。
4. SAM3D:从 2D promptable perception 到 grounded 3D reconstruction
4.1 命名说明:SAM3D Objects 与 SAM3D Body
Meta 在 2025 年发布的 SAM 3D 包含两个方向:
-
SAM 3D Objects:从单张自然图像中重建 object / scene 的 3D shape、texture、layout;
-
SAM 3D Body:从单张图像中恢复人体 pose 和 shape,基于 Momentum Human Rig,支持 keypoints 和 masks 作为辅助 prompt。5
本报告主要讨论 SAM 3D Objects 的 data engine,因为它与 SAM/SAM2 的“标注飞轮”关系最直接;同时在 4.7 节补充 SAM 3D Body 的 curation 逻辑。
4.2 3D 的核心瓶颈:人类不能像画 mask 一样画 mesh
SAM3D 面对的不是 mask annotation,而是更难的数据问题:
给定一张自然图像和目标 mask,需要获得该物体的 3D shape、texture、rotation、translation、scale。
对于普通标注员来说,直接创建 3D mesh 几乎不可行;即使专业 3D artist,也需要很长时间。SAM3D 的核心洞察是:
大多数人不能从零创建 mesh,但可以在多个候选 mesh 中选出更像的,并给出质量评分。
于是 SAM3D 把数据生产形式从“人类创作 3D”转成“模型生成候选 + 人类 ranking / selection / verification”。论文将其描述为 human- and model-in-the-loop pipeline,用于标注 object shape、texture 和 pose。6
4.3 SAM3D 的多阶段训练:synthetic pretraining → real-world alignment
SAM3D 的训练路线更像 LLM/生成模型:
SAM3D 使用的关键数据包括:
-
Iso-3DO:孤立 3D asset 渲染,用于基础 shape/texture 能力;
-
RP-3DO:Render-Paste 数据,把 synthetic textured meshes 合成到自然图像中,生成有精确 3D ground truth 的图像;论文提到 RP-3DO 有 61M samples 和 2.8M unique meshes;7
-
MITL-3DO:model-in-the-loop 的真实图像 3D 标注;
-
Art-3DO:最难样本交给专业 3D artists,补齐模型 blind spots;
-
SA-3DAO:artist-created benchmark,用于 real-world 3D object reconstruction 评估。
4.4 SAM3D data engine 的三个核心 stage
论文描述的数据流程包括:
-
Stage 1:Choosing target objects 从多样真实数据集中采样图像和对象 mask,并使用 3D-oriented taxonomy 平衡对象分布。
-
Stage 2:Object model ranking and selection 模型 ensemble 生成多个 shape/texture 候选;标注员从 N 个候选中选择最匹配图像的候选并评分。论文明确把这称为 best-of-N search using humans。
-
Stage 2.5:Hard example triage 对于模型完全无法生成合理 shape 的 hard cases,普通标注员不能修 mesh,因此路由给专业 3D artists,形成 Art-3DO。
-
Stage 3:Aligning objects to 2.5D scene 标注员在 point cloud / point map 中调整 translation、rotation、scale,得到 camera-relative layout。
最终,SAM3D 标注了接近 1M images、约 3.14M untextured meshes 和约 100K textured meshes。8
4.5 SAM3D 的 curation 核心:从 label production 到 preference alignment
SAM3D 相比 SAM/SAM2 更接近 RLHF / preference learning:
-
当前模型生成多个候选;
-
人类选择最佳候选;
-
高质量候选进入 SFT;
-
低质量候选或未选候选作为 preference negative;
-
使用 DPO 等方式对齐人类偏好;
-
新模型产生更高质量候选,继续循环。
这可以抽象为:
SAM3D 论文也指出,这个 data engine 可以理解为一种 online alignment algorithm,与 RLHF、self-training、Expert Iteration 有相似性。9
4.6 SAM3D 对 CV scaling 的启发
SAM3D 最值得关注的是它没有假设真实 3D ground truth 可以直接 scale,而是设计了一个“可被普通人验证”的接口。
这背后的设计原则是:
当标签太难直接生产时,不要强迫人类生产标签;应让模型生成候选,让人类执行低成本的比较、选择、评分、修正。
这与 LLM 后训练中的偏好数据非常相似。3D 的 ground truth 很难从 web 获得,所以 SAM3D 用 synthetic pretraining 解决 cold start,用 real-world post-training 解决 sim-to-real,用 human preference 解决质量和审美对齐。
4.7 补充:SAM3D Body 的 curation
SAM3D Body 关注 single-image full-body human mesh recovery。它使用新的 MHR 表示,解耦 skeletal structure 和 surface shape;支持 2D keypoints、masks 等辅助 prompts。SAM3D Body 论文摘要描述其高质量标注来自多阶段 annotation pipeline,结合 manual keypoint annotation、differentiable optimization、multi-view geometry 和 dense keypoint detection;其 data engine 还会选择 unusual poses 和 rare imaging conditions,以提高数据多样性。10
Meta 官方介绍还提到 SAM3D Body 从大规模多样图像、multi-camera videos、专业合成数据出发,通过自动化 data engine 挖掘 high-value images,组装约 8M images 的高质量训练集。11
这说明 SAM3D Body 的 data engine 更强调:
-
rare pose / rare capture condition mining;
-
多视角几何与优化生成高质量伪真值;
-
promptable human mesh recovery;
-
人体表示 MHR 对下游稳定性的影响。
5. DINOv2:视觉自监督中的 data curation
5.1 目标:不用文本、不用人工标签,训练通用视觉特征
DINOv2 的目标是学习 robust visual features without supervision。它的核心不是“无脑吃 1B+ web images”,而是构建一个 curated image dataset:LVD-142M。
DINOv2 论文明确说,LVD-142M 是从 uncurated large pool 中检索与多个 curated datasets 接近的图像构成;该流程不需要 metadata 或 text,直接作用于图像。12
5.2 DINOv2 curation pipeline
DINOv2 的 curated seed datasets 包括 ImageNet-22k、ImageNet-1k train split、Google Landmarks 和一些 fine-grained datasets;raw web 数据经过 URL/domain 安全过滤、PCA hash 去重、NSFW 过滤、可识别人脸模糊,得到 1.2B unique images;随后进一步去除近重复和 benchmark test/val 近重复,避免泄漏。13
5.3 为什么不是直接随机采样 142M?
DINOv2 做了对比:同样训练 ViT-g/14、同样迭代数,比较 ImageNet-22k、uncurated random 142M、LVD-142M。结果显示 curated LVD-142M 在多数 benchmark 上优于 uncurated data,尤其在跨域任务上更强。论文明确总结:curated images 在 self-supervised pretraining 中也更有效。14
这说明:
自监督学习可以去掉人工标签,但不能去掉数据分布设计。没有标签不等于没有 supervision;自监督目标仍然会从数据分布中继承偏置和冗余。
5.4 DINOv2 的训练目标与 curation 的关系
DINOv2 使用 DINO image-level objective 与 iBOT patch-level objective 的组合,并加上 Sinkhorn-Knopp centering、KoLeo regularizer、高分辨率短训等组件。15
关键点是:
-
image-level objective 让 CLS / global representation 有语义一致性;
-
patch-level iBOT objective 让 dense features 更有局部结构;
-
curated data 让这些 objective 面对多样但不过度噪声的视觉概念。
如果数据没有被 curate,patch-level objective 可能大量学习重复纹理、模板、低质量图像;如果只用 ImageNet-like 数据,模型可能泛化到长尾、场景、细粒度、非自然图像任务时不足。
5.5 DINOv2 的 curation 设计理念
DINOv2 的核心理念可以概括为:
用少量 curated seed datasets 定义“视觉质量和语义覆盖的参考空间”,再用 embedding retrieval 从 web-scale raw pool 中扩展这个空间。
它不是按文本匹配,也不是按类别标签采样,而是按视觉相似性扩展。可以把它理解成:
这种方法的优点:
-
不依赖 caption,因此避免 web caption 噪声;
-
不依赖人工类别标签,因此适合 self-supervised backbone;
-
可以从 curated benchmark/domain seed 出发扩大覆盖;
-
可控制 test leakage 和 near-duplicate contamination;
-
比随机 raw crawl 更有效。
局限也很明显:
-
seed dataset 决定了 retrieval 的覆盖边界;
-
visual similarity 可能放大 seed bias;
-
检索到的图像可能语义相似但任务难度不够;
-
DINOv2 的 LVD-142M 仍比真正开放 web 分布窄。
6. DINOv3:从 retrieval curation 到 billion-scale balanced visual concepts
6.1 目标:把 DINOv2 的 SSL foundation model scale 到更大数据、更大模型、更强 dense features
DINOv3 是 DINO 系列更明确的 scaling 版本。论文称其通过 careful data preparation、design、optimization,同时 scale dataset 和 model;核心新问题是:长训练会提升 global metrics,但 dense features 会退化,因此需要 Gram anchoring 来保持 patch-level consistency。16
DINOv3 teacher 规模从 DINOv2 的 1.1B ViT-giant 提升到约 6.7B ViT-7B,并发布一系列蒸馏后的 ViT/ConvNeXt 模型。17
6.2 DINOv3 的数据构造:17B raw pool → LVD-1689M + retrieval + public datasets
DINOv3 的预训练数据从 Instagram public posts 的约 17B web images raw pool 出发;这些图像先经过平台级内容审核。随后构造三个数据部分:
-
hierarchical k-means + balanced sampling 使用 DINOv2 embeddings,对 raw pool 做 5 层层次聚类,cluster 数从低到高为 200M、8M、800K、100K、25K;再用 balanced sampling 得到 LVD-1689M,目标是平衡覆盖 web 上的视觉概念。
-
retrieval-based curation 类似 DINOv2,从 selected seed datasets 检索相似图像,使数据覆盖 downstream-relevant visual concepts。
-
raw public CV datasets 包括 ImageNet1k、ImageNet22k、Mapillary Street-level Sequences 等,用于优化模型性能。
训练时,DINOv3 使用 sampler 混合这些数据部分;论文中特别提到 10% training iterations 使用 ImageNet1k homogeneous batches,其余使用混合数据。18
6.3 为什么 DINOv3 不只用 retrieval?
DINOv3 论文比较了 raw、clustering、retrieval、full LVD-1689M mixture:没有单一 curation 技术在所有 benchmark 上最好;clustering 更利于多样和平衡,retrieval 更利于常见下游任务,full pipeline 获得“best of both worlds”。19
可以理解为:
| 方法 | 优势 | 风险 |
|---|---|---|
| Raw sampling | 覆盖广,成本低 | 冗余、噪声、分布不平衡 |
| Retrieval | 与 benchmark / seed 相关性强 | 可能过拟合 seed 分布,覆盖受限 |
| Clustering + balanced sampling | 长尾覆盖更均衡 | 未必最贴合具体 downstream |
| Mixture | 兼顾覆盖与实用性 | 需要 sampler 和比例设计 |
6.4 DINOv3 的关键新问题:dense features 在长训练中退化
DINOv3 发现,大规模 SSL 长训练时 global classification 表现会持续提升,但 dense prediction 表现可能下降。论文分析认为,训练后期 patch-level consistency 变差:patch features 的局部相似性变得噪声化,CLS 与 patch token 过度相似,局部性减弱。20
这对 CV foundation model 非常关键:
LLM scaling 通常更关心 token-level loss;CV foundation model 同时需要 global representation 和 dense representation。更长训练不一定同时改善二者。
6.5 Gram anchoring:让 scaling 不牺牲 dense representation
DINOv3 引入 Gram anchoring,用较早 checkpoint 或高分辨率 teacher 的 patch correlation structure 约束后续模型,防止 dense feature map 变得不稳定。论文中的 ablation 显示,使用高分辨率 Gram teacher 可以显著提升 ADE20k mIoU,并改善 depth RMSE。21
6.6 DINOv3 curation 的设计理念
DINOv3 的核心不是单纯把 DINOv2 的 142M 扩到 1.7B,而是三件事一起做:
-
用 embedding-space clustering 做概念平衡:避免 raw data 中热门视觉概念支配训练。
-
用 retrieval 保持 downstream usefulness:不要只追求分布均匀,也要贴近实际任务。
-
用 objective/optimization 保持 dense feature quality:数据 scaling 如果导致 dense 表征退化,必须用训练目标修正。
DINOv3 的深层启示是:
对 CV backbone 来说,curation 不是训练前的一次性过滤,而是和模型结构、loss、sampler、训练时长、分辨率策略共同组成 scaling recipe。
7. 横向比较:SAM 系列 vs DINO 系列
| 维度 | SAM | SAM2 | SAM3D Objects | DINOv2 | DINOv3 |
|---|---|---|---|---|---|
| 数据目标 | image masks | video masklets | 3D shape/texture/layout | curated unlabeled images | billion-scale balanced unlabeled images |
| 是否生成标签 | 是 | 是 | 是 | 否 | 否 |
| 人类角色 | 交互标注、修正、质量评估 | refinement clicks、masklet verification | ranking、selection、pose alignment、hard cases artist | 无直接标注;seed datasets 间接定义视觉空间 | 无直接标注;通过 clustering/retrieval/sampler 定义分布 |
| 模型角色 | 辅助/自动生成 masks | 跟踪、传播、自动 masklets | 生成候选 mesh、产生偏好样本 | 生成 embeddings、SSL training | DINOv2 embedding for curation、7B SSL teacher |
| curation 单位 | object / part / stuff mask | object trajectory / masklet | object mesh + pose + texture | image | image cluster / visual concept |
| 质量门控 | human ratings, IoU vs corrected masks | satisfactory/unsatisfactory verification | quality threshold, best-of-N, artist data | dedup, NSFW, leakage removal, retrieval quality | cluster balance, retrieval relevance, mixture sampler |
| 主要瓶颈 | dense mask 标注成本 | temporal consistency 标注成本 | 3D ground truth 极稀缺 | raw web image 冗余/偏置 | billion-scale balance + dense feature stability |
| 核心飞轮 | SAM 标注更多 mask → SAM 更强 | SAM2 标注更多 masklets → memory/tracking 更强 | model candidates + human preference → real-world 3D alignment | curated data → better SSL features | larger curated data + Gram anchoring → global+dense features |
8. Curation 背后的核心思想
8.1 有效数据量不是 raw data size
可以用一个粗略公式理解:
SAM 系列提升的是 label richness 和 task alignment;DINO 系列提升的是 diversity、quality、低 redundancy 和 distribution balance。
8.2 Data engine 的本质是降低下一个有效样本的边际成本
SAM/SAM2/SAM3D 的每一代 data engine 都在降低“新增一个高质量结构化样本”的成本:
-
SAM:从人工画 mask → SAM 辅助 → SAM 自动 grid mask;
-
SAM2:从逐帧 mask → 首帧 prompt + temporal propagation;
-
SAM3D:从人工建 mesh → 模型候选 + 人类 ranking + artist hard cases。
这说明 data engine 设计中最重要的问题不是“如何标更多数据”,而是:
如何改变人类参与形式,使人类只做模型最难自动化、但人类很擅长的判断。
8.3 Curation 是 embedding 空间里的分布工程
DINOv2/v3 的 curation 说明,CV 数据分布不是靠文件数量描述的,而应该在 representation space 中描述:
-
哪些 visual concepts 被过度采样?
-
哪些长尾概念缺失?
-
哪些样本只是近重复?
-
哪些图像与 benchmark/test 重合?
-
哪些 seed domains 被放大,哪些 domain 被忽略?
因此,DINO-style curation 可以看作“视觉 embedding 空间中的数据工程”。
8.4 Promptability 是 data engine 的接口设计
SAM 系列的 prompt 不只是 inference interface,也是 annotation interface:
-
点/框/mask prompt 让人类可以低成本指定目标;
-
ambiguity-aware multi-mask 输出允许模型在不确定时保持多个合法解释;
-
video memory 让 prompt 从单帧扩展为 object identity;
-
3D masks/keypoints/pointmaps 让 2D perception 接入 3D reconstruction。
因此 promptability 的本质是:
把复杂视觉任务拆成“人类容易表达 intent、模型容易补全 structure”的交互协议。
8.5 Synthetic data 是 cold start,real-world alignment 是落地关键
SAM3D 尤其清楚地展示了这一点:
-
synthetic 3D assets 可以提供精确 shape/texture ground truth;
-
render-paste 可以提供 occlusion、scale、pose、mask-following 训练信号;
-
真实图片中的遮挡、上下文、间接视角、材质不确定性仍然需要 post-training alignment;
-
human preference 用于补足无法由 synthetic supervision 覆盖的质量维度。
这是一种通用策略:
8.6 Global representation 和 dense representation 需要分别保护
DINOv3 的 Gram anchoring 暗示:CV scaling 不像 LLM 那样只优化一个序列建模目标就够。视觉 backbone 同时被用于:
-
global classification / retrieval;
-
segmentation;
-
depth;
-
correspondence;
-
tracking;
-
3D / robotics。
如果训练目标和数据分布过度偏向 global semantics,patch-level dense structure 可能退化。因此,CV curation 和 training recipe 必须显式考虑 dense feature quality。
9. 如何借鉴这些 data engine 设计自己的 CV 数据飞轮?
下面是一个可复用的设计框架。
9.1 第一步:定义可 prompt / 可验证的任务接口
不要一开始就问“我要多少数据”,先问:
-
人类如何低成本表达目标?点、框、mask、文本、keypoint、轨迹、crop?
-
模型输出是否容易被人类验证?
-
错误是否可以被局部修正?
-
是否可以让模型输出多个候选,让人类选择?
如果输出是 mask、box、keypoint、caption、3D pose、mesh ranking,这些都可能形成 data engine。如果输出需要专家从零创作,则需要转成 ranking / verification / editing。
9.2 第二步:把人类劳动放在最高杠杆位置
| 标签难度 | 低杠杆人类劳动 | 高杠杆人类劳动 |
|---|---|---|
| mask | 人工逐像素画 | 点/框 prompt + 修正 |
| video masklet | 每帧从零画 | 首帧 prompt + 少量 refinement clicks |
| 3D mesh | 从零建模 | 候选 ranking + pose alignment |
| 人体 3D | 直接标 3D mesh | keypoints + multi-view optimization + rare case selection |
| 大规模无标注图 | 人工逐张筛 | embedding clustering/retrieval + 抽样审计 |
9.3 第三步:建立质量门控和 hard case 回流
一个好的 data engine 不应该只是过滤错误,而应该把错误变成训练信号:
SAM2 的 unsatisfactory masklets 回流 refinement,SAM3D 的 hard cases 送给 artists,都是这个思想。
9.4 第四步:区分“覆盖型数据”和“能力型数据”
-
覆盖型数据:用于让模型见到更多分布、更多长尾、更多场景。
-
能力型数据:用于补足某种明确能力,例如遮挡、极小物体、罕见姿态、复杂材质、跨帧消失重现。
DINOv3 的 clustering 更偏覆盖型;retrieval 和 public CV datasets 更偏能力/benchmark-relevant;SAM3D 的 RP-3DO 和 Art-3DO 则分别服务于 occlusion/mask-following 与 hard real-world quality。
9.5 第五步:用独立评估集防止 data engine 自嗨
Model-in-the-loop 容易产生偏差:模型擅长生成的样本更容易通过验证,模型不擅长的样本可能被拒绝或低频出现。SAM2 用 Phase 1 高质量 per-frame 标注创建 val/test,SAM3D 创建 SA-3DAO artist benchmark,DINOv2 去除 benchmark val/test 近重复,都是为了避免评估被数据引擎污染。
10. 关键结论
-
SAM 系列和 DINO 系列都是 CV scaling 的数据侧答案,但解决的问题不同。 SAM 解决 dense / temporal / 3D structured label scarcity;DINO 解决 unlabeled image pretraining 的分布质量和冗余问题。
-
SAM 的 data engine 是“标注生产系统”。 它通过 promptability、model-in-the-loop、human verification、automatic generation,把昂贵的 dense annotation 变成可扩展流程。
-
SAM2 的关键不是简单把 SAM 用到视频,而是让 temporal memory 进入数据生产。 视频标注的瓶颈是跨帧身份一致性;SAM2 用 memory 和 refinement clicks 把逐帧成本降下来。
-
SAM3D 的关键是把 3D 标注转化为人类可做的 ranking / preference task。 它承认真实 3D ground truth 稀缺,并用 synthetic pretraining + real-world post-training + human preference alignment 打破数据瓶颈。
-
DINOv2 证明自监督视觉模型仍然需要 curation。 没有标签不代表 raw data 可直接 scaling;去重、过滤、检索和 seed distribution 设计决定 effective data。
-
DINOv3 把 curation 从 retrieval 扩展到 billion-scale balanced visual concept coverage。 它同时使用 clustering、retrieval、public high-quality datasets 和 sampler,把泛化覆盖与下游相关性结合起来。
-
CV 的 data curation 必须考虑 dense features。 DINOv3 的 Gram anchoring 说明:大模型长训可能提升 global semantics,却伤害 patch-level locality;CV foundation model 需要同时保护 global 和 dense representations。
最终可以把这些工作统一成一句话:
CV scaling 的核心不是“堆更多图片”,而是设计一种机制,把 raw visual data 转换成更高密度、更低冗余、更强任务对齐、更可验证的有效数据。SAM 用模型生成结构化标注,DINO 用视觉表征筛选无标注数据;二者共同构成了视觉 foundation model 的数据工程范式。
11. 参考资料
-
Kirillov et al., Segment Anything, arXiv:2304.02643. https://arxiv.org/abs/2304.02643 ↩
-
Segment Anything paper, SA-1B dataset and mask quality analysis. https://arxiv.org/html/2304.02643v1 ↩
-
Ravi et al., SAM 2: Segment Anything in Images and Videos, arXiv:2408.00714. https://arxiv.org/abs/2408.00714 ↩
-
SAM 2 paper, data engine phases and SA-V dataset. https://arxiv.org/html/2408.00714v2 ↩
-
Meta AI, Introducing SAM 3D: Powerful 3D Reconstruction for Physical World Images, 2025-11-19. https://ai.meta.com/blog/sam-3d/ ↩
-
SAM 3D Team, SAM 3D: 3Dfy Anything in Images, arXiv:2511.16624. https://arxiv.org/abs/2511.16624 ↩
-
SAM 3D paper, Render-Paste / RP-3DO pipeline. https://arxiv.org/html/2511.16624v2 ↩
-
SAM 3D paper, post-training collection step and model-in-the-loop annotation. https://arxiv.org/html/2511.16624v2 ↩
-
SAM 3D paper, relationship to self-training / RLHF / Expert Iteration. https://arxiv.org/html/2511.16624v2 ↩
-
Yang et al., SAM 3D Body: Robust Full-Body Human Mesh Recovery, arXiv:2602.15989. https://arxiv.org/abs/2602.15989 ↩
-
Meta AI, Introducing SAM 3D: Powerful 3D Reconstruction for Physical World Images, 2025-11-19. https://ai.meta.com/blog/sam-3d/ ↩
-
Oquab et al., DINOv2: Learning Robust Visual Features without Supervision, arXiv:2304.07193. https://arxiv.org/abs/2304.07193 ↩
-
DINOv2 paper, data processing pipeline for LVD-142M. https://arxiv.org/html/2304.07193v2 ↩
-
DINOv2 paper, pretraining data source ablation. https://arxiv.org/html/2304.07193v2 ↩
-
DINOv2 paper, DINO + iBOT + KoLeo + high-resolution adaptation training recipe. https://arxiv.org/html/2304.07193v2 ↩
-
Siméoni et al., DINOv3, arXiv:2508.10104. https://arxiv.org/abs/2508.10104 ↩
-
DINOv3 paper, teacher architecture and distilled model family. https://arxiv.org/html/2508.10104v1 ↩
-
DINOv3 paper, data collection and curation section. https://arxiv.org/html/2508.10104v1 ↩
-
DINOv3 paper, training data ablation comparing raw, clustering, retrieval and full mix. https://arxiv.org/html/2508.10104v1 ↩
-
DINOv3 paper, Gram anchoring motivation and patch-level consistency analysis. https://arxiv.org/html/2508.10104v1 ↩
-
DINOv3 paper, high-resolution Gram anchoring ablation. https://arxiv.org/html/2508.10104v1 ↩