研究手记 · Computer Vision

视觉模型何以 Scaling?

从 SAM 到 DINO,重新理解视觉基础模型的数据飞轮、自动化标注与数据筛选。

文章目录

版本:2026-08-14

主题:CV foundation model 中的 数据飞轮、自动化标注、无监督数据筛选、curation 设计理念

核心问题:为什么 SAM 系列能把 dense annotation 做到规模化,为什么 DINO 系列能把无标注图像变成可 scaling 的视觉表征数据?


写在最前面

写在最前面。笔者希望通过几个CV foundation model中具有代表性的几个工作,回顾一下CV中的scaling是怎么实现的,特别是站在LLM的视角下,重新审视和思考CV中的scaling。

视觉模型scaling的一条线是SAM系列,对于一些特定的视觉任务(图像分割、物体跟踪分割、3D重建),我们可以通过什么样的方式去构建data engine,然后实现scaling。但是对比LLM的scaling,这样的方式显然存在着一些差异:

  • 任务范式窄:不同版本的SAM几乎只针对一个视觉任务,并没有统一的promptability去实现广泛的下游统一范式。

  • scaling缺少涌现:scaling之后,更多的数据和更大的模型,我们仍然只是在这个任务上的bench上获得了一些收益,可是之后呢?多大的数据和模型够达到100分?大模型和小模型本质区别在哪里?

答案里似乎埋藏着CV的本质,悲观地视角来看,传统的CV范式通过scaling不能实现智能,也不会有智能涌现。LLM的scaling,智能涌现的本质是抽象化的符号系统+data synergy,多种任务统一在语言空间中,使模型学会举一反三,触类旁通,从而实现泛化。例如,数学推理可以帮助coding任务,因为coding背后的算法和数学推理是强相关的,模型学习数学推理能够更好地从coding中抽象出算法。

那么CV任务中是否也存在着类似的现象呢?试想我们将SAM系列做一个统一,从图像、视频到3D,所有估计任务放在一起,模型学习图像的mask估计,有助于做视频的mask估计;模型学习人体pose的估计,也有助于做人体的mask估计。显然在视觉任务中,也存在类似的data synergy。这应当是CV foundation model需要重视的地方。

但是,存在data synergy不等于存在智能涌现,CV模型更偏向感知,传统CV任务(不包括多模态的理解或生成)输出的空间都是预先定义好的一些固定格式,用于表示一些特定含义。而语言空间本身纳入了数学、coding,这些高度抽象化和符号化的东西能够高效地产生逻辑推理,一定程度上代表了智能本身。

另一条线,是DINO系列的自监督。DINO的问题和SAM不同,不需要人类标注的知识,自动从数据中学习概念。从scaling的角度来看,DINO在下游任务的提升依赖于retrieval,这是一个严重的问题。很可能说明data synergy这件事在视觉自监督中更加困难,下游任务之外的数据对下游任务可能没有帮助。

再往更深的层次思考,SAM/DINO之类的视觉基础模型怎么和语言模型建立连接,或者是否需要建立连接,都是很难处理的问题。从视觉基础模型到真正具备视觉能力的智能还有很大gap。

总而言之,我们或许不应当对CV foundation model在智能方面报以过高的期许,它的使命,可能就是在感知任务上作为智能的基础。但是笔者也相信,好的scaling范式是相通的,SAM/DINO系列的实践经验,可以给后续工作带来启发,例如在多模态任务的scaling中可以借鉴。

SAM / SAM2 / SAM3D 与 DINOv2 / DINOv3 的 Data Engine 与 Data Curation

0. 摘要

SAM 与 DINO 系列都在回答同一个 CV scaling 问题:图像/视频/3D 数据不像文本 token 那样天然带有密集、廉价、可自动获取的监督信号,那么如何把 raw visual data 变成 effective training data?

但它们的答案不同:

  • SAM 系列走的是 data engine 路线:用当前模型帮助人类或自动系统产生更便宜、更密集、更结构化的标注,再用新数据训练更强模型,形成“模型改进数据、数据改进模型”的闭环。

  • DINO 系列走的是 curation engine 路线:不依赖人工标签或文本 caption,而是在视觉 embedding 空间中进行过滤、去重、检索、聚类、平衡采样,让自监督学习看到更有代表性、更少冗余、更覆盖长尾的图像分布。

一句话总结:

SAM 的核心是“让标注可 scaling”;DINO 的核心是“让无标注图像的有效信息可 scaling”。


1. 总览:两类视觉数据引擎

1.1 SAM-style data engine:生成结构化标注

SAM、SAM2、SAM3D 的共同逻辑是:先定义一个可提示、可交互、可验证的任务接口,然后让模型参与数据生产。

1.1 SAM-style data engine:生成结构化标注
1.1 SAM-style data engine:生成结构化标注

在 SAM 系列中,数据不是被动收集的,而是被“制造”出来的:

  • SAM 制造 image masks;

  • SAM2 制造 video masklets;

  • SAM3D 制造 image-grounded 3D shape / texture / pose / layout supervision;

  • SAM3D Body 制造 human mesh recovery supervision。

这里的关键不是“标注员画得更快”这么简单,而是 把人类角色从逐像素生产者转变为纠错者、验证者、排序者、偏好提供者。这使得标注成本从“人类直接创作结构化标签”变成“模型生成候选,人类选择/校正/过滤”。

1.2 DINO-style curation engine:选择有效无标注数据

DINOv2、DINOv3 的目标不是创建显式标签,而是提高自监督预训练数据的有效性。

1.2 DINO-style curation engine:选择有效无标注数据
1.2 DINO-style curation engine:选择有效无标注数据

DINO 系列的核心判断是:

自监督不是“任何无标注图像都行”。如果 raw data 充满重复、低质量、分布偏置或长尾缺失,模型会浪费容量在冗余模式上;curation 的作用是让每个 batch 的视觉信息密度更高。


2. SAM:从交互式分割到 SA-1B

2.1 目标:把 segmentation 变成 promptable foundation task

SAM 的贡献不是简单训练了一个更大的分割模型,而是同时定义了三件事:

  1. Promptable segmentation task:输入点、框、mask、文本等 prompt,输出一个合法 mask。

  2. SAM 模型:图像编码器 + prompt 编码器 + 轻量 mask decoder,支持交互式预测。

  3. SA-1B data engine:通过模型参与标注,构建大规模 mask 数据集。

SAM 论文明确指出,SA-1B 包含 11M licensed and privacy-preserving images1.1B masks;这些 masks 通过 data engine 收集,其中最终发布的 SA-1B 只包含自动生成的 masks。1

2.2 三阶段 data engine

SAM 的 data engine 有三个阶段:assisted-manual、semi-automatic、fully automatic。其本质是逐步减少人类参与,同时逐步扩大 mask 覆盖。

2.2 三阶段 data engine
2.2 三阶段 data engine
阶段 人类角色 模型角色 数据价值
Assisted-manual 画/修 mask 交互式辅助 建立高质量初始数据
Semi-automatic 补充未覆盖对象 自动生成部分对象 masks 增加 diversity,减少 saliency bias
Fully automatic 主要做验证与质量评估 网格点自动生成 masks 扩展到 1B+ masks

2.3 质量控制:为什么自动 mask 可以用?

SAM 不是盲目相信自动标注。论文中对自动 mask 做了质量估计:随机采样 500 张图约 50K masks,让专业标注员修正;自动 mask 与修正 mask 的 IoU 中,94% 超过 90%,97% 超过 75%。2

这说明 SAM data engine 的核心设计并不是“自动标注就够了”,而是:

先通过人类辅助阶段把模型推到足够强,再让模型自动生成密集候选,最后用人类评估确认自动标注质量达到可训练阈值。

2.4 SAM curation 的核心思想

SAM 的 curation 不主要发生在“选哪些图片”,而发生在“同一张图里选择哪些 objects / parts / stuff 被 mask 化”。它在单张图内部增加监督密度。

SAM 背后的设计理念可以总结为:

  1. 把任务接口做成 promptable:prompt 既是推理接口,也是数据生产接口。

  2. 把模型部署到标注系统里:模型不是训练结束才用,而是从数据生产阶段就开始用。

  3. 从 saliency-driven 标注转向 grid-driven 覆盖:人工标注通常偏向显著前景物体;规则网格点可以覆盖背景、小物体、部件和 stuff。

  4. 接受语义开放性:SAM 不强迫类别标签,因此避开了 closed-vocabulary classification 的瓶颈。

  5. 用 ambiguity-aware 训练降低 prompt 不确定性:单点 prompt 可能对应局部、整体、遮挡对象;SAM 输出多个候选 mask 以处理歧义。


3. SAM2:从 image mask 到 video masklet

3.1 目标:把“任意图像分割”扩展到“任意视频分割”

SAM2 解决的是 promptable visual segmentation in images and videos。相比 SAM,视频数据有两个额外难点:

  • 每个对象不再是单帧 mask,而是跨时间的 masklet

  • 标注成本随帧数线性增长,且需要 temporal consistency。

SAM2 因此引入 streaming memory:模型记住目标对象在过去帧的空间特征和高层 object pointers,让用户用少量点击或 mask prompt 就能持续跟踪目标。3

3.2 SAM2 data engine 的三阶段

SAM2 的 data engine 同样是三阶段,但每一阶段针对的是视频标注成本。

3.2 SAM2 data engine 的三阶段
3.2 SAM2 data engine 的三阶段

SAM2 论文报告:

  • Phase 1:SAM per-frame,37.8 秒/帧,收集 16K masklets / 1.4K videos;

  • Phase 2:SAM + SAM2 Mask,7.4 秒/帧,收集 63.5K masklets;

  • Phase 3:full SAM2,4.5 秒/帧,收集 197K masklets;

  • SA-V 数据集包含 50.9K videos 和 642.6K masklets,其中包含 190.9K manual masklets 和 451.7K automatic masklets。4

3.3 SAM2 的 auto masklet:不只是扩大数量,也收集 failure cases

SAM2 自动 masklet 生成使用第一帧规则网格点 prompt 生成候选 masklets,然后进入验证流程:

  • satisfactory 的自动 masklet 加入 SA-V;

  • unsatisfactory 的 masklet 被当作 failure case,送回人工 + SAM2 交互流程 refinement。

这一步非常关键。它不是“过滤掉错误样本”而已,而是构建了一个 hard-example mining loop:

3.3 SAM2 的 auto masklet:不只是扩大数量,也收集 failure cases
3.3 SAM2 的 auto masklet:不只是扩大数量,也收集 failure cases

3.4 SAM2 curation 的设计理念

SAM2 的 curation 有三个层次:

  1. 时间一致性优先:masklet 不是独立 masks 的集合,而是同一对象跨帧的轨迹。数据质量标准从 “boundary quality” 扩展到 “tracking consistency”。

  2. 用 memory 降低人工编辑频率:SAM 是单帧工具;SAM2 的 memory 让用户不必逐帧从零开始。

  3. 自动生成覆盖非显著对象:人类倾向标注中心显著对象;grid prompt 可以挖出背景、小目标、边缘区域对象。

SAM2 最有启发的一点是:

当任务从 image 扩展到 video,data engine 的核心瓶颈从“画 mask”变成了“维护 object identity over time”。模型结构中的 memory 不是单纯为推理设计的,也是为数据生产设计的。


4. SAM3D:从 2D promptable perception 到 grounded 3D reconstruction

4.1 命名说明:SAM3D Objects 与 SAM3D Body

Meta 在 2025 年发布的 SAM 3D 包含两个方向:

  • SAM 3D Objects:从单张自然图像中重建 object / scene 的 3D shape、texture、layout;

  • SAM 3D Body:从单张图像中恢复人体 pose 和 shape,基于 Momentum Human Rig,支持 keypoints 和 masks 作为辅助 prompt。5

本报告主要讨论 SAM 3D Objects 的 data engine,因为它与 SAM/SAM2 的“标注飞轮”关系最直接;同时在 4.7 节补充 SAM 3D Body 的 curation 逻辑。

4.2 3D 的核心瓶颈:人类不能像画 mask 一样画 mesh

SAM3D 面对的不是 mask annotation,而是更难的数据问题:

给定一张自然图像和目标 mask,需要获得该物体的 3D shape、texture、rotation、translation、scale。

对于普通标注员来说,直接创建 3D mesh 几乎不可行;即使专业 3D artist,也需要很长时间。SAM3D 的核心洞察是:

大多数人不能从零创建 mesh,但可以在多个候选 mesh 中选出更像的,并给出质量评分。

于是 SAM3D 把数据生产形式从“人类创作 3D”转成“模型生成候选 + 人类 ranking / selection / verification”。论文将其描述为 human- and model-in-the-loop pipeline,用于标注 object shape、texture 和 pose。6

4.3 SAM3D 的多阶段训练:synthetic pretraining → real-world alignment

SAM3D 的训练路线更像 LLM/生成模型:

4.3 SAM3D 的多阶段训练:synthetic pretraining → real-world alignment
4.3 SAM3D 的多阶段训练:synthetic pretraining → real-world alignment

SAM3D 使用的关键数据包括:

  • Iso-3DO:孤立 3D asset 渲染,用于基础 shape/texture 能力;

  • RP-3DO:Render-Paste 数据,把 synthetic textured meshes 合成到自然图像中,生成有精确 3D ground truth 的图像;论文提到 RP-3DO 有 61M samples 和 2.8M unique meshes;7

  • MITL-3DO:model-in-the-loop 的真实图像 3D 标注;

  • Art-3DO:最难样本交给专业 3D artists,补齐模型 blind spots;

  • SA-3DAO:artist-created benchmark,用于 real-world 3D object reconstruction 评估。

4.4 SAM3D data engine 的三个核心 stage

4.4 SAM3D data engine 的三个核心 stage
4.4 SAM3D data engine 的三个核心 stage

论文描述的数据流程包括:

  1. Stage 1:Choosing target objects 从多样真实数据集中采样图像和对象 mask,并使用 3D-oriented taxonomy 平衡对象分布。

  2. Stage 2:Object model ranking and selection 模型 ensemble 生成多个 shape/texture 候选;标注员从 N 个候选中选择最匹配图像的候选并评分。论文明确把这称为 best-of-N search using humans。

  3. Stage 2.5:Hard example triage 对于模型完全无法生成合理 shape 的 hard cases,普通标注员不能修 mesh,因此路由给专业 3D artists,形成 Art-3DO。

  4. Stage 3:Aligning objects to 2.5D scene 标注员在 point cloud / point map 中调整 translation、rotation、scale,得到 camera-relative layout。

最终,SAM3D 标注了接近 1M images、约 3.14M untextured meshes 和约 100K textured meshes。8

4.5 SAM3D 的 curation 核心:从 label production 到 preference alignment

SAM3D 相比 SAM/SAM2 更接近 RLHF / preference learning:

  • 当前模型生成多个候选;

  • 人类选择最佳候选;

  • 高质量候选进入 SFT;

  • 低质量候选或未选候选作为 preference negative;

  • 使用 DPO 等方式对齐人类偏好;

  • 新模型产生更高质量候选,继续循环。

这可以抽象为:

4.5 SAM3D 的 curation 核心:从 label production 到 preference alignment
4.5 SAM3D 的 curation 核心:从 label production 到 preference alignment

SAM3D 论文也指出,这个 data engine 可以理解为一种 online alignment algorithm,与 RLHF、self-training、Expert Iteration 有相似性。9

4.6 SAM3D 对 CV scaling 的启发

SAM3D 最值得关注的是它没有假设真实 3D ground truth 可以直接 scale,而是设计了一个“可被普通人验证”的接口。

这背后的设计原则是:

当标签太难直接生产时,不要强迫人类生产标签;应让模型生成候选,让人类执行低成本的比较、选择、评分、修正。

这与 LLM 后训练中的偏好数据非常相似。3D 的 ground truth 很难从 web 获得,所以 SAM3D 用 synthetic pretraining 解决 cold start,用 real-world post-training 解决 sim-to-real,用 human preference 解决质量和审美对齐。

4.7 补充:SAM3D Body 的 curation

SAM3D Body 关注 single-image full-body human mesh recovery。它使用新的 MHR 表示,解耦 skeletal structure 和 surface shape;支持 2D keypoints、masks 等辅助 prompts。SAM3D Body 论文摘要描述其高质量标注来自多阶段 annotation pipeline,结合 manual keypoint annotation、differentiable optimization、multi-view geometry 和 dense keypoint detection;其 data engine 还会选择 unusual poses 和 rare imaging conditions,以提高数据多样性。10

Meta 官方介绍还提到 SAM3D Body 从大规模多样图像、multi-camera videos、专业合成数据出发,通过自动化 data engine 挖掘 high-value images,组装约 8M images 的高质量训练集。11

这说明 SAM3D Body 的 data engine 更强调:

  • rare pose / rare capture condition mining;

  • 多视角几何与优化生成高质量伪真值;

  • promptable human mesh recovery;

  • 人体表示 MHR 对下游稳定性的影响。


5. DINOv2:视觉自监督中的 data curation

5.1 目标:不用文本、不用人工标签,训练通用视觉特征

DINOv2 的目标是学习 robust visual features without supervision。它的核心不是“无脑吃 1B+ web images”,而是构建一个 curated image dataset:LVD-142M

DINOv2 论文明确说,LVD-142M 是从 uncurated large pool 中检索与多个 curated datasets 接近的图像构成;该流程不需要 metadata 或 text,直接作用于图像。12

5.2 DINOv2 curation pipeline

5.2 DINOv2 curation pipeline
5.2 DINOv2 curation pipeline

DINOv2 的 curated seed datasets 包括 ImageNet-22k、ImageNet-1k train split、Google Landmarks 和一些 fine-grained datasets;raw web 数据经过 URL/domain 安全过滤、PCA hash 去重、NSFW 过滤、可识别人脸模糊,得到 1.2B unique images;随后进一步去除近重复和 benchmark test/val 近重复,避免泄漏。13

5.3 为什么不是直接随机采样 142M?

DINOv2 做了对比:同样训练 ViT-g/14、同样迭代数,比较 ImageNet-22k、uncurated random 142M、LVD-142M。结果显示 curated LVD-142M 在多数 benchmark 上优于 uncurated data,尤其在跨域任务上更强。论文明确总结:curated images 在 self-supervised pretraining 中也更有效。14

这说明:

自监督学习可以去掉人工标签,但不能去掉数据分布设计。没有标签不等于没有 supervision;自监督目标仍然会从数据分布中继承偏置和冗余。

5.4 DINOv2 的训练目标与 curation 的关系

DINOv2 使用 DINO image-level objective 与 iBOT patch-level objective 的组合,并加上 Sinkhorn-Knopp centering、KoLeo regularizer、高分辨率短训等组件。15

关键点是:

  • image-level objective 让 CLS / global representation 有语义一致性;

  • patch-level iBOT objective 让 dense features 更有局部结构;

  • curated data 让这些 objective 面对多样但不过度噪声的视觉概念。

如果数据没有被 curate,patch-level objective 可能大量学习重复纹理、模板、低质量图像;如果只用 ImageNet-like 数据,模型可能泛化到长尾、场景、细粒度、非自然图像任务时不足。

5.5 DINOv2 的 curation 设计理念

DINOv2 的核心理念可以概括为:

用少量 curated seed datasets 定义“视觉质量和语义覆盖的参考空间”,再用 embedding retrieval 从 web-scale raw pool 中扩展这个空间。

它不是按文本匹配,也不是按类别标签采样,而是按视觉相似性扩展。可以把它理解成:

5.5 DINOv2 的 curation 设计理念
5.5 DINOv2 的 curation 设计理念

这种方法的优点:

  • 不依赖 caption,因此避免 web caption 噪声;

  • 不依赖人工类别标签,因此适合 self-supervised backbone;

  • 可以从 curated benchmark/domain seed 出发扩大覆盖;

  • 可控制 test leakage 和 near-duplicate contamination;

  • 比随机 raw crawl 更有效。

局限也很明显:

  • seed dataset 决定了 retrieval 的覆盖边界;

  • visual similarity 可能放大 seed bias;

  • 检索到的图像可能语义相似但任务难度不够;

  • DINOv2 的 LVD-142M 仍比真正开放 web 分布窄。


6. DINOv3:从 retrieval curation 到 billion-scale balanced visual concepts

6.1 目标:把 DINOv2 的 SSL foundation model scale 到更大数据、更大模型、更强 dense features

DINOv3 是 DINO 系列更明确的 scaling 版本。论文称其通过 careful data preparation、design、optimization,同时 scale dataset 和 model;核心新问题是:长训练会提升 global metrics,但 dense features 会退化,因此需要 Gram anchoring 来保持 patch-level consistency。16

DINOv3 teacher 规模从 DINOv2 的 1.1B ViT-giant 提升到约 6.7B ViT-7B,并发布一系列蒸馏后的 ViT/ConvNeXt 模型。17

6.2 DINOv3 的数据构造:17B raw pool → LVD-1689M + retrieval + public datasets

DINOv3 的预训练数据从 Instagram public posts 的约 17B web images raw pool 出发;这些图像先经过平台级内容审核。随后构造三个数据部分:

  1. hierarchical k-means + balanced sampling 使用 DINOv2 embeddings,对 raw pool 做 5 层层次聚类,cluster 数从低到高为 200M、8M、800K、100K、25K;再用 balanced sampling 得到 LVD-1689M,目标是平衡覆盖 web 上的视觉概念。

  2. retrieval-based curation 类似 DINOv2,从 selected seed datasets 检索相似图像,使数据覆盖 downstream-relevant visual concepts。

  3. raw public CV datasets 包括 ImageNet1k、ImageNet22k、Mapillary Street-level Sequences 等,用于优化模型性能。

训练时,DINOv3 使用 sampler 混合这些数据部分;论文中特别提到 10% training iterations 使用 ImageNet1k homogeneous batches,其余使用混合数据。18

6.2 DINOv3 的数据构造:17B raw pool → LVD-1689M + retrieval + public datasets
6.2 DINOv3 的数据构造:17B raw pool → LVD-1689M + retrieval + public datasets

6.3 为什么 DINOv3 不只用 retrieval?

DINOv3 论文比较了 raw、clustering、retrieval、full LVD-1689M mixture:没有单一 curation 技术在所有 benchmark 上最好;clustering 更利于多样和平衡,retrieval 更利于常见下游任务,full pipeline 获得“best of both worlds”。19

可以理解为:

方法 优势 风险
Raw sampling 覆盖广,成本低 冗余、噪声、分布不平衡
Retrieval 与 benchmark / seed 相关性强 可能过拟合 seed 分布,覆盖受限
Clustering + balanced sampling 长尾覆盖更均衡 未必最贴合具体 downstream
Mixture 兼顾覆盖与实用性 需要 sampler 和比例设计

6.4 DINOv3 的关键新问题:dense features 在长训练中退化

DINOv3 发现,大规模 SSL 长训练时 global classification 表现会持续提升,但 dense prediction 表现可能下降。论文分析认为,训练后期 patch-level consistency 变差:patch features 的局部相似性变得噪声化,CLS 与 patch token 过度相似,局部性减弱。20

这对 CV foundation model 非常关键:

LLM scaling 通常更关心 token-level loss;CV foundation model 同时需要 global representation 和 dense representation。更长训练不一定同时改善二者。

6.5 Gram anchoring:让 scaling 不牺牲 dense representation

DINOv3 引入 Gram anchoring,用较早 checkpoint 或高分辨率 teacher 的 patch correlation structure 约束后续模型,防止 dense feature map 变得不稳定。论文中的 ablation 显示,使用高分辨率 Gram teacher 可以显著提升 ADE20k mIoU,并改善 depth RMSE。21

6.5 Gram anchoring:让 scaling 不牺牲 dense representation
6.5 Gram anchoring:让 scaling 不牺牲 dense representation

6.6 DINOv3 curation 的设计理念

DINOv3 的核心不是单纯把 DINOv2 的 142M 扩到 1.7B,而是三件事一起做:

  1. 用 embedding-space clustering 做概念平衡:避免 raw data 中热门视觉概念支配训练。

  2. 用 retrieval 保持 downstream usefulness:不要只追求分布均匀,也要贴近实际任务。

  3. 用 objective/optimization 保持 dense feature quality:数据 scaling 如果导致 dense 表征退化,必须用训练目标修正。

DINOv3 的深层启示是:

对 CV backbone 来说,curation 不是训练前的一次性过滤,而是和模型结构、loss、sampler、训练时长、分辨率策略共同组成 scaling recipe。


7. 横向比较:SAM 系列 vs DINO 系列

维度 SAM SAM2 SAM3D Objects DINOv2 DINOv3
数据目标 image masks video masklets 3D shape/texture/layout curated unlabeled images billion-scale balanced unlabeled images
是否生成标签
人类角色 交互标注、修正、质量评估 refinement clicks、masklet verification ranking、selection、pose alignment、hard cases artist 无直接标注;seed datasets 间接定义视觉空间 无直接标注;通过 clustering/retrieval/sampler 定义分布
模型角色 辅助/自动生成 masks 跟踪、传播、自动 masklets 生成候选 mesh、产生偏好样本 生成 embeddings、SSL training DINOv2 embedding for curation、7B SSL teacher
curation 单位 object / part / stuff mask object trajectory / masklet object mesh + pose + texture image image cluster / visual concept
质量门控 human ratings, IoU vs corrected masks satisfactory/unsatisfactory verification quality threshold, best-of-N, artist data dedup, NSFW, leakage removal, retrieval quality cluster balance, retrieval relevance, mixture sampler
主要瓶颈 dense mask 标注成本 temporal consistency 标注成本 3D ground truth 极稀缺 raw web image 冗余/偏置 billion-scale balance + dense feature stability
核心飞轮 SAM 标注更多 mask → SAM 更强 SAM2 标注更多 masklets → memory/tracking 更强 model candidates + human preference → real-world 3D alignment curated data → better SSL features larger curated data + Gram anchoring → global+dense features

8. Curation 背后的核心思想

8.1 有效数据量不是 raw data size

可以用一个粗略公式理解:

DeffectiveDraw×diversity×semantic density×label richness×task alignment×qualityredundancy×noise×leakage

SAM 系列提升的是 label richness 和 task alignment;DINO 系列提升的是 diversity、quality、低 redundancy 和 distribution balance。

8.2 Data engine 的本质是降低下一个有效样本的边际成本

SAM/SAM2/SAM3D 的每一代 data engine 都在降低“新增一个高质量结构化样本”的成本:

  • SAM:从人工画 mask → SAM 辅助 → SAM 自动 grid mask;

  • SAM2:从逐帧 mask → 首帧 prompt + temporal propagation;

  • SAM3D:从人工建 mesh → 模型候选 + 人类 ranking + artist hard cases。

这说明 data engine 设计中最重要的问题不是“如何标更多数据”,而是:

如何改变人类参与形式,使人类只做模型最难自动化、但人类很擅长的判断。

8.3 Curation 是 embedding 空间里的分布工程

DINOv2/v3 的 curation 说明,CV 数据分布不是靠文件数量描述的,而应该在 representation space 中描述:

  • 哪些 visual concepts 被过度采样?

  • 哪些长尾概念缺失?

  • 哪些样本只是近重复?

  • 哪些图像与 benchmark/test 重合?

  • 哪些 seed domains 被放大,哪些 domain 被忽略?

因此,DINO-style curation 可以看作“视觉 embedding 空间中的数据工程”。

8.4 Promptability 是 data engine 的接口设计

SAM 系列的 prompt 不只是 inference interface,也是 annotation interface:

  • 点/框/mask prompt 让人类可以低成本指定目标;

  • ambiguity-aware multi-mask 输出允许模型在不确定时保持多个合法解释;

  • video memory 让 prompt 从单帧扩展为 object identity;

  • 3D masks/keypoints/pointmaps 让 2D perception 接入 3D reconstruction。

因此 promptability 的本质是:

把复杂视觉任务拆成“人类容易表达 intent、模型容易补全 structure”的交互协议。

8.5 Synthetic data 是 cold start,real-world alignment 是落地关键

SAM3D 尤其清楚地展示了这一点:

  • synthetic 3D assets 可以提供精确 shape/texture ground truth;

  • render-paste 可以提供 occlusion、scale、pose、mask-following 训练信号;

  • 真实图片中的遮挡、上下文、间接视角、材质不确定性仍然需要 post-training alignment;

  • human preference 用于补足无法由 synthetic supervision 覆盖的质量维度。

这是一种通用策略:

8.5 Synthetic data 是 cold start,real-world alignment 是落地关键
8.5 Synthetic data 是 cold start,real-world alignment 是落地关键

8.6 Global representation 和 dense representation 需要分别保护

DINOv3 的 Gram anchoring 暗示:CV scaling 不像 LLM 那样只优化一个序列建模目标就够。视觉 backbone 同时被用于:

  • global classification / retrieval;

  • segmentation;

  • depth;

  • correspondence;

  • tracking;

  • 3D / robotics。

如果训练目标和数据分布过度偏向 global semantics,patch-level dense structure 可能退化。因此,CV curation 和 training recipe 必须显式考虑 dense feature quality。


9. 如何借鉴这些 data engine 设计自己的 CV 数据飞轮?

下面是一个可复用的设计框架。

9.1 第一步:定义可 prompt / 可验证的任务接口

不要一开始就问“我要多少数据”,先问:

  • 人类如何低成本表达目标?点、框、mask、文本、keypoint、轨迹、crop?

  • 模型输出是否容易被人类验证?

  • 错误是否可以被局部修正?

  • 是否可以让模型输出多个候选,让人类选择?

如果输出是 mask、box、keypoint、caption、3D pose、mesh ranking,这些都可能形成 data engine。如果输出需要专家从零创作,则需要转成 ranking / verification / editing。

9.2 第二步:把人类劳动放在最高杠杆位置

标签难度 低杠杆人类劳动 高杠杆人类劳动
mask 人工逐像素画 点/框 prompt + 修正
video masklet 每帧从零画 首帧 prompt + 少量 refinement clicks
3D mesh 从零建模 候选 ranking + pose alignment
人体 3D 直接标 3D mesh keypoints + multi-view optimization + rare case selection
大规模无标注图 人工逐张筛 embedding clustering/retrieval + 抽样审计

9.3 第三步:建立质量门控和 hard case 回流

一个好的 data engine 不应该只是过滤错误,而应该把错误变成训练信号:

9.3 第三步:建立质量门控和 hard case 回流
9.3 第三步:建立质量门控和 hard case 回流

SAM2 的 unsatisfactory masklets 回流 refinement,SAM3D 的 hard cases 送给 artists,都是这个思想。

9.4 第四步:区分“覆盖型数据”和“能力型数据”

  • 覆盖型数据:用于让模型见到更多分布、更多长尾、更多场景。

  • 能力型数据:用于补足某种明确能力,例如遮挡、极小物体、罕见姿态、复杂材质、跨帧消失重现。

DINOv3 的 clustering 更偏覆盖型;retrieval 和 public CV datasets 更偏能力/benchmark-relevant;SAM3D 的 RP-3DO 和 Art-3DO 则分别服务于 occlusion/mask-following 与 hard real-world quality。

9.5 第五步:用独立评估集防止 data engine 自嗨

Model-in-the-loop 容易产生偏差:模型擅长生成的样本更容易通过验证,模型不擅长的样本可能被拒绝或低频出现。SAM2 用 Phase 1 高质量 per-frame 标注创建 val/test,SAM3D 创建 SA-3DAO artist benchmark,DINOv2 去除 benchmark val/test 近重复,都是为了避免评估被数据引擎污染。


10. 关键结论

  1. SAM 系列和 DINO 系列都是 CV scaling 的数据侧答案,但解决的问题不同。 SAM 解决 dense / temporal / 3D structured label scarcity;DINO 解决 unlabeled image pretraining 的分布质量和冗余问题。

  2. SAM 的 data engine 是“标注生产系统”。 它通过 promptability、model-in-the-loop、human verification、automatic generation,把昂贵的 dense annotation 变成可扩展流程。

  3. SAM2 的关键不是简单把 SAM 用到视频,而是让 temporal memory 进入数据生产。 视频标注的瓶颈是跨帧身份一致性;SAM2 用 memory 和 refinement clicks 把逐帧成本降下来。

  4. SAM3D 的关键是把 3D 标注转化为人类可做的 ranking / preference task。 它承认真实 3D ground truth 稀缺,并用 synthetic pretraining + real-world post-training + human preference alignment 打破数据瓶颈。

  5. DINOv2 证明自监督视觉模型仍然需要 curation。 没有标签不代表 raw data 可直接 scaling;去重、过滤、检索和 seed distribution 设计决定 effective data。

  6. DINOv3 把 curation 从 retrieval 扩展到 billion-scale balanced visual concept coverage。 它同时使用 clustering、retrieval、public high-quality datasets 和 sampler,把泛化覆盖与下游相关性结合起来。

  7. CV 的 data curation 必须考虑 dense features。 DINOv3 的 Gram anchoring 说明:大模型长训可能提升 global semantics,却伤害 patch-level locality;CV foundation model 需要同时保护 global 和 dense representations。

最终可以把这些工作统一成一句话:

CV scaling 的核心不是“堆更多图片”,而是设计一种机制,把 raw visual data 转换成更高密度、更低冗余、更强任务对齐、更可验证的有效数据。SAM 用模型生成结构化标注,DINO 用视觉表征筛选无标注数据;二者共同构成了视觉 foundation model 的数据工程范式。


11. 参考资料



  1. Kirillov et al., Segment Anything, arXiv:2304.02643. https://arxiv.org/abs/2304.02643 

  2. Segment Anything paper, SA-1B dataset and mask quality analysis. https://arxiv.org/html/2304.02643v1 

  3. Ravi et al., SAM 2: Segment Anything in Images and Videos, arXiv:2408.00714. https://arxiv.org/abs/2408.00714 

  4. SAM 2 paper, data engine phases and SA-V dataset. https://arxiv.org/html/2408.00714v2 

  5. Meta AI, Introducing SAM 3D: Powerful 3D Reconstruction for Physical World Images, 2025-11-19. https://ai.meta.com/blog/sam-3d/ 

  6. SAM 3D Team, SAM 3D: 3Dfy Anything in Images, arXiv:2511.16624. https://arxiv.org/abs/2511.16624 

  7. SAM 3D paper, Render-Paste / RP-3DO pipeline. https://arxiv.org/html/2511.16624v2 

  8. SAM 3D paper, post-training collection step and model-in-the-loop annotation. https://arxiv.org/html/2511.16624v2 

  9. SAM 3D paper, relationship to self-training / RLHF / Expert Iteration. https://arxiv.org/html/2511.16624v2 

  10. Yang et al., SAM 3D Body: Robust Full-Body Human Mesh Recovery, arXiv:2602.15989. https://arxiv.org/abs/2602.15989 

  11. Meta AI, Introducing SAM 3D: Powerful 3D Reconstruction for Physical World Images, 2025-11-19. https://ai.meta.com/blog/sam-3d/ 

  12. Oquab et al., DINOv2: Learning Robust Visual Features without Supervision, arXiv:2304.07193. https://arxiv.org/abs/2304.07193 

  13. DINOv2 paper, data processing pipeline for LVD-142M. https://arxiv.org/html/2304.07193v2 

  14. DINOv2 paper, pretraining data source ablation. https://arxiv.org/html/2304.07193v2 

  15. DINOv2 paper, DINO + iBOT + KoLeo + high-resolution adaptation training recipe. https://arxiv.org/html/2304.07193v2 

  16. Siméoni et al., DINOv3, arXiv:2508.10104. https://arxiv.org/abs/2508.10104 

  17. DINOv3 paper, teacher architecture and distilled model family. https://arxiv.org/html/2508.10104v1 

  18. DINOv3 paper, data collection and curation section. https://arxiv.org/html/2508.10104v1 

  19. DINOv3 paper, training data ablation comparing raw, clustering, retrieval and full mix. https://arxiv.org/html/2508.10104v1 

  20. DINOv3 paper, Gram anchoring motivation and patch-level consistency analysis. https://arxiv.org/html/2508.10104v1 

  21. DINOv3 paper, high-resolution Gram anchoring ablation. https://arxiv.org/html/2508.10104v1 

← 返回全部文章