一文搞懂 Sapiens2:10 亿张人像喂出的二代基座,强在哪?
上一代 Sapiens 用“3亿张人像 MAE 1K 分辨率”的做法把姿态、分割、深度、法线四个任务全部刷到榜首。2026 年 4 月Meta 同一个团队放出了 Sapiens2ICLR 2026参数从 2B 涨到 5B数据从 3 亿涨到 10 亿分辨率从 1K 涨到 4K任务从四个加到五个。但二代真正的升级不是这些数字而是预训练从“一条腿走路”变成了“两条腿”。预训练MAE 和对比学习为什么非得合体自监督预训练有两条路线各自带着一个与生俱来的毛病。MAE掩码重建把图遮住 75% 再重建回来逼模型保住像素级的细节——纹理、颜色、边缘这正是密集预测逐像素输出的口粮。但重建的本质是压缩特征只要够把图还原就行语义这一层像素目标根本管不着。所以 MAE 的特征做理解类任务还得依赖大量标注数据来强化。对比学习CLIP、DINO 一脉把同一张照片的不同增强版本在特征空间里对齐语义强、检索准。但它学语义的方式是教模型无视颜色变化、裁剪这些增强——为了对齐它会主动丢掉这些细节。问题在于肤色、发色、衣料颜色恰恰是人体任务最需要的细节丢不得。把两条路线拼起来的想法并不新鲜iBOT 最早把掩码和师生蒸馏合在一起DINOv2 拿它当主目标DINOv3 继续放大。但这些合体把两个目标都放在特征空间里——特征不再锚定在像素上配上激进的外观增强教师和学生会一起漂离真实画面表征漂移颜色这类密集预测的关键线索照样被磨掉。Sapiens2 换了一种分工重建目标把特征锚在像素空间对比目标只负责组织语义——细节有锚语义有序。Sapiens2 的做法是合体同一份编码器一头接 MAE 解码器重建被遮住的 75%保住细节一头接 [CLS] 输出头一个不对应图片任何区域、专门把全图信息汇总成语义指纹的小型网络与教师模型对齐两个视角的语义DINOv3 式的师生框架教师是学生权重的指数滑动平均、不训练。还有一个关键细节拿去做重建的视图一律不做颜色增强——不能让模型学着忘记颜色。落地训练也处处为合体服务每张照片裁出 2 个全局视角加 4 个局部视角75% 的掩码里混着大块遮挡和碎块遮挡——大块让重建更难也给对比留足上下文重建损失和对比损失按 1.0 比 0.4 的权重一起回传教师以 0.992 的系数跟着学生滑动更新。整个预训练跑了 50 万步其间每个检查点都冻结编码器测一遍下游任务最后取表现最好的那个。合体还带来两样意外收获不给任何监督模型的注意力图自动聚焦到人身上用 [CLS] 特征做最近邻检索找回来的都是姿态、场景真正相近的人——语义空间确实更像懂人了。数据从 3 亿到 10 亿漏斗怎么筛规模有一个前提数据要多样、均衡、高质量光堆量没用。网页图片里的人是什么样的大头自拍泛滥、正脸站姿扎堆、水印图重复图一堆——直接拿去预训练模型学到的多半是怎么识别自拍。一代的 Humans-300M 证明了对口数据的价值二代把这套筛选用在更大的池子上规模翻到三倍多从约 40 亿张网页图片里过一道多关卡漏斗。第一关是过滤五道工序各司其职人形检测先框出图里有没有人、人在哪头部姿态估计检查脸的朝向美学和真实感打分刷掉低画质和艺术加工图文字覆盖检测去掉糊满水印字幕的图CLIP 特征再做一遍内容筛查。过关之后还有一道硬门槛图里至少要有一个人物的检测框短边不低于 384 像素——比一代的 300 像素又抬高了一截人太小就学不到细节。图里可以有多个人不苛求单人照。第二关是去重。网页图片的重复率惊人同一张照片可能被转发、裁剪、调色无数次。两招配合感知哈希先做快筛——长得像的图哈希值也相近一眼揪出复制粘贴深度特征近邻剪枝再兜底——在特征空间里太像的图只留一张。第三关是平衡。就算滤干净了剩下的人像分布依然是偏的正脸多、站姿多、户外多。做法是先按视觉特征把图片聚类再在姿态、视角、遮挡、衣着、场景、光照几个维度上选择性采样——压低热门类别保住少见的长尾。采样的阈值和各类目的配额都靠小规模人工审核来校准。最终得到 Humans-1B约 10 亿张高质量人像覆盖不同年龄、族裔、背景和真实环境。值得强调的是约束条件只有一条图里至少有一个突出的人。除此之外预训练不用任何任务标签也不往模型里注入任何人体先验——一切靠数据自己说话。架构为 4K 和 5B 重新设计骨架模型共四档0.4B、0.8B、1B、5B。前三档在一代对应档位的基础上做架构改造5B 是全新的一档层数和特征维度一起加深加宽。模型参数量层数特征维度注意力头预训练算力FLOPsSapiens2-0.4B4.0 亿241024161.3 万亿Sapiens2-0.8B8.2 亿321280162.6 万亿Sapiens2-1B14.6 亿401536244.7 万亿Sapiens2-5B50.7 亿5624323215.7 万亿先算一笔账4096×3072 的 4K 输入切成 16×16 的 patch就是将近 5 万个 token而 1K 输入只有 3072 个 token。对 5 万个 token 直接做全局注意力算力是烧不起的解法是分层局部阶段前几层在每个窗口内做局部注意力先把纹理、边缘这些细节看清汇总每个窗口用 [CLS] 引导的池化压成 1 个汇总 token序列长度从 N 缩到 N/ω全局阶段后几层只对这些汇总 token 做全局注意力把长程关系拼回来。这个布局和 MAE 天然兼容被遮的 token 在局部阶段之后直接丢弃信息不会从遮住的区域泄漏出去——真值若漏进输入重建就白学了。换作卷积网络就没这么省事得专门设计“掩码卷积”来防漏。预训练的末尾还安排了一小段 2K 分辨率的掩码重建专门把亚像素级的细节磨锐且不耽误语义。解码器也跟着升级基础档的输出分辨率从 0.5K 提升至 1K4K 档直接解码到 2K——分割的边缘、法线的细纹都靠这个分辨率撑起来。最精细的两个任务分割和法线因此交给了专门的 1B-4K 型号它的分割成绩是 81.9 mIoU、法线是 6.98°都紧挨着最大的 5B 档。骨架的其余部分全面换新零件各有分工中段的注意力块换成分组查询注意力GQA提高吞吐首尾两段保持标准多头注意力QK-Norm 在注意力计算前先归一化 query 和 key稳住高分辨率下的长训练RMSNorm 取代 LayerNorm省参数前馈层换成门控的 SwiGLU解码器用 PixelShuffle 做亚像素还原。5B 档的预训练算力达到 15.7 万亿 FLOPs——此前最大的视觉骨干 ViT-22B 只在 224 分辨率上训练DINOv2 也只到 512Sapiens2 这一代不但算力登顶分辨率也一路推到了 4K。微调五个任务两个新面孔微调的方式和一代完全一样预训练骨干的权重直接复用接轻量任务头端到端一起微调。变的是监督的规模和任务清单——每个任务的标注量提到一代的约 10 倍每任务约 100 万条任务从四个变成五个姿态估计308 个关键点的骨架不变标注从纯棚拍升级为棚拍 10 万张野外照片混合野外泛化明显更好部位分割28 类扩到 29 类——新增眼镜这个类别野外标注 2 万张pointmap新取代一代的相对深度。不再只回答每个像素有多远而是直接回归每个像素在相机坐标系里的 3D 坐标XYZ另配一个尺度头解决绝对尺寸的歧义。输出可以直接转出新视角的 3D 视图——照片里的人被真正立了起来法线估计监督全部来自更精细的合成资产头发丝、眼部细节、面部皱纹解码器换成 PixelShuffle反照率新预测每个像素剥掉光照的本色这是重打光和数字人渲染的关键输入。全部用合成数据训练前馈网络一次出图比扩散类方法快得多。成绩单全面反超一代姿态1.1 万张野外测试图Sapiens2-5B 拿到 82.3 mAP比一代的最高分78.3再高 4 个点0.8B 一档就已经超过一代更大的模型分割5000 张野外测试图5B 拿到 82.5 mIoU比一代 2B 的 58.2 高出 24.3 个点。同门对比最狠Sapiens2-1B 的 81.7 对一代 1B 的 53.8高出 27.9 个点——靠的是野外监督和输出分辨率从 0.5K 提到 1KPointMap全面赢过 UniDepth、DUSt3R、VGGT、MoGe5B 的 L2 距离 0.167 对 MoGe 的 0.202法向量5B 的平均角度误差 6.73°比一代的 12.38° 低了 45.6%最小的 0.4B8.63°就已经赢过此前最强的 DAViD-L10.73°反照率5B 的 MAE 0.012、PSNR 32.6 dB。还有一个更本质的评测把预训练骨干冻结、只轻量微调任务头Dense ProbingSapiens2-5B 在五个任务上全部赢过 DINOv3-7B——一个参数比它多 16 亿的通用模型。联合预训练学到的东西确实比任何一条单路线都扎实。结尾从一代到二代骨架没变对口的数据、高分辨率、轻量微调。变了的是预训练的目标——一代只会重建二代学会重建 理解两条腿走路。数据从 3 亿到 10 亿、参数从 2B 到 5B 都只是放大器真正让四个老任务再进一步、让反照率这种新任务成为可能的是重建之外新加入的理解。延伸阅读Sapiens2——Sapiens2 论文Sapiens: Foundation for Human Vision Models——上一代 Sapiens 论文Masked Autoencoders Are Scalable Vision Learners——MAE 论文iBOT: Image BERT Pre-Training with Online Tokenizer——掩码与师生蒸馏的首次结合DINOv3——对比学习的师生框架