ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Meta 双响炮:SAM3 与 SAM 3D 同日发布,『分割一切』正式进入 3D 时代

Meta 双响炮:SAM3 与 SAM 3D 同日发布,『分割一切』正式进入 3D 时代 Meta 双响炮SAM3 与 SAM 3D 同日发布『分割一切』正式进入 3D 时代【免费下载链接】sam3项目地址: https://ai.gitcode.com/hf_mirrors/facebook/sam32023 年Meta 用一张 1100 万图像、11 亿掩码的巨型数据引擎把「Segment Anything」变成了 CV 社区的口号两年后这个口号开始从 2D 平面向 3D 空间迁移。2025 年 11 月Meta 同日放出两枚重磅第三代可提示分割基础模型SAM 3Segment Anything with Concepts以及把分割能力直接扩展到三维世界的SAM 3D。前者让「分割一切」从框一个物体进化到描述一个概念、找齐所有实例后者则让图像分割结果可以直接立起来成为 3D 表达——社区媒体用「效果逆天」来形容这次发布智源社区的标题则直接点明了行业情绪「『分割一切』正式进入 3D 时代」。本文结合社区公开情报与本仓库hf_mirrors/facebook/sam3的真实模型文件从时间线、技术架构、数据引擎到部署落地拆解这枚双响炮到底改变了什么。同日发布一次针对「分割」能力的重新定义先看时间线与产品定位。SAM 3 于 2025 年 11 月发布官方定位是图像与视频统一的、可提示分割基础模型unified foundation model for promptable segmentation in images and videos。与前辈 SAM 2 相比最本质的变化写在仓库 README.md 的第一段SAM 3 introduces the ability to exhaustively segment all instances of an open-vocabulary concept specified by a short text phrase or exemplars.即给定一句短文本如黄色校车或若干示例图像SAM 3 能把画面中所有匹配该概念的实例全部找出来并分割——这在官方术语里叫Promptable Concept SegmentationPCS可提示概念分割是一个全新任务范式。作为对照SAM/SAM 2 时代的视觉提示点、框、掩码一次只能锁定单个物体实例。而同日发布的 SAM 3D 则把这条能力线延伸到空间维度。根据智源社区等媒体的报道其核心看点是图像分割结果可以直接产出 3D 表达并且对遮挡区域具备复原能力。两枚产品一文一武SAM 3 负责把识别概念的能力做深SAM 3D 负责把分割结果的维度做宽。从「分割实例」到「理解概念」SAM 3 的技术内核社区里最热闹的讨论集中在 SAM 3 的 PCS 能力上——正如 CSDN 上一篇高阅读量文章所说SAM 3 的意义不止分割一切它开始理解世界了。这种理解体现在三层。架构检测器 跟踪器共用一个视觉主干从本仓库 config.json 可以直接读到 SAM 3 的完整配置model_type为sam3_video由detector_config与tracker_config两大部分组成。检测器Detector基于 DETR 的架构。detr_decoder_config中num_queries为 200use_presence_token为 true——这正是 SAM 3 论文中强调的存在性预测头presence head用一个全局学习令牌先判断目标概念是否出现在画面中把识别是什么与定位在哪里解耦从而避免两类目标互相冲突。Ultralytics 的消融数据显示加上存在性分支后 CGF1 从 57.6 提升到 63.3。文本编码器text_config直接复用 CLIP 的文本分支clip_text_model24 层 Transformer隐藏维度 1024词表 49408tokenizer 也在仓库中tokenizer_config.json 标明CLIPTokenizermax_length为 32。这意味着开放词汇能力来自 CLIP 对齐的语义空间。视觉主干vision_config中的sam3_vit_model是一个 32 层 ViT输入分辨率 1008×1008patch size 14在 7/15/23/31 层做全局注意力并带 3 级 FPN 特征金字塔num_feature_levels: 3。跟踪器Tracker继承 SAM 2 的 memory-based 视频分割体系memory_attention_*、mask_decoder_config、prompt_encoder_config一应俱全并显式开启enable_occlusion_spatial_embedding与enable_temporal_pos_encoding_for_object_pointers——这两项正是视频场景下处理遮挡、拥挤与跟踪丢失的关键机制配合hotstart_*系列启发式参数完成时间维度的消歧。数据SA-CO比现有基准多 50 倍的概念集PCS 能力不是凭空长出来的靠的是新的数据引擎。README 中给出了两个关键数字新的SA-CO benchmark包含270K 个独特概念是现有基准如 LVIS 约 4K 概念的50 倍以上SAM 3 在该基准上达到人类表现的 75%–80%Ultralytics 文档进一步给出达人类标注下界的 88%。训练侧SA-CO 由 520 万张人工标注图像SA-Co/HQ、14 亿个 AI 合成掩码SA-Co/SYN与 5.25 万段视频SA-Co/VIDEO构成AI 标注器基于 Llama 提出名词短语、多模态 LLM 做质量验证、主动挖掘把人力集中在失败案例上——这套人机协同数据引擎把标注吞吐量提升了约 2 倍。性能30ms 处理 100 个检测对象社区情报中反复出现的一个数字是30 毫秒处理 100 个检测对象性能提升 2 倍。这与 Ultralytics 公布的基准一致在 H200 GPU 上SAM 3 单张图像推理约 30ms 即可检出 100 物体LVIS 零样本掩码 AP 达 47.0此前最佳 38.5提升约 22%视频侧 MOSEv2 基准 JF 60.1比 SAM 2.1 高 25.5%。这也是为什么 CSDN 教程社区能在发布后不到一个月内就涌现大量文本提示分割实战文章——零样本、开放词汇、多实例这三个点对工程落地太有吸引力了。仓库实证一个 3.4GB 的统一模型本仓库即 SAM 3 的 Hugging Face 镜像其文件结构本身就能说明问题config.json 声明的唯一架构是Sam3VideoModel——图像、视频、PCS、PVS 全部收敛进一个模型model.safetensors 的 LFS 指针显示权重约 3.44GB对应约 4.7 亿参数Ultralytics 标注为 3.45GB / 473.6M远大于 SAM 2 base 的 162MBprocessor_config.json 同时包含Sam3ImageProcessorFast图像 1008×1008、掩码 288×288与Sam2VideoVideoProcessor视频采样印证图像视频统一的定位configuration.json 标注任务为mask-generation框架 PyTorch。用 Transformers 跑一次文本提示分割官方在 README.md 里给出的路径非常干净from transformers import Sam3Processor, Sam3Model import torch from PIL import Image import requests model Sam3Model.from_pretrained(facebook/sam3).to(cuda) processor Sam3Processor.from_pretrained(facebook/sam3) image Image.open(requests.get(http://images.cocodataset.org/val2017/000000077595.jpg, streamTrue).raw).convert(RGB) # 文本提示ear —— 分割图中所有耳朵实例 inputs processor(imagesimage, textear, return_tensorspt).to(cuda) with torch.no_grad(): outputs model(**inputs) results processor.post_process_instance_segmentation( outputs, threshold0.5, mask_threshold0.5, target_sizesinputs.get(original_sizes).tolist() )[0] print(fFound {len(results[masks])} objects)注意最后一行不再是一个掩码而是Found N objects——一段文本提示会返回所有匹配实例的掩码、边界框与置信度。README 还演示了正/负框示例、文本负框组合、批量混合提示等交互式细化玩法这正是示例提示比视觉提示收敛快得多的工程基础Ultralytics 数据显示仅文本 46.4 CGF1加 3 个示例即到 65.0。图像分割结果直出 3D有遮挡也能复原回到标题中的另一半——SAM 3D。智源社区的报道标题用了两个关键词图像分割结果直出3D与有遮挡也能复原。翻译成技术语言直出 3D传统 3D 重建流水线通常需要先分割、再立体匹配/重建的两段式处理且 2D 分割误差会逐级传导。SAM 3D 的思路是把分割与 3D 表达统一在一个模型里让这张图里有什么和它在空间里长什么样共享同一套表征图像分割结果直接成为 3D 输出的中间表示。遮挡复原这是 3D 理解最难啃的骨头之一——现实场景中物体互相遮挡单视角信息天然缺失。社区报道所称的有遮挡也能复原意味着模型不再满足于只分割可见部分而是能基于对概念的语义理解推断被遮挡区域的几何这与 SAM 3 的概念理解能力一脉相承只有当模型知道这是一把椅子它才可能补全被桌子挡住的椅腿。需要说明的是SAM 3D 目前更多以研究性成果与演示形态出现其公开资料详于效果展示、略于完整技术细节但把它与 SAM 3 放在同一天发布Meta 的意图相当明确——2D 的概念分割与 3D 的空间理解正在被拼进同一块感知底座。3D 时代对机器人、XR 场景的想象力社区对这次发布的高频讨论场景集中在两个方向。机器人机器人的操作闭环里抓取、避障、位姿估计都依赖准确知道物体边界及其空间位置。过去一个常见的工程痛苦是2D 分割模型质量很高但拿到三维空间还要再走一遍点云配准、深度估计、占用栅格等手工管线且遮挡场景下 2D 掩码本身就不可靠。SAM 3 把用一句话圈定所有实例变成零样本能力SAM 3D 又承诺直出 3D、遮挡可复原意味着机器人的看见环节可能从分割重建的流水线收缩为一句话 一个模型。这对仓储分拣、家庭服务、自动驾驶的视觉栈都是结构性变化。XR扩展现实空间计算最缺的从来不是算力而是理解房间的能力。Meta 自家 Ray-Ban 智能眼镜和 Quest 生态本质上都是为物理世界建立可交互副本。SAM 3D 让开发者可以用自然语言在真实场景里圈出物体并拿到其 3D 形态AR 叠加、场景编辑、虚拟道具锚定这些玩法将大幅降低对标注数据和手工建模的依赖。智源社区报道中将此形容为分割一切的 3D 时代很大程度上正是因为 XR 是这条能力最直接、最性感的落地场景。落地与冷思考3.4GB 的模型不是所有场景都扛得住热度之下社区的技术文章也在密集讨论工程侧的代价。梳理 CSDN 上的部署实战内容可以得到一份清醒的清单体积与速度SAM 3 权重约 3.4GB、473.6M 参数端到端推理Ultralytics 实测约 2921ms/图相比 YOLO 系分割模型是数量级的差距。30ms 的亮眼数字来自 H200 高端卡 检测器路径不代表普通边缘设备体验。优化三板斧社区文章反复出现 ONNX 导出、FP16/8bit 量化、TensorRT 加速、批处理与图像嵌入缓存——这些是把它压进生产环境的常规手段也有 C# 开发者用 OnnxRuntime 完成 C# 侧部署说明生态接入已经走到 .NET 栈。中文提示与词汇边界SAM 3 的开放词汇对齐的是 CLIP 语义空间社区教程普遍提示英文 Prompt 效果更稳且模型擅长简单名词短语复杂指代与组合推理如离镜头最近、没戴项圈的狗需要外挂多模态大模型做 SAM 3 Agent 才能完成。与 SAM 2 的关系SAM 3 完整保留了点/框/掩码视觉提示能力接口与 SAM 2 兼容可作为 SAM 2 工作流的 drop-in 升级——这也是官方 README 中明确承诺的兼容策略降低了存量项目的迁移成本。从 2023 年的分割一切到 2025 年底的理解概念 直出 3DSAM 系列完成了一次范式跃迁。SAM 3 与 SAM 3D 的同日发布与其说是两篇新论文不如说是 Meta 对外宣布的一条产品路线分割不再是 2D 平面的终点而是通往 3D 空间理解与具身智能的起点。对开发者而言仓库里那份 3.4GB 的权重文件就是这张路线图的入口——剩下的问题只有一个你的场景扛不扛得住这份算力账单。【免费下载链接】sam3项目地址: https://ai.gitcode.com/hf_mirrors/facebook/sam3创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进