GroundedSAM 2 自动标注实战用文本提示生成检测框和分割 Mask这篇教程根据我复现 GroundedSAM 2 自动标注流程时整理重点演示如何用文本提示定位目标、生成 Mask、检查标注质量并导出标注数据。本文整理自我的学习和项目复现过程尽量按实操顺序保留 notebook 的关键步骤同时把数据集获取方式调整为适合中文教程发布的写法。本文会重点跑通以下流程安装 GroundedSAM 2 自动标注依赖准备待标注图片目录配置文本提示和类别映射单图预测并可视化检测框与 Mask批量生成标注数据如果你正在系统学习目标检测、实例分割、OCR、多目标跟踪或视觉大模型建议收藏本文配套 notebook、示例图片和运行环境说明后续会继续整理。如果环境配置卡住可以在评论区说明具体报错。 文章目录GroundedSAM 2 自动标注实战用文本提示生成检测框和分割 Mask⚙️ 安装依赖 准备图片目录 加载基础模型️ 配置文本提示️ 单图预测可视化 批量生成标注 导出说明 小结 同系列教程汇总⚙️ 安装依赖安装 GroundedSAM 2 自动标注所需依赖。!pip install githttps://github.com/autodistill/autodistill-grounded-sam-2rf_groundingdino-q 准备图片目录准备待自动标注的图片目录可以替换为自己的图片。# 准备待自动标注图片目录。可以将自己的 jpg/png 图片放到 containers 目录。IMAGE_DIRcontainersos.makedirs(IMAGE_DIR,exist_okTrue)print(image dir:,IMAGE_DIR) 加载基础模型导入 GroundedSAM2 作为自动标注基础模型。fromautodistill_grounded_sam_2importGroundedSAM2️ 配置文本提示定义 CaptionOntology指定 prompt 与类别名映射。fromautodistill.detectionimportCaptionOntologyfromautodistill.utilsimportplotimportnumpyasnpimportcv2importosimportrandomimportsupervisionassv# define an ontology to map class names to our Grounded SAM 2 prompt# the ontology dictionary has the format {caption: class}# where caption is the prompt sent to the base model, and class is the label that will# be saved for that caption in the generated annotations# then, load the modelbase_modelGroundedSAM2(ontologyCaptionOntology({shipping container:container}),modelGrounding DINO,grounding_dino_box_threshold0.25)️ 单图预测可视化随机选择一张图片查看检测框和分割 Mask。IMAGE_DIRcontainersIMAGE_PATHos.path.join(IMAGE_DIR,random.choice(os.listdir(IMAGE_DIR)))resultsbase_model.predict(IMAGE_PATH).with_nms()resultsresults[results.confidence0.3]imagecv2.imread(IMAGE_PATH)mask_annotatorsv.BoxAnnotator()annotated_imagemask_annotator.annotate(image.copy(),detectionsresults)sv.plot_image(imageannotated_image,size(8,8)) 批量生成标注对图片目录批量生成标注文件。base_model.label(IMAGE_DIR,extensionjpg) 导出说明自动标注完成后可以把本地标注目录接入自己的数据管理流程。# 自动标注结果会保存在本地目录可按需接入自己的数据管理流程。LABELED_DIRIMAGE_DIR_labeled/print(labeled dataset dir:,LABELED_DIR) 小结这篇教程完整整理了GroundedSAM 2 自动标注的核心复现流程。实际操作时建议先确认 GPU、依赖版本、数据集路径和模型权重路径再逐段运行 notebook。后续我会继续按源项目顺序整理同系列中的目标检测、实例分割、OCR、多目标跟踪和视觉大模型教程。 同系列教程汇总Google Gemini 3.5 Flash 零样本目标检测教程从提示词到可视化结果GLM-OCR 文档识别实战教程从验证码、公式到车牌 OCRRF-DETR ByteTrack 多目标跟踪实战教程从命令行到 Python 视频轨迹可视化SAM 3 图像分割实战教程文本、框和点提示的多种分割方式GroundedSAM 2 自动标注实战用文本提示生成检测框和分割 Mask