尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

InternImage-G(internimage_g_22kto1k_512)完全概览:唯一开源突破ImageNet Top-1 90%的3B视觉基础模型

InternImage-G(internimage_g_22kto1k_512)完全概览:唯一开源突破ImageNet Top-1 90%的3B视觉基础模型 InternImage-Ginternimage_g_22kto1k_512完全概览唯一开源突破ImageNet Top-1 90%的3B视觉基础模型【免费下载链接】internimage_g_22kto1k_512项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/internimage_g_22kto1k_512InternImage-G 是上海人工智能实验室与清华大学等机构联合研发的3B 参数视觉基础模型以 DCNv3 可变形卷积为核心算子在 ImageNet-1K 上取得90.1% Top-1 精度是目前唯一开源且突破 90%的图像分类模型也是全球规模最大的开源视觉基础模型。本文带你快速了解它的性能、架构与使用方法。一、为什么 InternImage-G 值得关注在 Vision Transformer 主导的视觉模型时代InternImage 走出了一条不同的路——它不用注意力机制而以第三代可变形卷积DCNv3作为核心算子让模型具备动态、高效的感受野天然适配分类、检测、分割等下游任务。核心优势说明 精度天花板ImageNet-1K Top-190.1%唯一开源超 90% 的模型仅公开数据训练 检测 SOTACOCO 目标检测 mAP65.5全球唯一突破 65 mAP 的模型 多基准第一在分类、检测、分割等16 个重要视觉基准上取得世界最佳️ 架构创新以 DCNv3 替代 Transformer 注意力实现自适应空间聚合 完全开源MIT 协议3B 参数权重完整放出二、性能一览3B 模型家族对比 InternImage 提供了从 30M 到 3B 的完整模型家族InternImage-G 是其中的旗舰本仓库模型模型预训练输入分辨率参数量ImageNet acc1FLOPsInternImage-TIN-1K224×22430M83.55GInternImage-BIN-1K224×22497M84.916GInternImage-LIN-22K384×384223M87.7108GInternImage-XLIN-22K384×384335M88.0163GInternImage-HJoint 427M → IN-22K640×6401.08B89.61478GInternImage-G⭐Joint 427M → IN-22K512×5123B90.12700G可以看到从 30M 到 3B精度随规模稳定提升3B 的 InternImage-G 是精度的终极选择。三、核心架构揭秘DCNv3 如何让 3B 模型如此强大InternImage-G 由 4 个阶段Stage组成每个阶段堆叠若干 InternImage 块核心算子为 DCNv3。其架构关键参数定义于config.json如下参数取值含义core_opDCNv3核心算子第三代可变形卷积depths[2, 2, 48, 4]各阶段块数第 3 阶段是计算核心channels512初始通道数逐级翻倍至 4096groups[16, 32, 64, 128]组卷积分组数dw_kernel_size5深度可分离卷积核大小H/G 专用use_clip_projectortrue启用 CLIP 投影头H/G 专用num_classes1000ImageNet-1K 分类头三个关键设计点DCNv3 可变形卷积传统卷积的采样位置是固定的DCNv3 让模型根据输入内容动态调整每个像素的采样位置从而获得灵活的感受野这是它能超越同规模 Transformer 的核心原因CLIP 投影头InternImage-H/G 在主干输出后增加了 CLIP 投影器将最后一阶段特征与第 3 阶段特征融合使特征表示更适合跨模态与下游微调实现见modeling_internimage.py中的forward_clip_projector双归一化策略采用 post-norm 局部 post-normlevel2_post_norm组合让 3B 规模的深层网络训练更稳定。 DCNv3 同时提供CUDA 加速版和纯 PyTorch 实现。若未安装 CUDA 算子模型会自动回退到 PyTorch 实现功能不受影响仅效率略有差异。四、快速上手3 步加载 InternImage-G 第 1 步获取模型文件git clone https://gitcode.com/hf_mirrors/OpenGVLab/internimage_g_22kto1k_512第 2 步安装 HuggingFace Transformers4.37.2 及以上版本第 3 步作为图像分类器加载from transformers import AutoModelForImageClassification, CLIPImageProcessor model_name internimage_g_22kto1k_512 # 本地模型目录 processor CLIPImageProcessor.from_pretrained(model_name) model AutoModelForImageClassification.from_pretrained(model_name, trust_remote_codeTrue) logits model(processor(imagesImage.open(cat.jpg), return_tensorspt).pixel_values).logits进阶用法去掉分类头作为**特征主干Backbone**使用通过AutoModel加载即可拿到 4 个阶段的特征图hidden_states接入你自己的检测、分割或聚类网络。性能提示⚡如需提升 GPU 推理效率、降低显存占用可参考README.md中的DCNv3 CUDA Kernel Installation章节编译 CUDA 算子模型会自动启用加速实现。五、仓库文件结构说明 文件作用config.json模型架构配置DCNv3 参数、各阶段深度与通道数等preprocessor_config.json图像预处理配置512×512 裁剪 ImageNet 均值/方差归一化configuration_internimage.pyInternImageConfig配置类定义全部架构超参数modeling_internimage.py模型完整实现DCNv3 卷积层、InternImage 块、CLIP 投影头与分类头dcnv3.py/dcnvv3_func.pydcnv3_func.pyDCNv3 的纯 PyTorch 实现无 CUDA 算子时的自动回退方案model-00001-of-00003.safetensors等 3 个分片3B 模型权重按分片存储model.safetensors.index.json权重分片索引用于按块加载README.md官方模型卡性能数据、安装与使用示例、引用信息六、适合谁使用追求极致分类精度的研究者90.1% Top-1 是公开数据训练的开源天花板目标检测 / 语义分割开发者以AutoModel加载作为 3B 级主干COCO 65.5 mAP 证明了它的骨干能力下游任务微调用户CLIP 投影头使其特征天然适合跨任务迁移算力充足的生产团队3B 参数 / 2700G FLOPs 属于重模型建议配合 GPU 与 CUDA 版 DCNv3 使用显存紧张时可从同家族的 L/XL 版本起步。七、总结InternImage-Ginternimage_g_22kto1k_512用DCNv3 可变形卷积证明了非 Transformer路线的可能性3B 参数、ImageNet Top-1 90.1%、COCO 65.5 mAP是目前唯一开源突破 90%的视觉基础模型。无论是做高精度分类还是作为大规模视觉任务的主干网络它都是当下开源世界最值得关注的选择。【免费下载链接】internimage_g_22kto1k_512项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/internimage_g_22kto1k_512创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表