
1. 项目概述为什么我们需要一份SOTA模型“地图”在计算机视觉这个日新月异的领域每天都有新的论文、新的模型和新的代码库涌现。对于刚入行的研究者、准备面试的工程师甚至是像我这样在一线摸爬滚打了十多年的老手都常常会面临一个最朴素也最棘手的问题“现在这个任务到底哪个模型最好用”这个问题背后是对整个领域发展脉络和技术前沿的把握需求。你可能会在arXiv上看到一篇宣称SOTA的论文但它的代码可能还没开源或者复现条件极其苛刻你也可能听说某个模型在某个特定数据集上表现惊人但换到你的业务场景里效果却大打折扣。这就是我花时间整理这份涵盖197个经典SOTA模型清单的初衷。它不是一个简单的列表而是一张精心绘制的“技术地图”。这份地图试图回答几个核心问题从AlexNet点燃深度学习革命的火种至今图像分类、目标检测、图像生成等核心方向究竟走过了怎样的技术路径哪些模型是真正经得起时间考验的里程碑面对一个具体的任务我们该如何根据数据规模、计算资源、精度要求和实时性需求从这浩如烟海的选项中快速定位到最合适的几个候选模型这份整理正是为了将散落在无数论文、博客和GitHub仓库中的知识碎片串联成一个有逻辑、可检索、能指导实践的知识体系。2. 模型清单的架构逻辑与分类体系整理近两百个模型最忌讳的就是堆砌。如果只是把模型名字和论文链接罗列出来那和搜索引擎的结果没什么两样价值有限。我的整理遵循了一套清晰的架构逻辑确保每个模型都能在其应有的位置上被找到和理解。2.1 核心任务维度纵向的技术演进树首先我以计算机视觉的核心任务作为第一级分类。这是最直观的维度因为工程师拿到需求时第一反应往往是“我要做分类”还是“我要做检测”。图像分类这是计算机视觉的基石任务。清单从这里开始清晰地展示了从依赖手工特征的SVM时代到AlexNet、VGG、GoogLeNet开启的深度网络时代再到ResNet通过残差连接解决网络退化问题以及随后DenseNet、EfficientNet等模型在参数效率上的持续优化。这条线是理解所有视觉模型的基础因为分类网络往往是其他任务如检测、分割的骨干Backbone。目标检测这个方向的技术演进堪称波澜壮阔。清单将其进一步细分为两阶段检测器以R-CNN系列R-CNN, Fast R-CNN, Faster R-CNN为代表。其“先候选区域后分类回归”的思想影响深远。清单中会标注每个模型的创新点比如Faster R-CNN的RPN区域提议网络如何将检测流程真正端到端化。单阶段检测器以YOLO系列v1-v5, v8, v9等、SSD、RetinaNet为代表。它们摒弃了独立的候选区域生成步骤速度更快更适合实时场景。清单会特别对比不同版本YOLO在骨干网络、Neck结构如FPN、PANet、损失函数上的演进以及SSD的多尺度特征图检测思想。基于Transformer的检测器如DETR及其变体Deformable DETR, DINO。这是近年来的新范式用Transformer架构统一了检测中的特征提取和关系建模。清单会解释其如何用可学习的目标查询Object Queries替代了传统的锚框Anchor。图像分割包括语义分割FCN, U-Net, DeepLab系列、实例分割Mask R-CNN, YOLACT, SOLO和全景分割。清单会梳理从全卷积网络FCN上采样恢复分辨率到U-Net的编码器-解码器加跳跃连接成为医学图像分割标配再到DeepLab系列利用空洞卷积和ASPP模块扩大感受野的历程。图像生成这是AIGC浪潮的核心。清单涵盖了从GAN生成对抗网络家族的原始GAN、DCGAN、StyleGAN到扩散模型Diffusion Model家族的DDPM、Stable Diffusion、Imagen的完整脉络。重点在于理清GAN的“生成器-判别器”博弈框架以及扩散模型“加噪-去噪”的马尔可夫链原理。2.2 关键技术维度横向的创新点索引仅仅按任务分类还不够。很多模型的创新是跨任务的。因此第二个维度是提取贯穿多个模型的关键技术点形成横向索引。骨干网络架构这是模型的“发动机”。清单会标注哪些模型使用了ResNet、VGG、TransformerViT, Swin Transformer、ConvNeXt等骨干并说明其特点。例如Swin Transformer的滑动窗口机制如何让Transformer适应密集预测任务ConvNeXt又如何“现代化”卷积网络以媲美Transformer。注意力机制从SENet的通道注意力到Non-local Networks的空间注意力再到Transformer的自注意力Self-Attention和交叉注意力Cross-Attention。清单会指出哪些模型在哪一层集成了何种注意力例如CBAM卷积块注意力模块如何同时关注通道和空间维度。损失函数创新这是模型优化的“指挥棒”。例如目标检测中的Focal Loss如何解决正负样本极端不平衡的问题分割中的Dice Loss如何更好地处理类别不平衡生成任务中的对抗损失、感知损失等。训练技巧与优化策略如标签平滑Label Smoothing、知识蒸馏Knowledge Distillation、混合精度训练Mixed Precision Training、模型EMA指数移动平均等。清单会在相关模型处注明其采用的关键训练技巧。通过“任务纵轴”和“技术横轴”的交叉定位这份清单就能从一个简单的列表升级为一个立体化的知识网络。当你研究一个模型时不仅能知道它属于哪个任务还能立刻关联到它采用了哪些关键技术以及这些技术在其他模型中的应用情况。3. 核心方向深度解析从图像分类到目标检测清单的主体是模型但理解模型背后的思想演变更为重要。这里我挑两个最基础也是最活跃的方向——图像分类和目标检测深入聊聊它们的SOTA之路是怎么走过来的以及清单是如何呈现这种演进的。3.1 图像分类从“深”度竞赛到“效”率优先图像分类的SOTA之争最初是网络深度的竞赛。VGG用一堆3x3的小卷积堆出了19层证明了深度的重要性。但GoogLeNetInception v1带来了新思路宽度和并行。它的Inception模块在同一层使用不同尺寸的卷积核并行提取特征既增加了网络宽度又控制了计算量。清单中会详细拆解Inception模块的结构图并说明其1x1卷积的“降维”作用。真正的分水岭是ResNet。它提出的残差连接Shortcut Connection简单却革命性地解决了深度网络的梯度消失和退化问题让网络可以轻松做到上百层。在清单里ResNet不是一个孤立的点而是一个枢纽。我会标注出所有基于ResNet变体ResNet-50, ResNet-101, ResNeXt, ResNeSt作为骨干的后续模型并解释ResNeXt的“分组卷积基数Cardinality”概念如何进一步提升了性能。此后分类网络的竞赛焦点从“更深”转向了“更智能”和“更高效”。DenseNet通过密集连接实现了特征重用SENet引入了通道注意力机制让网络学会“关注”重要的特征通道而EfficientNet则通过复合缩放Compound Scaling统一缩放深度、宽度和分辨率在给定计算预算下找到了最优的模型结构。在清单的“图像分类”部分这些模型会按时间线和逻辑关系排列旁边附有其核心创新点的关键词和当时的经典数据集如ImageNet上的Top-1准确率让你一眼就能看出技术进步的轨迹。注意看分类模型榜单时一定要区分“干净数据”上的精度和“鲁棒性”精度。有些模型在ImageNet上刷到了很高的分数但可能对对抗样本或自然扰动非常敏感。在清单中我会对这类模型如通过大量数据增强或特殊训练策略获得的模型加以备注提醒你在追求精度的同时也要考虑模型的稳健性。3.2 目标检测两阶段、单阶段与Transformer的三国演义目标检测的演进故事更加精彩。清单会清晰地画出三条主线。两阶段检测器的精髓在于“精雕细琢”。R-CNN开创了用深度学习做检测的先河但速度慢得离谱因为它要对每个候选区域单独跑CNN。Fast R-CNN的重大改进是ROI Pooling它允许整张图只过一次CNN然后将候选区域映射到特征图上进行池化大大加速。清单会解释ROI Pooling的坐标映射和量化过程以及它可能带来的区域不匹配问题。Faster R-CNN的RPN区域提议网络则是将候选区域生成也网络化、端到端化了这是两阶段检测器的完全体。后续的Mask R-CNN用ROI Align双线性插值替代ROI Pooling解决了量化误差从而能做好像素级的实例分割。在清单中这些模型是一脉相承的我会用箭头和文字说明它们之间的改进关系。单阶段检测器的哲学是“天下武功唯快不破”。YOLO v1直接将检测框定为回归问题一张图只过一次网络就出结果速度极快但早期版本对小目标和密集目标检测不佳。SSD的创新在于多尺度特征图检测它在不同层级的特征图上设置默认框Default Box从而更好地检测不同尺度的目标。RetinaNet的贡献是提出了Focal Loss这个损失函数通过降低易分类样本的权重让模型在训练时更专注于难分的样本一举解决了单阶段检测器精度长期落后于两阶段检测器的问题。清单会对比YOLO系列各版本v3的Darknet-53骨干和FPNv4的CSPDarknet和PANetv5/v8的Focus模块和Anchor-Free设计的演进并附上在COCO数据集上的精度-速度曲线图让你能直观地根据业务需求是要求毫秒级响应还是极致精度进行选型。Transformer检测器试图“重写游戏规则”。DETR完全摒弃了锚框、非极大值抑制NMS这些手工设计的组件使用Transformer编码器-解码器架构和二分图匹配损失实现了真正的端到端检测。它的优势是设计简洁但训练收敛慢对小目标检测效果一般。后续的Deformable DETR引入了可变形注意力只关注参考点周围的一小部分关键采样点大大降低了计算量并加速了收敛。在清单中这类模型会被单独归类并重点解释其“目标查询”和“集合预测”的概念这与传统检测的思维范式有根本不同。4. 模型选择与落地实操指南有了这份清单最终目的是为了用起来。面对一个具体的项目如何从197个模型中做出选择这绝不是拍脑袋而是基于一系列约束条件的系统工程。4.1 四维评估框架精度、速度、资源与易用性我通常使用一个四维评估框架来做初筛精度Accuracy这是首要指标。清单中会标注每个模型在主流基准数据集如ImageNet for 分类 COCO for 检测/分割上的关键指标Top-1 Acc, mAP, mIoU。但要注意榜单精度不等于你的业务精度。一定要在自己的验证集上做快速测试。速度Speed包括推理速度FPS和训练速度。对于实时应用如视频监控、自动驾驶感知FPS是硬指标。清单会提供在标准硬件如NVIDIA V100, RTX 3090上的参考FPS。YOLO系列、SSD通常是速度优先的选择而两阶段检测器或大型Transformer模型则更偏向精度。资源消耗Resource计算资源模型参数量、FLOPs浮点运算数。这直接关系到你需要什么样的GPU以及推理成本。EfficientNet、MobileNet系列就是为低计算资源场景设计的。数据资源模型是否需要海量数据预训练有些大型Transformer模型如Swin Transformer在ImageNet-21K或更大数据集上预训练后效果才好如果你的数据很少可能不如一个在ImageNet-1K上预训练的ResNet-50做微调来得实在。易用性与生态Usability代码质量与文档模型是否有官方或社区维护良好的实现如PyTorch官方Model Zoo MMDetection, Detectron2清单会附上推荐的项目链接。部署友好度模型是否容易转换为ONNX、TensorRT、OpenVINO等格式进行部署结构是否规整如没有动态控制流社区活跃度遇到问题时是否容易找到解决方案YOLO、ResNet这类经典模型社区支持最好。4.2 实操流程从选型到微调假设你现在有一个工业零件缺陷检测的任务需要定位和分类缺陷。数据量中等几千张需要部署在边缘计算设备如Jetson Xavier NX上。需求分析这是一个小目标检测缺陷可能很小任务需要实时或准实时生产线速度硬件算力有限。清单初筛任务维度锁定“目标检测”。技术维度关注“小目标检测”优化技术如更密集的锚框设计、特征金字塔优化。结合四维框架优先考虑单阶段模型以保证速度在资源消耗上选择参数量适中的模型由于是边缘部署可以特别关注YOLOv5/v8的NCNN或Tengine部署版本或者专门为边缘优化的模型如NanoDet、YOLO-Fastest。候选模型举例YOLOv8n/sUltralytics官方维护生态极好部署工具链成熟。其Nano和Small版本参数量小速度极快且自带分类头适合你的“检测分类”任务。其PAN-FPN结构有利于多尺度特征融合对小目标友好。PP-PicoDet百度飞桨推出的超轻量级检测器专门为移动端和CPU设计在精度和速度的平衡上做得很好。TOOD这是一个在单阶段检测器上改进任务对齐性的模型通过设计任务对齐头来缓解分类和回归任务之间的冲突在标准数据集上表现优异但社区生态可能稍弱于YOLO。快速验证用你的数据分别对YOLOv8s和PP-PicoDet进行短期微调比如1-2个epoch。比较两者在你的验证集上的mAP和FPS在Jetson设备上实测。检查小目标的召回率是否达标。最终确定与深度优化假设YOLOv8s在速度和精度上更均衡。接下来进行完整训练并可以尝试一些针对性的优化数据层面针对小缺陷使用Mosaic、MixUp等增强时注意控制尺度避免小目标被过度稀释。模型层面可以尝试将YOLOv8的PAN-FPN中的上采样方式从最近邻插值改为双线性插值或转置卷积看是否能提升小目标特征融合质量。损失函数如果正样本缺陷非常少可以考虑引入Focal Loss的变种或者调整正负样本分配策略。5. 避坑经验与未来趋势观察整理了这么多模型也亲手复现和调优过其中不少我总结了一些容易踩的坑和值得关注的趋势。5.1 实操中的常见“坑点”“榜单模型”水土不服一个在COCO上mAP很高的检测模型直接用到你的遥感图像或医疗图像上效果可能很差。原因往往是领域差异物体尺度、长宽比、纹理与自然图像不同。解决方案一定要用自己领域的数据进行预训练或至少充分微调。可以考虑使用在类似领域如卫星图像上预训练过的模型作为起点。训练技巧的“隐形”影响很多论文里的SOTA结果依赖于一整套复杂的训练技巧如特殊的数据增强、优化器设置、学习率调度、模型EMA。如果你只复现了模型结构而忽略了这些技巧结果可能相差甚远。解决方案仔细阅读论文的“Implementation Details”部分和官方代码库的配置。清单中我会在关键模型处备注其依赖的重要训练技巧。部署时的“精度损失”在PyTorch训练时精度很好但转换为TensorRT或OpenVINO后精度下降。常见原因包括算子不支持如某些自定义的激活函数、动态尺寸处理不当、量化INT8带来的误差。解决方案选择部署友好的模型架构在转换前在PyTorch中使用与部署时相同的预处理和后处理代码进行验证进行量化感知训练QAT或使用精度更高的FP16模式。盲目追求最新模型看到一篇新出的论文效果炸裂就立刻想用到生产环境。这风险很高。新模型可能代码不稳定、社区支持少、存在未发现的缺陷。解决方案对于生产系统采用“领先一步”而非“领先十步”的策略。优先选择经过社区大量验证、有成熟工业部署案例的模型如YOLOv5/v8, ResNet, Swin Transformer。将新模型放在实验环境或非核心业务上进行充分评估。5.2 从清单看技术演进趋势观察这197个模型的发展脉络可以清晰地看到几个不可逆转的趋势Backbone的Transformer化ViT证明了纯Transformer在分类任务上的潜力Swin Transformer通过移位窗口使其适合密集预测。ConvNeXt则表明用Transformer的设计思想如大卷积核、更少的激活函数来“现代化”CNN也能取得极佳效果。未来CNN和Transformer的界限会越来越模糊混合架构如CoAtNet或将成为主流。视觉任务的“大一统”DETR展示了用同一套Transformer架构做检测、分割的潜力。Segment Anything Model (SAM) 更是朝着通用图像分割迈出了一大步。未来一个庞大的预训练模型通过提示Prompt适应各种下游任务可能是方向。这意味着模型清单可能会从“多个专用模型”向“少数几个基础模型适配器”演变。效率的极致追求在边缘计算和移动设备上部署模型的需求催生了模型压缩、剪枝、量化、神经架构搜索NAS技术的蓬勃发展。模型不仅要准还要小、要快。清单中EfficientNet、MobileNet、ShuffleNet等系列以及知识蒸馏如TinyBERT、动态推理如SkipNet等技术相关的模型其重要性会持续提升。从感知到生成与理解Stable Diffusion等文生图模型的爆发标志着视觉AI的重点正在从“看懂”向“创造”和“深层次理解”延伸。多模态大模型如图文理解、图文生成将成为新的SOTA竞技场。这份清单的未来版本必然需要大幅扩充生成式模型和多模态模型的部分。这份197个SOTA模型的清单是我试图为计算机视觉领域绘制的一张“活地图”。它记录了过去十年的辉煌足迹也试图为探索未来的方向提供一些坐标。技术迭代飞快今天SOTA明天可能就被超越。但理解这些模型背后的设计思想、权衡取舍和演进逻辑比记住任何一个具体的模型名称都更重要。这份清单的价值就在于它提供了一个系统化的视角帮助你在纷繁的技术浪潮中更快地定位、理解和选择最适合你手中那把“锤子”的“钉子”。