尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

目标检测算法(R-CNN,SSD,YOLO)

目标检测算法(R-CNN,SSD,YOLO) 目标检测中的常用算法R-CNNSSDYOLO区域卷积神经网络R-CNN首个将卷积神经网络用于目标检测的两阶段经典算法核心思路先提取候选目标区域再对每个区域提取特征分别完成分类 边框微调。大致步骤1生成候选提议区域Region Proposal采用选择性搜索算法对整张图像基于颜色、纹理相似度聚合像素块生成约 2000 个不同尺度、长宽的候选框给每个候选框标注物体类别标签、真实边界框坐标。2 CNN 抽取候选区域特征取用在 ImageNet 上预训练好的 CNN 网络去掉最终分类输出层将每一个候选框裁剪、拉伸缩放至 CNN 固定输入尺寸逐个前向传播提取一维特征向量。3SVM 分类器完成类别判定以候选区域特征 类别标签作为训练样本为每一类物体单独训练一个二分类 SVM逐个判断候选框属于某类物体还是背景。4线性回归微调边界框利用候选区域特征 真实边框坐标训练线性回归模型输入候选框特征输出坐标偏移量修正粗糙的候选框让边框紧密贴合物体轮廓。问题速度极慢难以落地使用一张图片会生成上千个候选区域每个候选框都要单独走一遍 CNN 前向传播卷积计算存在大量重复卷积运算计算开销巨大兴趣区域RoI池化层将输入区域均匀切分为预先设定好的 n×m 个子网格对每一个小网格执行最大池化取出网格内最大值作为输出Fast R-CNN核心改进整张图片只卷积一次 RoI 池化统一特征尺寸 单损失端到端联合训练大致步骤1整图全局卷积提取共享特征2选择性搜索生成候选框 RoI 池化规整特征RoI Pooling池化作用解决候选框尺寸不一无法接入固定维度全连接层的问题。3全连接层维度变换规整后的特征送入全连接层把特征维度统一4双头分支同步预测分类 边框回归两次取整操作1.原图候选框坐标映射到特征图后浮点坐标强制取整数2.把框均分网格时边界坐标再次取整。Faster R-CNN唯一核心改动用 RPN 区域提议网络完全替换掉 Fast R-CNN 里 CPU 运行的选择性搜索区域提议网络步骤1卷积提取逐点特征2锚框生成铺满整张特征图作为候选基准框。3双分支预测每个锚框输出两类结果 依托像素特征并行预测二元分类判断锚框内是前景目标还是背景边框偏移回归预测锚框坐标修正量把粗糙锚框微调至贴合物体轮廓。NMS 非极大值抑制筛选候选框通过非极大值抑制剔除高度重叠的边框Mask R-CNN在目标检测基础上新增实例分割能力不仅能输出物体类别、包围盒还可以预测每个目标精准的像素轮廓像素级掩码两大核心改动1RoI Pooling → RoI Align兴趣区域对齐层原RoI池化缺陷坐标取整量化误差会丢失精细空间像素信息不适合像素级分割任务RoI Align 改进取消整数向下取整操作采用双线性插值计算浮点坐标位置的像素值精准保留特征图空间细节让截取的特征区域和原图位置严格对齐是像素掩码预测的关键前提。2掩码头全卷积网络 FCN 对每个候选区域用全卷积网络输出二值掩码勾勒物体内部像素轮廓实现实例分割。单发多框检测SSD生成锚框Anchor Box同上一章生成锚框的方法以每个像素为中心生成nm-1个框直接在特征图上一步预测不会生成候选区域只基于锚框做偏移修正与分类预测多尺度特征图检测最关键创新CNN 前向传播会输出多层大小不同的特征图浅层特征图尺寸大、分辨率高 → 适合检测小目标深层特征图尺寸小、感受野大 → 适合检测大目标在每段都生成锚框底部拟合小物体顶部拟合大物体对每个锚框预测类别和边缘框依旧是两个分支预测Category prediction 类别预测预测该锚框内属于各个物体类别含背景类的置信度Bounding box prediction 边界框预测预测锚框相对于真实物体框的 4 个坐标偏移量用来微调锚框位置与大小*损失一些精度换取更快的速度YOLOYou Only Look Once核心思想整张图片只经过一次 CNN 前向传播直接回归出目标边框位置 物体类别追求极致的速度物体中心点落入哪个网格就强制由该网格负责预测这个物体。每个网格输出预测内容每个格子会预测B 个边界框Bounding Box每个框包含 4 个坐标偏移 1 个置信度 score置信度含义框内存在物体的概率 * 预测框与真实框 IoUC 个类别概率该网格包含物体时属于每一类别的条件概率最终张量输出S * S *B*5 C后续处理把置信度 * 类别条件概率得到每个框各类别最终得分设定阈值过滤低分框NMS 非极大值抑制剔除重叠冗余边框输出最终检测结果
返回列表