1.加入BN层 卷积过后添加 舍弃Dropout 更加容易收敛 基本上都是卷积网络标配
好处就是 ①加快收敛 ②提高了2%map
2.训练时候不同
v1训练使用224224 测试使用448448
v2训练开始是224224 最后使用了10次448448的微调
提升 Map 4%
3.网络结构
没有全连接 都是卷积 (全连接层容易过拟合 , 训练慢参数多,
DarkNet-19
在这里插入图片描述
使用了5次降采样 例416416 输出 1313
网络主要使用了 33 和11 的 卷积核 主要使用了是 VGG的思想 计算量比较小 感受野大
使用11的卷积核 主要就是减少参数的作用,个人理解就是这块就是做数据传输的也没有提取特征的用处 如果33的话相对来说,数据量会比较大

4.聚类提取先验框
Faster Rcnn 中 先验框都是固定的三种格式 1:1 1:2 2:1的 按照不同的比例缩放。但是他不一定适合数据集

在V2中 使用k means 在数据集中做聚类
例如 聚类为5类 都是实际的真实框,每一堆都有中心点,可以用h.w来表示这个框。 把这些框用来做先验框,
k means 聚类中的距离表示 用欧式距离不太合适,因为有大的框和有小的框,产生的差异比较大。大的框误差大,小的框误差小。 d=1-Iou
iou的值越大距离也就越重合,中心距离就离得越近,距离也就越近。

5次是折中的值 论文也是这样

5.Anchor Box
详细解释
提升了recall召回率 查全率 7 map略微下降0.3

  1. 直接预测相对的位置

在这里插入图片描述

o为sigmoid函数 限制了x,y的取值范围 偏移量只能在这个格子中间去, Cx在图中为1,就是他的预测框例为13*13的,但是这个cell位于第二个 就要加上1

7.感受野
在这里插入图片描述
在这里插入图片描述
小的卷积核可以减少很多的数据量

8.特征融合
最后一层的感受野太大了,小目标会丢失,需要融合之前的特征。
就例
把前一层的特征图拆开为 1313512 四个的特征图 在和下一层的特征图叠加。
在这里插入图片描述
9.多尺度检测
在这里插入图片描述
都是卷积操作,不用担心输入图片的大小。但是必须得是32的倍数

Logo

加入「COC·上海城市开发者社区」,成就更好的自己!

更多推荐