位置: IT常识 - 正文

yolox改进--添加Coordinate Attention模块(CVPR2021)(yolo改进方法)

编辑:rootadmin
yolox改进--添加Coordinate Attention模块(CVPR2021) yolox改进--添加Coordinate Attention模块Coordinate Attention代码建立包含CAM代码的attention.py在yolo_pafpn.py中添加CAM总结

推荐整理分享yolox改进--添加Coordinate Attention模块(CVPR2021)(yolo改进方法),希望有所帮助,仅作参考,欢迎阅读内容。

文章相关热门搜索词:yolov2改进,yolo增加检测层,yolov5如何改进,yolo增加检测层,改进yolov3,改进yolov3,yolov2改进,改进yolov3,内容如对您有帮助,希望把文章链接给更多的朋友!

因为项目需要,尝试魔改一下yolox-s,看看能不能在个人数据集上刷高点mAP。因为Coordinate Attention模块(以下简称CAM)的作者提供了代码,并且之前不少博主公开了CAM用在yolov5或者yolox等模型的代码,所以一开始我直接当了搬运工,但在搬运过程,我发现官方的代码不能直接用在yolox上,且之前公开CAM用在yolox的代码根本跑不通。在debug之后,发现问题是出现在官方的代码上,于是心血来潮写下这篇文章,废话不多说,来看修改后的代码吧!

Coordinate Attentionyolox改进--添加Coordinate Attention模块(CVPR2021)(yolo改进方法)

论文来源: http://arxiv.org/abs/2103.02907 官方代码:https://github.com/Andrew-Qibin/CoordAttention

注意力机制广泛用于深度神经网络中来提高模型的性能。然而,因为其昂贵的计算代价,很难应用在一些轻量级网络,但不乏有一些注意力模块脱颖而出,具有代表性的有SE、CBAM等。SE模块通过2D全局池化来计算通道注意力,在非常低的计算成本下达到了提升网络性能的目的,遗憾的是,SE模块忽视了捕获位置信息的注意力;CBAM模块通过使用大尺寸卷积来获得位置信息的注意力,但只偏向于捕获局部的位置信息。 CAM模块来源于2021CVPR,该模块通过将位置信息嵌入到通道注意力中,因为其较少的计算代价,使轻量级网可以较大的区域中获得注意力。为了缓解位置信息丢失的问题,论文作者将2D全局池化替换成分别在特征的w和h并行提取特征的两个1D池化,可以有效捕获空间坐标信息;而后这两个并行的特征图通过两个卷积来生成两个独立方向的注意力图;通过将两个注意力图乘入到原始特征图中,以达到增强特征图的表征能力。

代码建立包含CAM代码的attention.py

在./yolox/models/文件夹下建立attention.py,CAM代码如下。相较于官方的代码,为了适配yolox,这里将nn.AdaptiveAvgPool2d直接用于forward。

class CAM(nn.Module): def __init__(self, channels, reduction=32): super(CAM, self).__init__() self.conv_1x1 = nn.Conv2d(in_channels=channels, out_channels=channels // reduction, kernel_size=1, stride=1, bias=False) self.mish = Mish() # 可用自行选择激活函数 self.bn = nn.BatchNorm2d(channels // reduction) self.F_h = nn.Conv2d(in_channels=channels // reduction, out_channels=channels, kernel_size=1, stride=1, bias=False) self.F_w = nn.Conv2d(in_channels=channels // reduction, out_channels=channels, kernel_size=1, stride=1, bias=False) self.sigmoid_h = nn.Sigmoid() self.sigmoid_w = nn.Sigmoid() def forward(self, x): h, w = x.shape[2], x.shape[3] avg_pool_x = nn.AdaptiveAvgPool2d((h, 1)) avg_pool_y = nn.AdaptiveAvgPool2d((1, w)) x_h = avg_pool_x(x).permute(0, 1, 3, 2) x_w = avg_pool_y(x) x_cat_conv_relu = self.mish(self.conv_1x1(torch.cat((x_h, x_w), 3))) x_cat_conv_split_h, x_cat_conv_split_w = x_cat_conv_relu.split([h, w], 3) s_h = self.sigmoid_h(self.F_h(x_cat_conv_split_h.permute(0, 1, 3, 2))) s_w = self.sigmoid_w(self.F_w(x_cat_conv_split_w)) out = x * s_h.expand_as(x) * s_w.expand_as(x) return out在yolo_pafpn.py中添加CAM

CAM作为即插即用的注意力模块,添加位置可以完全替换例如CBAM等经典的注意力机制模块,具体可参考其他有关yolox在head中插入注意力机制的教程,这里给的代码以添加在pafpn为例,添加在哪效果好要取决于添加位置在特定数据集的表现。

#!/usr/bin/env python# -*- encoding: utf-8 -*-# Copyright (c) Megvii Inc. All rights reserved.import torchimport torch.nn as nnfrom .darknet import CSPDarknetfrom .network_blocks import BaseConv, CSPLayer, DWConvfrom .attention import CAMclass YOLOPAFPN(nn.Module): """ YOLOv3 model. Darknet 53 is the default backbone of this model. """ def __init__( self, depth=1.0, width=1.0, in_features=("dark3", "dark4", "dark5"), in_channels=[256, 512, 1024], depthwise=False, act="silu", ): super().__init__() self.backbone = CSPDarknet(depth, width, depthwise=depthwise, act=act) self.in_features = in_features self.in_channels = in_channels Conv = DWConv if depthwise else BaseConv self.upsample = nn.Upsample(scale_factor=2, mode="nearest") # self.upsample = nn.Upsample(scale_factor=2, mode="bilinear") self.lateral_conv0 = BaseConv( int(in_channels[2] * width), int(in_channels[1] * width), 1, 1, act=act ) self.C3_p4 = CSPLayer( int(2 * in_channels[1] * width), int(in_channels[1] * width), round(3 * depth), False, depthwise=depthwise, act=act, ) # cat self.reduce_conv1 = BaseConv( int(in_channels[1] * width), int(in_channels[0] * width), 1, 1, act=act ) self.C3_p3 = CSPLayer( int(2 * in_channels[0] * width), int(in_channels[0] * width), round(3 * depth), False, depthwise=depthwise, act=act, ) # bottom-up conv self.bu_conv2 = Conv( int(in_channels[0] * width), int(in_channels[0] * width), 3, 2, act=act ) self.C3_n3 = CSPLayer( int(2 * in_channels[0] * width), int(in_channels[1] * width), round(3 * depth), False, depthwise=depthwise, act=act, ) # bottom-up conv self.bu_conv1 = Conv( int(in_channels[1] * width), int(in_channels[1] * width), 3, 2, act=act ) self.C3_n4 = CSPLayer( int(2 * in_channels[1] * width), int(in_channels[2] * width), round(3 * depth), False, depthwise=depthwise, act=act, ) self.CAM0 = CAM(int(in_channels[2] * width)) self.CAM1 = CAM(int(in_channels[1] * width)) self.CAM2 = CAM(int(in_channels[0] * width)) # self.CAM3 = CAM(int(in_channels[0] * width)) # self.CAM4 = CAM(int(in_channels[1] * width)) # self.CAM5 = CAM(int(in_channels[2] * width)) def forward(self, input): """ Args: inputs: input images. Returns: Tuple[Tensor]: FPN feature. """ # backbone out_features = self.backbone(input) features = [out_features[f] for f in self.in_features] [x2, x1, x0] = features #############add CAM############## x0 = self.CAM0(x0) x1 = self.CAM1(x1) x2 = self.CAM2(x2) ################################## fpn_out0 = self.lateral_conv0(x0) # 1024->512/32 f_out0 = self.upsample(fpn_out0) # 512/16 f_out0 = torch.cat([f_out0, x1], 1) # 512->1024/16 f_out0 = self.C3_p4(f_out0) # 1024->512/16 fpn_out1 = self.reduce_conv1(f_out0) # 512->256/16 f_out1 = self.upsample(fpn_out1) # 256/8 f_out1 = torch.cat([f_out1, x2], 1) # 256->512/8 pan_out2 = self.C3_p3(f_out1) # 512->256/8 # pan_out2 = self.CAM3(pan_out2) p_out1 = self.bu_conv2(pan_out2) # 256->256/16 p_out1 = torch.cat([p_out1, fpn_out1], 1) # 256->512/16 pan_out1 = self.C3_n3(p_out1) # 512->512/16 # p_out1 = self.CAM4(p_out1) p_out0 = self.bu_conv1(pan_out1) # 512->512/32 p_out0 = torch.cat([p_out0, fpn_out0], 1) # 512->1024/32 pan_out0 = self.C3_n4(p_out0) # 1024->1024/32 # pan_out0 = self.CAM5(pan_out0) outputs = (pan_out2, pan_out1, pan_out0) return outputs总结

CAM,同SE、CBAM等模块一样,作为即插即用的注意力机制,在yolov5、yolox等轻量级网络中有着重要的作用。本文介绍的CAM+yolox在我的数据集上,mAP比不添加的时候提高了0.02个点,相比使用CBAM提高了0.01个点,效果还是很可观的。

本文链接地址:https://www.jiuchutong.com/zhishi/297518.html 转载请保留说明!

上一篇:前端使用lottie-web,使用AE导出的JSON动画贴心教程(前端使用vue)

下一篇:下载、编译、安装、使用 vue-devtools(编译安装和普通安装)

  • 小米人脸识别智能门锁x怎么换电池(小米人脸识别智能门锁 X)

    小米人脸识别智能门锁x怎么换电池(小米人脸识别智能门锁 X)

  • 信号贴为何对手机信号无任何改善(信号贴是什么原理)

    信号贴为何对手机信号无任何改善(信号贴是什么原理)

  • 怎么保存腾讯视频到手机相册(怎么保存腾讯视频里的精彩片段?)

    怎么保存腾讯视频到手机相册(怎么保存腾讯视频里的精彩片段?)

  • 小米8录音文件在哪里(小米录音文件在哪个文件夹)

    小米8录音文件在哪里(小米录音文件在哪个文件夹)

  • econavi是什么意思(econ什么意思)

    econavi是什么意思(econ什么意思)

  • 淘宝和天猫的区别(淘宝和天猫的区别在哪)

    淘宝和天猫的区别(淘宝和天猫的区别在哪)

  • thinkpadx230上市时间

    thinkpadx230上市时间

  • 企业微信直播美颜功能在哪(企业微信直播美颜软件)

    企业微信直播美颜功能在哪(企业微信直播美颜软件)

  • 0xa00f4292相机错误如何修复(0xa00f4292相机错误 黑屏)

    0xa00f4292相机错误如何修复(0xa00f4292相机错误 黑屏)

  • 12306候补订单兑现失败钱什么时候退(12306候补订单兑现成功但是携程还在抢票)

    12306候补订单兑现失败钱什么时候退(12306候补订单兑现成功但是携程还在抢票)

  • 爱奇艺会员自动掉线(爱奇艺会员自动扣费怎么取消掉)

    爱奇艺会员自动掉线(爱奇艺会员自动扣费怎么取消掉)

  • 苹果11长度多少厘米(苹果11长度多少寸)

    苹果11长度多少厘米(苹果11长度多少寸)

  • a1586是三网通吗(a1586支持联通吗)

    a1586是三网通吗(a1586支持联通吗)

  • word2010的替换功能在(word2010的替换功能所在的选项卡是)

    word2010的替换功能在(word2010的替换功能所在的选项卡是)

  • 手机关机后qq多久下线(手机关机qq多久会离线)

    手机关机后qq多久下线(手机关机qq多久会离线)

  • 手机怎么打开root权限(手机怎么打开root)

    手机怎么打开root权限(手机怎么打开root)

  • 大众点评匿名怎么查看(大众点评匿名怎么查是谁发的)

    大众点评匿名怎么查看(大众点评匿名怎么查是谁发的)

  • oa系统怎么使用(oa系统操作指南)

    oa系统怎么使用(oa系统操作指南)

  • oppo手机二维码在哪里(怎么查看oppo手机二维码)

    oppo手机二维码在哪里(怎么查看oppo手机二维码)

  • 苹果手机相机专业模式在哪里(苹果手机相机专业模式拍月亮)

    苹果手机相机专业模式在哪里(苹果手机相机专业模式拍月亮)

  • 麒麟970和麒麟980区别(麒麟970和麒麟980处理器差距大吗)

    麒麟970和麒麟980区别(麒麟970和麒麟980处理器差距大吗)

  • 3dmax怎么让棱边变圆滑(3dmax怎么让模型的棱角分明)

    3dmax怎么让棱边变圆滑(3dmax怎么让模型的棱角分明)

  • 华为mate20pro双卡双待吗(华为mate20Pro双卡一个4G一个2G)

    华为mate20pro双卡双待吗(华为mate20Pro双卡一个4G一个2G)

  • 小米6如何投屏(小米如何投屏到电脑)

    小米6如何投屏(小米如何投屏到电脑)

  • 价税分离计算公式有哪些
  • 汽油费通行费等怎么记账
  • 减免的企业所得税需要计入应交税费吗
  • 代开专票上的税额比电子缴款凭证上的税额少怎么调整
  • 库存暂估入账
  • 个体工商户季度不超过30万免增值税吗
  • 投资控股型公司什么意思
  • 减免税款借贷方表示
  • 银行证书年费计入什么科目
  • 每月10万不要交税从什么时候开始
  • 公司购买的货架入哪个科目
  • 开技术服务费发票怎么做账
  • 公司代个人收承兑汇票
  • 金蝶怎么填写凭证
  • 城镇土地使用税暂行条例
  • 报销差旅费退回现金是什么凭证
  • 产品缺陷处理流程
  • 由财政拨钱还银行借款怎么做分录?
  • 购买车间用的材料怎么做分录
  • 增值税专用发票怎么开
  • 营改增后建筑行业税率
  • 费用的补提利息怎么计算
  • 应收账款周转次数计算方法
  • 保洁属于劳务报酬吗
  • win11最低硬件要求几代
  • 绝地求生未来之役手游下载
  • 同一张发票可以分两次报销吗
  • PHP:xml_set_character_data_handler()的用法_XML解析器函数
  • windows 10 版本 21h1
  • .exe是啥
  • bug is
  • 存货的核算方法
  • 宾馆一次性用品有哪些
  • 阿里云onedata
  • 蛇形矩阵找数的位置
  • 未分配利润可以弥补亏损吗
  • 公司哪些支出费用可以扣
  • 个税专项扣除中赡养老人
  • typescriptlang
  • 汽车抵押贷款会上征信吗
  • 织梦如何给栏目增加缩略图
  • 房地产企业汇算清缴资料
  • 软件和集成电路企业
  • 免税后的商品有什么优势?
  • python如何合并字典
  • python中变量类型有几种
  • 无偿受赠房屋 交个人所得税嘛
  • 消耗品属于哪个会计科目
  • 公账转给员工工资情况说明怎么写
  • 税负率包含哪些税种
  • 充电口有烧焦味怎么简单解决
  • 跨境电商财务如何报税
  • 材料成本差异会计处理
  • 诉讼费应计入什么会计科目
  • 会计的视频教程
  • 内控制度包括哪几方面
  • 领备用金时会计怎么做分录
  • 加计扣除10%进项税政策文件
  • 普票与专票有什么区别报销
  • 在建工程明细科目怎么设置
  • 增值税直接减免额怎么做账
  • 实际利率与名义利率的换算
  • 记账发生错账怎么办
  • 获得sql数据库信息的方法
  • u盘装系统软件哪个好
  • bios是什么怎么设置
  • win7 双击不能打开文件
  • Ubuntu中Virtualbox虚拟机NAT方式无法上网解决方法
  • winxp使用到什么时候
  • vmware中安装centos7
  • linux的链接文件
  • nero recode
  • win10系统找不到无线网络连接
  • ExtJS4中的requires使用方法示例介绍
  • Bullet(Cocos2dx)之创建地形
  • js的isnan
  • 网页制作css怎么用
  • bootstrap怎么学
  • js对象索引获取key
  • 贵州国家电子税务局登录入口
  • 免责声明:网站部分图片文字素材来源于网络,如有侵权,请及时告知,我们会第一时间删除,谢谢! 邮箱:opceo@qq.com

    鄂ICP备2023003026号

    网站地图: 企业信息 工商信息 财税知识 网络常识 编程技术

    友情链接: 武汉网站建设