0.前言

相关资料：
- arxiv
- github
- 论文解读
论文基本信息：

发表时间：arxiv2022(2022.9.16)

1.针对的问题

　　CNN虽然效率更高，能够建模局部关系，易于训练，收敛速度快。然而，它们大多采用静态权重，限制了它们的表示能力和通用性。而全局注意力机制虽然提供了动态权重，能从每个实例预测，从而在大数据集中获得强大的性能和鲁棒性，但是计算代价太高。

2.主要贡献

　　•提出了一种新颖的注意力机制MCA，该机制具有动态性，针对不同的分辨率模式采用了不同大小的卷积核。

　　•基于MCA，设计了一个综合了ViT和CNN优点的通用CNN骨干网ConvFormer。

　　•对多个视觉任务进行了广泛的实验，包括图像分类、目标检测和语义分割，以评估ConvFormer。实验结果表明，ConvFormer实现了最先进的性能。

3.方法　

　　本文提出的方法比较简单。MCA的两个关键组成部分是多级特征融合和门控机制。

　　多级特征融合能够捕捉不同分辨率下输入图像的不同模式，结合多尺度特征图。

　　门控机制进行特征重校准，学习选择性地强调含信息量大的特征，抑制非平凡特征。

　　MCA框架如下：

　　设输入为x，先用一个1×1卷积层，将通道数量扩展N倍。然后，通过3×3,5×5,7 ×7深度卷积并行学习多尺度特征，这里，5×5和7 ×7的是膨胀深度卷积，膨胀率分别为2和3，以获得更大的感受野。然后输入BatchNorm和ReLU来防止过拟合。接下来，为了应用残差连接进行更好的优化，通过1×1的卷积层来减少通道数量到与原始输入x一致，得到x'。

　　对于门控机制，首先使用全局平均池化层获取全局信息，然后是连续的两个全连接层。最后，利用sigmoid函数计算注意力向量Attn。

　　最后，将x通过1×1卷积的输出与Attn相乘得到最终输出。

　　ConvFormer总体框架如下：

　　输入图片首先输入一个卷积stem，该模块由一个stride为2的7 × 7卷积层,一个stride为1的3×3卷积层和一个stride为2的不重叠的2×2卷积层组成。这样，生成的输入特征空间大小为 H/4×W/4。

　　表示X∈R^N×C_¹^×^H/4^×^W/4为输入特征，N为batch大小，C₁为通道数。然后，将输入的特征输入重复的ConvFormer，每个ConvFormer由两个子块组成。具体来说，第一个子块的主要组件包括MCA和BatchNorm模块，第二个子块由两个全连接的层和一个非线性激活GELU组成，也就是一个MLP。

4.补充

　　作者在论文中提到注意力可以分为四种基本类别：通道注意力，自适应地重新校准每个通道的权重，以关注不同的对象。时序注意力强调捕捉帧间的交互作用并决定何时进行注意力。分支注意力是一种动态的分支选择机制，使得信息可以在不同分支间流动。空间注意力产生注意力掩膜，自适应地选择重要的空间区域。而MCA就是采用通道注意力机制。

ConvFormer: Closing the Gap Between CNN and Vision Transformers概述的更多相关文章

How Do Vision Transformers Work?[2202.06709] - 论文研读系列(2) 个人笔记
[论文简析]How Do Vision Transformers Work?[2202.06709] 论文题目:How Do Vision Transformers Work? 论文地址:http:/ ...
论文笔记：DeepFace: Closing the Gap to Human-Level Performance in Face Verification
2014 CVPR Facebook AI研究院简单介绍人脸识别中,通常经过四个步骤,检测,对齐(校正),表示,分类论文主要阐述了在对齐和表示这两个步骤上提出了新的方法,模型的表现超越了前人的工 ...
Awesome Deep Vision
Awesome Deep Vision A curated list of deep learning resources for computer vision, inspired by awes ...
ICCV2021 | Tokens-to-Token ViT:在ImageNet上从零训练Vision Transformer
前言本文介绍一种新的tokens-to-token Vision Transformer(T2T-ViT),T2T-ViT将原始ViT的参数数量和MAC减少了一半,同时在ImageNet上从 ...
《Vision Permutator: A Permutable MLP-Like ArchItecture For Visual Recognition》论文笔记
论文题目:<Vision Permutator: A Permutable MLP-Like ArchItecture For Visual Recognition> 论文作者:Qibin ...
Deep Learning模型之：CNN卷积神经网络（一）深度解析CNN
http://m.blog.csdn.net/blog/wu010555688/24487301 本文整理了网上几位大牛的博客,详细地讲解了CNN的基础结构与核心思想,欢迎交流. [1]Deep le ...
深度解析CNN
[1]Deep learning简介 [2]Deep Learning训练过程 [3]Deep Learning模型之:CNN卷积神经网络推导和实现 [4]Deep Learning模型之:CNN的反 ...
cnn(卷积神经网络)比较系统的讲解
本文整理了网上几位大牛的博客,详细地讲解了CNN的基础结构与核心思想,欢迎交流. [1]Deep learning简介 [2]Deep Learning训练过程 [3]Deep Learning模型之 ...
DeepFace--Facebook的人脸识别（转）
DeepFace基本框架人脸识别的基本流程是: detect -> aligh -> represent -> classify 人脸对齐流程分为如下几步: a. 人脸检测,使用 ...
face recognition[翻译][深度学习理解人脸]
本文译自<Deep learning for understanding faces: Machines may be just as good, or better, than humans& ...

随机推荐

Pytorch 基本操作
Pytorch 基础操作主要是在读深度学习入门之PyTorch这本书记的笔记.强烈推荐这本书 1. 常用类numpy操作 torch.Tensor(numpy_tensor) torch.from_ ...
【Azure 云服务】为Azure云服务配置上自签名的SSL证书步骤
问题描述在使用Azure Cloud Service(云服务),默认的情况下都是使用的 HTTP 服务,通过 Visual Studio 2022 创建的默认 Cloud Service项目中,在S ...
docker搭建Elasticsearch、Kibana、Logstash 同步mysql数据到ES
一.前言在数据量大的企业级实践中,Elasticsearch显得非常常见,特别是数据表超过千万级后,无论怎么优化,还是有点力不从心!使用中,最首先的问题就是怎么把千万级数据同步到Elasticsea ...
[LeetCode]爬楼梯
题目假设你正在爬楼梯.需要 n 步你才能到达楼顶. 每次你可以爬 1 或 2 个台阶.你有多少种不同的方法可以爬到楼顶呢? 注意:给定 n 是一个正整数. 示例 1: 输入: 2 输出: 2 解释: ...
小H的小屋
题解 [NOI2004]小H的小屋前记又鸽了好久,这回可要努力更新了 2019.6.2,痛下杀心,把电脑上所有的游戏都删掉了,提前160天奋力备考NOIP.目标:A类省队! 我是传送门题解这道 ...
计组Review1
1GB的内存,它是以字节编址的,假设内存地址为32位,128KB的高速缓存.现在有一个数据位于0x123456(字节编址),会映射到那些不同情形的内存单元上,还有TAG和总缓存大小. 1. 直接映射, ...
Cert Manager 申请 SSL 证书流程及相关概念 - 一
2022.3.9 用 cert-manager 申请成功通配符证书 (*.ewhisper.cn), 2022.4.30 该证书距离过期还有 30 天,cert-manager 进行自动续期,但是却失 ...
手把手教你写Dockerfile以及测试
Dockerfile是什么? dockerfile就是用来构建docker镜像的构建文件,命令参数脚本. 如何使用Dockerfile? 1.编写一个Dockerfile文件 2.docker bui ...
作业详解及流程控制之for循环
作业详解及流程控制之for循环目录作业详解及流程控制之for循环一.作业详解 1.根据用户输入内容打印其权限 2.编写用户登录程序 4.猜年龄的游戏二.流程控制之for循环三.while循环 ...
阿里百秀后台管理项目笔记 ---- Day04
来吧展示: step 1 : 实现评论管理数据渲染利用 ajax 创建接口得到数据使用模板引擎渲染页面 1.1 引入文件 <script src="/static/assets/ve ...

ConvFormer: Closing the Gap Between CNN and Vision Transformers概述

0.前言

1.针对的问题

2.主要贡献

3.方法

4.补充

ConvFormer: Closing the Gap Between CNN and Vision Transformers概述的更多相关文章

随机推荐

热门专题

3.方法