论文阅读笔记（二十二）【CVPR2017】：See the Forest for the Trees: Joint Spatial and Temporal Recurrent Neural Networks for Video-based Person Re-identiﬁcation

Introduction

在视频序列中，有些帧由于被严重遮挡，需要被尽可能的“忽略”掉，因此本文提出了时间注意力模型（temporal attention model，TAM），注重于更有相关性的帧。

常规的矩阵学习通常用特征的距离来进行计算，但忽视了帧之间的差异，上图可以看出，本文的方法考虑了相邻帧的空间差异，即空间循环模型（spatial recurrent model，SRM）。

The proposed method

（1）总体框架：

输入的视频序列为：，输入为视频序列三元组，首先通过CNN提取每帧的特征，选择的CNN为CaffeNet，包含5个卷积层（conv1~conv5）、2个全连接层（fc6~fc7），得到的输出为：。

时间注意力模型包含两部分：学习每帧相关性的子网络和时间RNN模型提取特征，最后输出特征为：，定义为：。

同时，对于视频对 xⁱ 和 x^j，计算和（第5个卷积层后的池化层），并将其输入到空间循环模型，该部分包含6个RNN，每个RNN都从一个特定的方向提取特征。输出的结果为一对视频是否为同一个人的可能性，即。

在测试中，最终两个视频的相似度可以计算为：（为什么这样计算？M的计算方法？）

其中 F 为欧式距离，λ 为平衡特征学习和矩阵学习的参数，默认为 1.

（2）针对特征学习的时间注意力模型（TAM）：

输入CNN提取的特征，每次时间单元 t 都对帧都进行平均加权，即：

其中，参数 w 通过训练如下子网络获得：

得到的送入RNN，其中的RNN网络采用 Long Short-Term Memory（LSTM）网络。最后将 T 次结果进行时间平均池化。

（3）针对度量学习的空间循环模型（SRM）：

输入一对视频序列的池化层特征，元素间进行相减操作，得到初步的差异映射，再通过1*1卷积。随后通过6个方向上的空间RNN模块，将得到的特征进行结合，再通过1*1卷积层和全连接层得到最终的特征。

其中RNN的工作原理为：

1*1卷积的原理为：

Experiments

（1）实验设置：

① 数据集：iLIDS-VID、PRID2011、MARS；

② 实现细节：CNN采用CaffeNet，RNN采用LSTM，视频序列长度设置为6，从tracklet中随机挑选，fc6和fc7的维度设置为1024.

（2）实验结果：

CNN：只使用CNN；

CNN+RNN：只使用CNN和RNN（不使用时间池化）；

CNN+TAM：使用CNN和RNN基础上的时间池化；

CNN+DIFF：使用CNN，并用全连接层代替空间RNN；

CNN+SRM：使用CNN，并使用空间RNN：

ALL：CNN、时间RNN、空间RNN。

论文阅读笔记（二十二）【CVPR2017】：See the Forest for the Trees: Joint Spatial and Temporal Recurrent Neural Networks for Video-based Person Re-identiﬁcation的更多相关文章

论文阅读笔记（十二）【CVPR2018】：Exploit the Unknown Gradually: One-Shot Video-Based Person Re-Identiﬁcation by Stepwise Learning
Introduction (1)Motivation: 大量标记数据成本过高,采用半监督的方式只标注一部分的行人,且采用单样本学习,每个行人只标注一个数据. (2)Method: 对没有标记的数据生成 ...
论文阅读笔记五十二：CornerNet-Lite: Efficient Keypoint Based Object Detection（CVPR2019）
论文原址:https://arxiv.org/pdf/1904.08900.pdf github:https://github.com/princeton-vl/CornerNet-Lite 摘要基 ...
论文阅读笔记四十二：Going deeper with convolutions (Inception V1 CVPR2014 )
论文原址:https://arxiv.org/pdf/1409.4842.pdf 代码连接:https://github.com/titu1994/Inception-v4(包含v1,v2,v4) ...
论文阅读笔记三十二：YOLOv3: An Incremental Improvement
论文源址:https://pjreddie.com/media/files/papers/YOLOv3.pdf 代码:https://github.com/qqwweee/keras-yolo3 摘要 ...
论文阅读笔记六十二:RePr: Improved Training of Convolutional Filters(CVPR2019)
论文原址:https://arxiv.org/abs/1811.07275 摘要一个训练好的网络模型由于其模型捕捉的特征中存在大量的重叠,可以在不过多的降低其性能的条件下进行压缩剪枝.一些skip/ ...
论文阅读笔记三十六：Mask R-CNN（CVPR2017）
论文源址:https://arxiv.org/pdf/1703.06870.pdf 开源代码:https://github.com/matterport/Mask_RCNN 摘要 Mask R-CNN ...
论文阅读笔记三十四：DSSD: Deconvolutiona lSingle Shot Detector（CVPR2017）
论文源址:https://arxiv.org/abs/1701.06659 开源代码:https://github.com/MTCloudVision/mxnet-dssd 摘要 DSSD主要是向目标 ...
论文阅读笔记五十：CornerNet: Detecting Objects as Paired Keypoints(ECCV2018)
论文原址:https://arxiv.org/pdf/1808.01244.pdf github:https://github.com/princeton-vl/CornerNet 摘要本文提出了目 ...
论文阅读笔记四十四：RetinaNet:Focal Loss for Dense Object Detection(ICCV2017）
论文原址:https://arxiv.org/abs/1708.02002 github代码:https://github.com/fizyr/keras-retinanet 摘要目前,具有较高准确 ...

随机推荐

winform应用如何发布（不用打包）、并提醒用户自动更新
环境:VS2019 community C# winform 应用程序设计应用程序界面编写对应代码使用PS设计程序标识ICON F4打开属性: 设置ICON 设置背景打开项目属性打开“发 ...
asp.net core 3.x 身份验证-3cookie身份验证原理
概述上两篇(asp.net core 3.x 身份验证-1涉及到的概念.asp.net core 3.x 身份验证-2启动阶段的配置)介绍了身份验证相关概念以及启动阶段的配置,本篇以cookie身份 ...
Codeforces_714_A
http://codeforces.com/problemset/problem/714/A 水,注意K的值. #include <iostream> using namespace st ...
快速了解Lambda表达式-Java
目录 lambda表达式前言简介简单入门用法好处总结 lambda表达式前言最近因为疫情,也不能正常返校什么的,希望大家都能好好的,希望武汉加油,中国加油,在家也看了很多视频,学了一点 ...
sqlserver install on linux chapter one
Hello The MS open the source to let people download source. You may ask where to download ? Ask goog ...
centos下升级php到5.6
今天正好用空把php环境升级到5.6版本,首先我之前的环境是源码包编译的lnmp环境首先到php官方网站上下载一个php5.6的tar包,放到机器上面后,开始安装,安装前先将nginx,mysql, ...
Spring学习笔记:使用Pointcut 和Advisor实现AOP
基础知识在 Spring AOP 中,有 3 个常用的概念,Advices . Pointcut . Advisor ,解释如下: Advices :表示一个 method 执行前或执行后的动作. ...
centos6.5下部署sersync+rsync --daemon同步数据
rsync --daemon端配置 [root@rsync-daemon etc]# /etc/init.d/iptables stop [root@rsync-daemon ~]# dos2unix ...
android系统webview使用input实现选择文件并预览
一般系统的实现方式: 代码实现 <!doctype html> <html> <head> <meta charset="utf-8"&g ...
移动端键盘顶起遮挡输入框&offsetTop值不准问题
先上图通常在开发中我们会遇到这样输入框被遮挡的问题,那么该怎么解决呢? 方案一(css): 首先,把置底元素设置成,在页面的底部而非屏幕的底部 .page .bottom { position ...

论文阅读笔记（二十二）【CVPR2017】：See the Forest for the Trees: Joint Spatial and Temporal Recurrent Neural Networks for Video-based Person Re-identiﬁcation

论文阅读笔记（二十二）【CVPR2017】：See the Forest for the Trees: Joint Spatial and Temporal Recurrent Neural Networks for Video-based Person Re-identiﬁcation的更多相关文章

随机推荐

热门专题