pytorch-backword函数的理解

函数：\(tensor.backward(params)\)

这个params的维度一定要和tensor的一致，因为tensor如果是一个向量y = [y1,y2,y3]，那么传入的params=[a1,a2,a3]，这三个值是系数，那么是什么的系数呢？
假定对x =[ x1,x2]求导，那么我们知道，
\(dy/dx\) 为：
第一列： \(dy1/dx1,dy2/dx1,dy3/dx1\)
第二列：\(dy1/dx2, dy2/dx2,dy3/dx2\)
从而 \(dy/dx\)是一个3行2列的矩阵，每一列对应了对x1的导数，每一列也就是\(x1\)的梯度向量
而反向计算的时候，并不是返回这个矩阵，而是返回这个矩阵每列的和作为梯度，也就是：\(dy1/dx1+dy2/dx1+dy3/dx1\) 是y对x1的梯度
这就好理解了，系数为\(params=[a1,a2,a3]\)就对应了这加和的三项！也就是，对\(x1\)的梯度实际上是\(a1*dy1/dx1+a2*dy2/dx1+a3*dy3/dx1\)
而输出y是标量的时候，就不需要了，默认的就是\(1.\)

自己重写backward函数时，要写上一个grad_output参数，这个参数就是上面提到的params

这个grad_output参数究竟是什么呢？下面作出解释：
是这样的，假如网络有两层， h = h(x)，y = y(h)
你可以计算\(dy/dx\)，这样，y.backward(),因为\(dy/dy=1\)，那么，backward的参数就可以省略
如果计算h.backward()，因为你想求的是\(dy/dx\)，（这才是输出对于输入的梯度），那么，计算图中的y = y(h)就没有考虑到
因为\(dy/dx = dy/dh * dh/dx\)，h.backward()求得是\(dh/dx\)，那么你必须传入之前的梯度\(dy/dh\)才行，也就是说，h.backward(params=dy/dh)这里面的参数就是\(dy/dh\)

这就好理解了，如果我们自己实现了一层，继承自Function，自己实现静态方法forward和backward时，backward必须有个grad_output参数，这个参数就是计算图中输出对该自定义层的梯度，这样才能求出对输入的梯度。

另外，假设定义的层计算出的是y，调用的就是y.backward(grad_output)，这个里面的参数的维度必须和y是相同的。这也就是为什么前面提到对于输出是多维的，会有个“系数”的原因，这个系数就是后向传播时，该层之前的梯度的累积，这样与本层再累积，才实现了完整的链式法则，最终求出out对input的梯度。

另外，自定义实现forward和backward时，两函数的输入输出是有要求的，即forward的输入必须和~的return相对应，如forward的input有个w参数，那么backward的return就必须在对应的位置返回grad_w，因为只有这样，才能够对相应的输入参数梯度下降。

【pytorch】pytorch-backward()的理解的更多相关文章

ARTS-S pytorch中backward函数的gradient参数作用
导数偏导数的数学定义参考资料1和2中对导数偏导数的定义都非常明确.导数和偏导数都是函数对自变量而言.从数学定义上讲,求导或者求偏导只有函数对自变量,其余任何情况都是错的.但是很多机器学习的资料和开源 ...
Pytorch autograd,backward详解
平常都是无脑使用backward,每次看到别人的代码里使用诸如autograd.grad这种方法的时候就有点抵触,今天花了点时间了解了一下原理,写下笔记以供以后参考.以下笔记基于Pytorch1.0 ...
Pytorch 之 backward
首先看这个自动求导的参数: grad_variables:形状与variable一致,对于y.backward(),grad_variables相当于链式法则dz/dx=dz/dy × dy/dx 中 ...
[pytorch] Pytorch入门
Pytorch入门简单容易上手,感觉比keras好理解多了,和mxnet很像(似乎mxnet有点借鉴pytorch),记一记. 直接从例子开始学,基础知识咱已经看了很多论文了... import t ...
pytorch lstm crf 代码理解重点
好久没有写博客了,这一次就将最近看的pytorch 教程中的lstm+crf的一些心得与困惑记录下来. 原文 PyTorch Tutorials 参考了很多其他大神的博客,https://blog.c ...
pytorch lstm crf 代码理解
好久没有写博客了,这一次就将最近看的pytorch 教程中的lstm+crf的一些心得与困惑记录下来. 原文 PyTorch Tutorials 参考了很多其他大神的博客,https://blog.c ...
Pytorch的LSTM的理解
class torch.nn.LSTM(*args, **kwargs) 参数列表 input_size:x的特征维度 hidden_size:隐藏层的特征维度 num_layers:lstm隐层的层 ...
pytorch autograd backward函数中 retain_graph参数的作用，简单例子分析，以及create_graph参数的作用
retain_graph参数的作用官方定义: retain_graph (bool, optional) – If False, the graph used to compute the grad ...
pytorch的backward
在学习的过程中遇见了一个问题,就是当使用backward()反向传播时传入参数的问题: net.zero_grad() #所有参数的梯度清零 output.backward(Variable(t.on ...

随机推荐

关于ApiCloud的Superwebview在androidstudio中集成微信支付模块，提示模块未绑定的问题
前两天ApiCloud项目集成了微信支付模块,android端今天也将ApiCloud官方的uzWxPay.jar集成了.在编译玩测试的时候提示wxPay模块为绑定!我的项目是使用ApiCloud推出 ...
痞子衡嵌入式：ARM Cortex-M内核MCU开发那些事 - 索引
大家好,我是痞子衡,是正经搞技术的痞子.本系列痞子衡给大家介绍的是ARM Cortex-M内核微控制器相关知识. ARM公司从2004年开始推出Cortex-M系列内核,迄今Cortex-M家族已经包 ...
【大数据安全】Apache Kylin 安全配置(Kerberos)
1. 概述本文首先会简单介绍Kylin的安装配置,然后介绍启用Kerberos的CDH集群中如何部署及使用Kylin. Apache Kylin™是一个开源的分布式分析引擎,提供Hadoop/Spa ...
Linux权限管理(week1_day5)--技术流ken
权限概述 Linux系统一般将文件可存/取访问的身份分为3个类别:owner(拥有者).group(和所有者同组的用户).others(其他人,除了所有者,除了同组的用户以及除了超级管理员),且3种身 ...
简述ADO.NET命名空间
system.data命名空间的类型 system.data命名空间的核心成员命名空间作用 Constraint 表示某个DataColumn对象的约束 DataColumn 表示某个DataT ...
SpringBoot 2.0 更优雅的配置注入
application.properties jdbc.driverClassName=com.mysql.jdbc.Driver jdbc.url=jdbc:mysql://127.0.0.1:33 ...
02 入门 - ASP.NET MVC 5 概述
目录索引:<ASP.NET MVC 5 高级编程>学习笔记本篇内容: 一.One ASP.NET 二.新的Web项目体验三.ASP.NET Identity 四.Bootstrap 模 ...
noi.ac#309 Mas的童年(子集乱搞)
题意题目链接 Sol 记\(s_i\)表示前\(i\)个数的前缀异或和,我们每次相当于要找一个\(j\)满足\(0 < j < i\)且\((s_i \oplus s_j) + s_j\ ...
weblogic patch log显示
如何在WebLogic 12.1.3 版本的 server log 中显示 opatch 的补丁信息? 打补丁 patch 23558563 之后. 需要在 JAVA_OPTIONS 中添加如下参数 ...
Fragment与Fragment相互切换之间的生命周期方法
Fragment 1 切换到 Fragment 2时生命周期变化 1.通过 add hide show 方式来切换 Fragment Fragment1 的生命周期变化为:onCreate().onC ...

【pytorch】pytorch-backward()的理解

pytorch-backword函数的理解

【pytorch】pytorch-backward()的理解的更多相关文章

随机推荐

热门专题