5.2自然语言处理

觉得有用的话,欢迎一起讨论相互学习~Follow Me

2.7 负采样 Negative sampling

Mikolov T, Sutskever I, Chen K, et al. Distributed representations of words and phrases and their compositionality[C]// International Conference on Neural Information Processing Systems. Curran Associates Inc. 2013:3111-3119.

skip-gram模型可以构造一个监督学习任务，把上下文映射到目标词上，以学习一个实用的词嵌入，但是他的缺点是softmax计算起来很慢。本节将会介绍了一个经过优化的学习问题叫做 负采样，其能够做到和 skip-gram 相似的功能但是使用起来更加高效。

样本生成方法

例句： I want a glass of orange juice to go along with my cereal 构造一个新的监督学习问题，给定一对单词 orange 和 juice ,预测这是否是一对 上下文词-目标词 (context-target) ,在这个样本中，orange 和 juice 就是一个正样本。然而对于 orange 和 king 就是一个负样本。
- 正样本 的生成是采样得到一个上下文词和一个目标词。其中先在句中随机均匀的选取一个单词作为上下文词。然后在其左右两边一定词距内随机选择一个单词作为目标词。并且将标签设置为1.
- 负样本 的生成是使用和正样本一样的上下文词，然后从字典中随机选取一个单词构成一个组合。并且将标签设置为0. 其中同一 上下文词 生成 K个负样本

context	word	target
orange	juice	1
orange	king	0
orange	book	0
orange	the	0
orange	of	0

注意：正负样本 的区别仅取决于单词对的来源，即是 of 也在 orange 的设定词距之内，但是作为随机从字典中选取的单词， of - orange 单词对仍然被标记为负样本。
在本次提出的算法中 输入数据x 将被设定为 context-word 的单词对，预测结果y 将被设置为 target 算法的目的即是区分 样本采样的来源
论文作者推荐，小数据集的话 K 被设置为5-20，而对于较大的数据集， K 被设置为2-5.即数据集越小 K 值被设定的越大。

模型学习原理

Skip-grams 中softmax函数定义:
\[P(target|content)=\frac{e^{\theta_{t}^{T}e_{c}}}{\sum^{10000}_{j=1}{e^{\theta^{T}_{j}e_{c}}}}\]
本节算法定义 输入Context为c,Word为t,定义输出Target为y

context	word	target
c	t	y
\(x_1\)	\(x_2\)	y
orange	juice	1
orange	king	0
orange	book	0
orange	the	0
orange	of	0

损失函数 定义为给定 样本单词对 的情况下，\(y=1\) 的概率:
- 使用\(e_{c}\)表示context的词嵌入向量其中\(\theta_{t}\)表示每个样本对应的参数.
- \[P(y=1|c,t)=\sigma(\theta^{T}_{t}e_{c})\]
- 对于每个正样本都有 K 个负样本来训练一个类似logisitic回归的模型。

神经网络算法流程

如果输入词是 orange ，即词典中的第6257个词，将其使用one-hot向量表示 \(o_{6257}\),
再传递给E(词嵌入向量矩阵)，通过两者相乘得到 orange 的嵌入向量 \(e_{6357}\)
\(e_{6357}\)是一个1W维(字典中总单词数量)的向量，可以看成是1W个可能的logistic回归分类问题，其中一个是用来判断目标词是否是 juice 的分类器，当然也有用来判断 king,book,the... 等词汇是否是目标词的分类器。但是每次迭代不都是训练所有的样本， 每次迭代只会训练一个正样本和随机选取的 K 个负样本

此算法将需要计算10000个维度的softmax问题转化为10000个二分类问题，每一个都易于计算，每次迭代要做的只是训练其中的 K+1 个样本，其中一个正样本和随机选取的同一个Context的 K 个负样本。
此算法被称为 负采样 ，因为在挑选一个 正样本 的同时，随机生成 K个负样本

负样本采样方法

仅考虑单词在 语料库 中出现的频率，会导致负样本中 the, of, and ... 等介词出现的频率过高
仅考虑单词在 词汇表 中出现的频率，即在 词汇表 中随机采样，分母是词汇表中的总词数，这样采样十分没有代表性。
论文提出采样公式为:
\[P(w_{i})=\frac{f(w_{i})^{3/4}}{\sum^{10000}_{j=1}f(w_{j})^{3/4}}\]其中\(f(w_{i})\)表示单词在语料库中的词频。

[DeeplearningAI笔记]序列模型2.7负采样Negative sampling的更多相关文章

[DeeplearningAI笔记]序列模型1.7-1.9RNN对新序列采样/GRU门控循环神经网络
5.1循环序列模型觉得有用的话,欢迎一起讨论相互学习~Follow Me 1.7对新序列采样基于词汇进行采样模型在训练完一个模型之后你想要知道模型学到了什么,一种非正式的方法就是进行一次新序列采 ...
[DeeplearningAI笔记]序列模型3.9-3.10语音辨识/CTC损失函数/触发字检测
5.3序列模型与注意力机制觉得有用的话,欢迎一起讨论相互学习~Follow Me 3.9语音辨识 Speech recognition 问题描述对于音频片段(audio clip)x ,y生成文本 ...
[DeeplearningAI笔记]序列模型3.7-3.8注意力模型
5.3序列模型与注意力机制觉得有用的话,欢迎一起讨论相互学习~Follow Me 3.7注意力模型直观理解Attention model intuition 长序列问题 The problem of ...
[DeeplearningAI笔记]序列模型3.6Bleu得分/机器翻译得分指标
5.3序列模型与注意力机制觉得有用的话,欢迎一起讨论相互学习~Follow Me 3.6Bleu得分在机器翻译中往往对应有多种翻译,而且同样好,此时怎样评估一个机器翻译系统是一个难题. 常见的解决 ...
[DeeplearningAI笔记]序列模型3.3集束搜索
5.3序列模型与注意力机制觉得有用的话,欢迎一起讨论相互学习~Follow Me 3.3 集束搜索Beam Search 对于机器翻译来说,给定输入的句子,会返回一个随机的英语翻译结果,但是你想要一 ...
[DeeplearningAI笔记]序列模型3.2有条件的语言模型与贪心搜索的不可行性
5.3序列模型与注意力机制觉得有用的话,欢迎一起讨论相互学习~Follow Me 3.2选择最可能的句子 Picking the most likely sentence condition lan ...
[DeeplearningAI笔记]序列模型3.1基本的 Seq2Seq /image to Seq
5.3序列模型与注意力机制觉得有用的话,欢迎一起讨论相互学习~Follow Me 3.1基础模型 [1] Sutskever I, Vinyals O, Le Q V. Sequence to Se ...
[DeeplearningAI笔记]序列模型2.8 GloVe词向量
5.2自然语言处理觉得有用的话,欢迎一起讨论相互学习~Follow Me 2.8 GloVe word vectors GloVe词向量 Pennington J, Socher R, Mannin ...
[DeeplearningAI笔记]序列模型1.10-1.12LSTM/BRNN/DeepRNN
5.1循环序列模型觉得有用的话,欢迎一起讨论相互学习~Follow Me 1.10长短期记忆网络(Long short term memory)LSTM Hochreiter S, Schmidhu ...

随机推荐

20个常用Linux性能监控工具/命令
20个常用Linux性能监控工具/命令对于 Linux/Unix 系统管理员非常有用的并且最常用的20个命令行系统监视工具.这些命令可以在所有版本的 Linux 下使用去监控和查找系统性能的实际原因 ...
Alpha 冲刺（4/10）
队名火箭少男100 组长博客林燊大哥作业博客 Alpha 冲鸭鸭鸭鸭! 成员冲刺阶段情况林燊(组长) 过去两天完成了哪些任务协调各成员之间的工作协助前后端接口的开发测试项目运行的服务器环 ...
软件工程 - 第二十次作业 Alpha 事后诸葛亮（团队）
Alpha 事后诸葛亮(团队) 组长本次作业链接:https://www.cnblogs.com/dawnduck/p/10056026.html 现代软件工程项目Postmortem 设想和目标 ...
WPF和Expression Blend开发实例:Adorner(装饰器)应用实例
装饰器-- 表示用于修饰 UIElement 的 FrameworkElement 的抽象类简单来说就是,在不改变一个UIElement结构的情况下,将一个Visual对象加到它上面. 应用举例: ...
iOS界面设计之基础控件的学习 --- UITextField
学习iOS界面设计也有段时间了,每次写到一些基础控件(如:UILable . UITextField)的时候就深觉应该总结一个函数来实现这些基础控件的属性设置,所以下面就是我对UITextField的 ...
【BioCode】将多个蛋白质序列分成单个的txt文档
代码说明: fasta格式的蛋白质序列,一个txt里面有很多蛋白质序列,计算ss.pssm或disorder score时候都需要单条计算,需要分开. 分割前: 分割后: show you the c ...
Halcon 笔记3 形态学
Halcon 三大数据类型: (1)图像 (2)区域 (3)XLD 查看时间工具如果想让图像减少,则进行腐蚀(或者使用开运算),反之,则进行膨胀(或闭运算) 腐蚀后再进行膨胀,相当于进行开运算.因 ...
@Resource 注解的作用【和 @Autowired 的对比】
今天看到一段代码使用的是 @Resource 的注解,的确是第一次看到这个注解,百度一查才知道,原来和 @Autowired 效果一样,但也有一定的区别. 两个注解都可以用来注入 bean ,@Res ...
【C++】深度探索C++对象模型读书笔记--关于对象（Object Lessons）
前言中的内容: 1.什么是C++对象模型? 1.语言中直接支持面向对象程序设计的部分 2. 对于各种支持的底层实现机制 2. C++ class的完整virtual functions在编译时期就固定 ...
第112天：javascript中函数预解析和执行阶段
关于javascript中的函数: 1.预解析:把所有的函数定义提前,所有的变量声明提前,变量的赋值不提前 2.执行 :从上到下执行,但有例外(setTimeout,setInterval,aja ...

[DeeplearningAI笔记]序列模型2.7负采样Negative sampling

5.2自然语言处理

觉得有用的话,欢迎一起讨论相互学习~Follow Me

2.7 负采样 Negative sampling

样本生成方法

模型学习原理

神经网络算法流程

负样本采样方法

[DeeplearningAI笔记]序列模型2.7负采样Negative sampling的更多相关文章

随机推荐

热门专题