Task

Sample Baseline模型介绍

class Classifier(nn.Module):

	def __init__(self, d_model=80, n_spks=600, dropout=0.1):

		super().__init__()

		# Project the dimension of features from that of input into d_model.

		self.prenet = nn.Linear(40, d_model)

		# transformer

		self.encoder_layer = nn.TransformerEncoderLayer(

			d_model=d_model, dim_feedforward=256, nhead=2

		)

		self.encoder = self.encoder_layer

		self.pred_layer = nn.Sequential(

			nn.Linear(d_model, d_model),

			nn.ReLU(),

			nn.Linear(d_model, n_spks),

		)

	def forward(self, mels):

		"""

		args:

			mels: (batch size, length, 40)

		return:

			out: (batch size, n_spks)

		"""

		# out: (batch size, length, d_model)

		out = self.prenet(mels)

		# out: (length, batch size, d_model)

		out = out.permute(1, 0, 2)

		# The encoder layer expect features in the shape of (length, batch size, d_model).

		out = self.encoder(out)

		# out: (batch size, length, d_model)

		out = out.transpose(0, 1)

		# mean pooling

		stats = out.mean(dim=1)

		# out: (batch, n_spks)

		out = self.pred_layer(stats)

		return out

模型开始对特征进行了升维以增强表示能力，随后通过transformer的encoder对数据进一步编码(未使用decoder)，到这一步就包含了原来没有包含的注意力信息，以英文Sequence为例，如果原来的Sequence中每个单词是独立编码的是没有任何关联的，那么经过这一步之后，每一个单词的编码都是由其他单词编码的叠加而成。最后通过pred_layer进行预测(当然在此之前进行了一个mean pooling，这个下面会讲)。

在模型的前向传播时，模型基本是安装前面定义的各层进行计算的，我们注意到在给encoder的输入时，维度的顺序为(length，batch_size, d_model)，而不是(batch_size, length, d_model)，实际上这是为了并行计算?

下图是batch_first时所对应的存储顺序

下图时length_first时所对应的存储顺序

在其他时序模型中，由于需要按序输入，因此直接拿到一个sequence没啥用，不如直接得到一批batch中的所有sequence中的第一个语音序列或单词，但是在transformer中应该不需要这样吧？

另外一个小细节是进行mean pooling

stats = out.mean(dim=1)

这一步是不必可少的，不然没法输入pred_layer，这里做mean的意思是把每个sequence的所有frame通过平均合并为一个frame，如下图所示

维度由batch_size\(\times\)length\(\times\)d_model变成了batch_size\(\times\)d_model

Medium Baseline

对于medium baseline，只需要调节视频中提示的地方进行修改即可，我的得分如下：

相关参数如下

d_model=120

4个encoder_layer的nhead=4

Strong Baseline

对于strong baseline，需要引入conformer架构，我的得分如下：

而conformer的引入需要注意以下几点：

引入(当然你也可以使用pip进行单独安装)

from torchaudio.models.conformer import Conformer

由于torchaudio中实现的conformer默认是batch_first，因此在代码中我们需要去掉下面两行

out = out.permute(1, 0, 2)

out = out.transpose(0, 1)

Boss Baseline

引入self-attention pooling和additive margin softmax后，准确率下降了。

李宏毅2022机器学习HW4 Speaker Identification下的更多相关文章

李宏毅老师机器学习课程笔记_ML Lecture 3-1: Gradient Descent
引言: 这个系列的笔记是台大李宏毅老师机器学习的课程笔记视频链接(bilibili):李宏毅机器学习(2017) 另外已经有有心的同学做了速记并更新在github上:李宏毅机器学习笔记(LeeML- ...
Python 机器学习实战 —— 监督学习（下）
前言近年来AI人工智能成为社会发展趋势,在IT行业引起一波热潮,有关机器学习.深度学习.神经网络等文章多不胜数.从智能家居.自动驾驶.无人机.智能机器人到人造卫星.安防军备,无论是国家级军事设备还是 ...
李宏毅老师机器学习课程笔记_ML Lecture 2: Where does the error come from?
引言: 最近开始学习"机器学习",早就听说祖国宝岛的李宏毅老师的大名,一直没有时间看他的系列课程.今天听了一课,感觉非常棒,通俗易懂,而又能够抓住重点,中间还能加上一些很有趣的例子 ...
李宏毅老师机器学习课程笔记_ML Lecture 1: ML Lecture 1: Regression - Demo
引言: 最近开始学习"机器学习",早就听说祖国宝岛的李宏毅老师的大名,一直没有时间看他的系列课程.今天听了一课,感觉非常棒,通俗易懂,而又能够抓住重点,中间还能加上一些很有趣的例子 ...
李宏毅老师机器学习课程笔记_ML Lecture 1: 回归案例研究
引言: 最近开始学习"机器学习",早就听说祖国宝岛的李宏毅老师的大名,一直没有时间看他的系列课程.今天听了一课,感觉非常棒,通俗易懂,而又能够抓住重点,中间还能加上一些很有趣的例子 ...
李宏毅老师机器学习课程笔记_ML Lecture 0-2: Why we need to learn machine learning?
引言: 最近开始学习"机器学习",早就听说祖国宝岛的李宏毅老师的大名,一直没有时间看他的系列课程.今天听了一课,感觉非常棒,通俗易懂,而又能够抓住重点,中间还能加上一些很有趣的例子 ...
李宏毅老师机器学习课程笔记_ML Lecture 0-1: Introduction of Machine Learning
引言: 最近开始学习"机器学习",早就听说祖国宝岛的李宏毅老师的大名,一直没有时间看他的系列课程.今天听了一课,感觉非常棒,通俗易懂,而又能够抓住重点,中间还能加上一些很有趣的例子 ...
机器学习之神经网络模型-下（Neural Networks: Representation）
3. Model Representation I 1 神经网络是在模仿大脑中的神经元或者神经网络时发明的.因此,要解释如何表示模型假设,我们不妨先来看单个神经元在大脑中是什么样的. 我们的大脑中充满 ...
Andrew Ng机器学习课程笔记--week5(下)
Neural Networks: Learning 内容较多,故分成上下两篇文章. 一.内容概要 Cost Function and Backpropagation Cost Function Bac ...
机器学习模型从windows下 spring上传到预发布会导致模型不可加载
1.通过上传到redis,程序通过redis拉取模型,解决问题. 2.问题原因初步思考为windows下模型文件上传到 linux导致,待继续跟进查找.

随机推荐

echarts更改x和y轴的颜色
<!DOCTYPE html> <html> <head> <meta charset="utf-8"> <title> ...
装elemnetUI中用户头像上传
组件.vue 在使用的时候,入股想出现边框.要自己在添加一个类哈自己还有在添加一个哈 .avatar-uploader { border:1px solid red; width: 178px; h ...
Java21 + SpringBoot3整合springdoc-openapi，自动生成在线接口文档，支持SpringSecurity和JWT认证方式
目录前言相关技术简介 OpenAPI Swagger Springfox springdoc swagger2与swagger3常用注解对比实现步骤引入maven依赖修改配置文件设置api ...
教你用JavaScript实现背景图像滑动
案例介绍欢迎来到我的小院,我是霍大侠,恭喜你今天又要进步一点点了!我们来用JavaScript编程实战案例,做一个背景图像滚动效果.滚动鼠标背景图像缩小,下方滑动出现文字.通过实战我们将学会obj. ...
Typora Mac中文破解版获取
作为程序员,markdown是非常好用的文本编辑语言,而Typora是非常好用的一款markdown编辑工具.Typora提供读者和作家的无缝体验.它删除了预览窗口,模式切换器,降低源代码的语法符号以 ...
关于一些OJ上的\r以及\n以及字符串行输入的一些警示
\r,\n,\r\n的区别 - 小天 - 博客园 (cnblogs.com) 这篇文章详细的解释了在Windows系统和Linux系统下的换行的区别概括的说,就是Windows系统下的" ...
ASP.NET Core分布式项目实战（Identity Server 4回顾，Consent 实现思路介绍）--学习笔记
任务17:Identity Server 4回顾上一节我们中间留了一部分,登录之后的 RequireConsent,就是用户授权这一步没有做,直接跳过,这种情况可以理解为我们自己比较信任的客户端,这 ...
HBase-Hbase启动异常java.lang.IllegalArgumentException: object is not an instance of declaring class
1.问题描述 HBase启动时异常如下: java.lang.IllegalArgumentException: object is not an instance of declaring clas ...
Linux-数据集 TPC-H、TPC-DS的导入和使用（MySQL）
一. TPC-H 数据集 1.数据集下载 TPC-H数据集: https://github.com/gregrahn/tpch-kit 可采用gcc下载或者直接下载zip包,然后解压即可. 具体使用方 ...
【简写MyBatis】01-简单映射器
前言新开一个坑,为了学习一下MyBatis的源码,写代码是次要的,主要为了吸收一下其中的思想和手法. 目的关联对象接口和映射类的问题,把 DAO 接口使用代理类,包装映射操作. 知识点动态代理 ...

李宏毅2022机器学习HW4 Speaker Identification下