Journal of Proteome Research | Clinically Applicable Deep Learning Algorithm Using Quantitative Proteomic Data (分享人:翁海玉)
题目:Clinically Applicable Deep Learning Algorithm Using Quantitative Proteomic Data
期刊:Journal of Proteome Research
发表时间:August 2, 2019
DOI:: 10.1021/acs.jproteome.9b00268
分享人:翁海玉
内容与观点:
本研究描述了一种优化的基于深度学习(DL)的胰腺癌诊断方法并测试了该方法的分类能力。
1、实验设计
1.1数据集构建:该方法使用1008个样本的选择反应监测-质谱(SRM - MS)数据集,SRM-MS在血浆样本中检测出34种多肽(由34个蛋白衍生而来)。数据集包括300个正常人样本(NC),109个胰腺癌良性样本(PB),49个其他良性样本(OB),149个其他癌症样本(OC),和401个胰腺癌样本(PDAC)。按照0.7:0.3的比例将数据集分为训练集(691 samples; 322 PDAC, 41 OB, 88 PB, and 240 NC)和测试集(317 samples; 79 PDAC, 8 OB, 149 OC, 21 PB, and 60 NC),保持内部比例不变。其中OC只在测试集中有,以确定是否构建的模型会受到癌症异质性影响。
为了算法能够表现出鉴别胰腺癌的能力,数据集被重新构建为控制组(NC+PB+OB+OC),病例组(PDAC)。
1.2 DL模型训练和参数优化:采用十倍交叉验证的方法对训练数据集进行处理,避免了抽样偏差。每次迭代从子训练数据集中随机抽取约622个数据点(691*0.9)输入模型;其余69个值(691*0.1)作为子测试数据集,用于评估模型中的误差,同时对每个选定的数据点(分层抽样)保持对照组和病例组的比例相等。为了构造该模型,我们采用逐步逼近的方法来减少测试所有可能特征集的计算量。
利用训练数据集对模型进行微调,优化参数。然后在独立的测试数据集上对训练后的模型进行测试,并对其分类性能进行评估。利用独立的测试数据集进一步验证了模型的性能。利用测试数据集的性能来指导参数的优化。为了减少样本选择偏差和模型过拟合的可能性,除了交叉验证外,还进行了bootstrapping验证。
训练和测试数据集使用v3.10.3.6版本的H2O软件包进行处理。DL方法对10个最重要的参数纪元数(number of epochs)、节点数和隐层数(number of nodes and hidden layers)、激活函数(activation function)、rho、epsilon、L1 & L2正则化(L1 & L2 regularization)、隐藏丢失率(hidden dropout ratio)、输入丢失率(input dropout ratio)、每次迭代训练样本(train samples per iteration)、最大w2(max w2)。同时进行网格搜索来优化每个参数的值。并使用每个参数的常用值对它们逐一进行了优化,以此确定重要参数。
1.3 五种传统机器学习模型参数优化:对在蛋白质组学应用最广泛的五种机器学习模型:随机森林(RF)、支持向量机(SVM),逻辑回归(LR),K近邻(KNN)和贝叶斯(NB)建模,训练和测试数据集的处理与DL方法相同。用网格搜索,对5种方法中的参数进行调优。
1.4 DL与传统模型比较:
采用了五种传统的模型性能指标:查全率、精密度、F1评分、精密度和工作特性曲线下面积(AUROC):
Recall= 
Precision= 
F1 score= 
Accuracy= 
AUROC通过测量这个图的recall和FDR来构建AUROC曲线,其中1.0表示完全分离,0.5表示随机分类。如图:

Figure 1 完整实验过程
2、结果
2.1 DL参数优化:10个参数中 epoch, activation function, epsilon, input dropout ratio影响DL模型的分类模型(Figure 2 ),如图,选择了AUROC最大时的值为参数值。

Figure 2 DL参数优化
2.2 DL与传统机器学习模型比较:
各个指标都有明显提升,如下图:

Figure 3 六个模型的性能参数柱状图
3、结论
研究结果表明,DL是蛋白组学数据生物标志物确认的有力工具。在临床实验室中,DL有提高疾病分类任务的标准化和内部可靠性的潜力。未来的工作应该优化其在临床环境中的表现,以充分利用DL方法作为临床工具。
4、讨论
虽然DL各个性能指标都远远高于传统方法,但其仍然存在耗时长,电脑硬件要求高,需要更多的特征和样本的数据集等局限,尤其受到质疑的是,DL是一个黑盒子,难以给出内部过程。但本文向我们展示了DL的潜力。相信DL预测不同群体的高精度的能力将产生全新的数据处理选项,支持和加强未来基于蛋白组学的生物标志物研究。
Journal of Proteome Research | Clinically Applicable Deep Learning Algorithm Using Quantitative Proteomic Data (分享人:翁海玉)的更多相关文章
- Journal of Proteome Research | Improving Silkworm Genome Annotation Using a Proteogenomics Approach (分享人:张霞)
题目:Improving Silkworm Genome Annotation Using a Proteogenomics Approach 期刊:Journal of Proteome Resea ...
- Integrative Analysis of MicroRNAome, Transcriptome, and Proteome during the Limb Regeneration of Cynops orientalis (文献分享一组-翁海玉)
文献名:Integrative Analysis of MicroRNAome, Transcriptome, and Proteome during the Limb Regeneration of ...
- Journal of Proteome Research | 人类牙槽骨蛋白的蛋白质组学和n端分析:改进的蛋白质提取方法和LysargiNase消化策略增加了蛋白质组的覆盖率和缺失蛋白的识别 | (解读人:卜繁宇)
文献名:Proteomic and N-Terminomic TAILS Analyses of Human Alveolar Bone Proteins: Improved Protein Extr ...
- Journal of Proteome Research | SAAVpedia: identification, functional annotation, and retrieval of single amino acid variants for proteogenomic interpretation | SAAV的识别、功能注释和检索 | (解读人:徐洪凯)
文献名:SAAVpedia: identification, functional annotation, and retrieval of single amino acid variants fo ...
- Journal of Proteome Research | iHPDM: In Silico Human Proteome Digestion Map with Proteolytic Peptide Analysis and Graphical Visualizations(iHPDM: 人类蛋白质组理论酶解图谱的水解肽段分析和可视化展示)| (解读人:邓亚美)
文献名:iHPDM: In Silico Human Proteome Digestion Map with Proteolytic Peptide Analysis and Graphical Vi ...
- Journal of Proteome Research | Down-Regulation of a Male-Specific H3K4 Demethylase, KDM5D, Impairs Cardiomyocyte Differentiation (男性特有的H3K4脱甲基酶基因(KDM5D)下调会损伤心肌细胞分化) | (解读人:徐宁)
文献名:Down-Regulation of a Male-Specific H3K4 Demethylase, KDM5D, Impairs Cardiomyocyte Differentiatio ...
- Journal of Proteome Research | Quantitative Subcellular Proteomics of the Orbitofrontal Cortex of Schizophrenia Patients (精神分裂症病人眶额叶皮层亚细胞结构的定量蛋白质组学研究)(解读人:王聚)
期刊名:Journal of Proteome Research 发表时间:(2019年10月) IF:3.78 单位: 里约热内卢联邦大学 坎皮纳斯州立大学 坎皮纳斯州立大学神经生物学中心 卡拉博大 ...
- Journal of Proteome Research | Proteomic Profiling of Rhabdomyosarcoma-Derived Exosomes Yield Insights into Their Functional Role in Paracrine Signaling (解读人:孙国莹)
文献名:Proteomic Profiling of Rhabdomyosarcoma-Derived Exosomes Yield Insights into Their Functional Ro ...
- Journal of Proteome Research | Global Proteomic Analysis of Lysine Succinylation in Zebrafish (Danio rerio) (解读人:关姣)
文献名:Global Proteomic Analysis of Lysine Succinylation in Zebrafish (Danio rerio)(斑马鱼赖氨酸琥珀酰化的全球蛋白质组学分 ...
随机推荐
- unicode编码与解码
unicode编码与解码,代码如下 package com.fenqiguanjia.api.services; /** * Created by daixianjun on 2017/9/3. */ ...
- Linux命令alias - 设置命令的别名
用途说明设置命令的别名.在linux系统中如果命令太长又不符合用户的习惯,那么我们可以为它指定一个别名.虽然可以为命令建立“链接”解决长文件名的问题,但对于带命令行参数的命令,链接就无能为力了.而指定 ...
- CentOS7安装Ceph
CentOS 7 下安装Ceph-nautilus 本问主要记录在CentOS 7下如何安装Ceph-nautilus,安装过程中遇到的一些问题及解决方法. 实验准备 以下是本次实验所用到的机器(采用 ...
- Opengl-法线贴图(用来细化表面的表现表现的凹凸)
我们通过这张图可以看出来,使用了法线贴图的物体表面更有细节更逼真,其实这就是发现贴图的作用,没什么钻牛角尖的. 其实表面没有凹凸的情况是因为我们把表面一直按照平整来做的,要想突出这个表面的凹凸就要用到 ...
- C++ 迷宫寻路问题
迷宫寻路应该是栈结构的一个非常经典的应用了, 最近看数据结构算法应用时看到了这个问题, 想起来在校求学时参加算法竞赛有遇到过相关问题, 感觉十分亲切, 在此求解并分享过程, 如有疏漏, 欢迎指正 问题 ...
- OpenCV3入门(十二)角点检测
1.角点介绍 角点检测(Corner Detection)是计算机视觉系统中用来获得图像特征的一种方法,广泛应用于运动检测.图像匹配.视频跟踪.三维建模和目标识别等领域中,也称为特征点检测.在图像中角 ...
- js判断PC端还是移动端的代码小坑
我在写官网的时候做了pc和移动端两个,在通过网上查找了这样的代码,看着完全没问题,等放进去页面中后,PC端页面一直刷新,根本停不下来,找了类似js还是同样的问题.通过不断尝试后才发现,问题就是多了一行 ...
- JavaScript 工作原理之十三-CSS 和 JS 动画底层原理及如何优化其性能
原文请查阅这里,本文采用知识共享署名 4.0 国际许可协议共享,BY Troland. 本系列持续更新中,Github 地址请查阅这里. 这是 JavaScript 工作原理的第十三章. 概述 正如你 ...
- 前端每日实战:42# 视频演示如何用纯 CSS 创作一个均衡器 loader 动画
效果预览 按下右侧的"点击预览"按钮可以在当前页面预览,点击链接可以全屏预览. https://codepen.io/comehope/pen/oybWBy 可交互视频教程 此视频 ...
- VUE实现Studio管理后台(十):OptionBox,一个综合属性输入界面,可以级联重置
为了便于阅读代码,已经把测试数据分离出来,放在了mock目录下: 阅读代码的话,稍微留意一下就好.本次介绍RXEditor界面最重要的部分,属性输入组件,该组件可以显示是否有数据被修改,还可以批量重置 ...