keras使用稀疏输入进行训练

2018.06.14 12:55:46字数 902阅读 760

稀疏矩阵

稀疏矩阵是指矩阵中数值为0的元素数目远远多于非0元素的数目，在实际中遇到的大矩阵基本都是稀疏的。如果使用普通的ndarray存储稀疏矩阵，会有很大的内存浪费。在python中我们可以使用scipy中的sparse模块存储这些矩阵，但是在用keras搭建神经网络使用这些矩阵作为神经网络的输入时，则需要做一些处理才能使用sparse格式的数据。

方法一、使用keras函数式API中的参数实现

keras的Sequential顺序模型是不支持稀疏输入的，如果非要用Sequential模型，可以参考方法二。在使用函数式API模型时，Input层初始化时有一个sparse参数，用来指明要创建的占位符是否是稀疏的，如图：

Input的参数，可以用sparse来指明是否是稀疏的输入数据

在使用时也很直接，一个参数就可以搞定：

ipt_layer = Input((shape, ), sparse=True)

网络的定义过程和常规方法没有什么区别，后边compile、fit等操作也都没有变化。不过目前这么用有一个问题，就是指定的batch_size不生效，不管设置多大的batch_size，训练的时候都是按照batch_size为1来进行，可能是人家觉得都用稀疏数据了，数据肯定大到可怕，用大一些batch会引入内存问题吧。如果要使用指定的batch_size来训练稀疏数据，或者需要调整batch_size，可以参考方法二。

方法二、使用生成器方法实现

还有一种方法可以实现，是使用生成器的方法，最早看到这个方法是在stackoverflow上，参考链接

这种方法是利用生成器配合keras模型的fit_generator来实现，核心代码如下：

# batch_generator

def batch_generator(x, y, batch_size):

    number_of_batches = x.shape[0]//batch_size

    counter = 0

    shuffle_index = np.arange(x.shape[0])

    np.random.shuffle(shuffle_index)

    x = x[shuffle_index, :]

    y = y[shuffle_index, :]

    while 1:

        index_batch = shuffle_index[batch_size*counter: batch_size*(counter+1)]

        x_batch = x[index_batch, :].todense()

        y_batch = y[index_batch, :].todense()

        counter += 1

        yield(np.array(x_batch), np.array(y_batch))

        if counter >= number_of_batches:

            np.random.shuffle(shuffle_index)

            counter = 0

# fit时要先根据batch_size和样本总量计算一下总共的steps_per_epoch

train_steps = x.shape[0]//batch_size

# 在fit时使用fit_generator

model.fit_generator(generator=batch_generator(x, y, batch_size), steps_per_epoch=train_steps......)

除了生成器函数，这里需要注意的是在fit之前先要计算每个epoch需要训练多少个step。

在用这个方法进行训练的时候，对于validation数据，有几种场景区分：

如果比较大，也可以使用这个生成器，直接将fit_generator的validation_data这个参数设置为生成器并且使用对应的验证数据即可；
如果数据不大，可以选择把所有的validation数据都todense转为常规的ndarray；
另外如果在训练中使用tensorboard，并且histogram_freq参数设置不为0，那么验证数据就不能使用生成器来生成了，必须转为ndarray才可以。

方法总结

时间就是金钱，在多数场景下，推荐使用方法一，节省生命。但如果对于需要调整batch_size或者铁了头要用Sequential模型的，方法二是比较好的选择，鉴于方法二对于tensorboard不是很友好，所以建议在使用方法二的时候不要在验证集上也使用生成器。

对于稀疏的输入，上边的方法应该可以解决大部分问题了，不过有一些输出也是稀疏的情况，虽然训练过程跟着batch_size走，不会有什么影响，但在需要大规模predict的时候，比如要对几千万上亿条数据进行预测，目前还没有很好的办法能够直接输出稀疏格式存储的数据。

Keras：的更多相关文章

keras：InternalError: Failed to create session
如题,keras出现以上错误,解决办法: 找到占用gpu的进程: nvidia-smi -q 杀死这些进程即可: xxxxx
[机器学习] keras：MNIST手写数字体识别（DeepLearning 的 HelloWord程序）
深度学习界的Hello Word程序:MNIST手写数字体识别 learn from(仍然是李宏毅老师<机器学习>课程):http://speech.ee.ntu.edu.tw/~tlka ...
深度学习：Keras入门(一)之基础篇
1.关于Keras 1)简介 Keras是由纯python编写的基于theano/tensorflow的深度学习框架. Keras是一个高层神经网络API,支持快速实验,能够把你的idea迅速转换为结 ...
深度学习框架： Keras官方中文版文档正式发布
今年 1 月 12 日,Keras 作者 François Chollet‏ 在推特上表示因为中文读者的广泛关注,他已经在 GitHub 上展开了一个 Keras 中文文档项目.而昨日,Françoi ...
深度学习：Keras入门(一)之基础篇【转】
本文转载自:http://www.cnblogs.com/lc1217/p/7132364.html 1.关于Keras 1)简介 Keras是由纯python编写的基于theano/tensorfl ...
深度学习：Keras入门(一)之基础篇（转）
转自http://www.cnblogs.com/lc1217/p/7132364.html 1.关于Keras 1)简介 Keras是由纯python编写的基于theano/tensorflow的深 ...
【TensorFlow 3】mnist数据集：与Keras对比
在TF1.8之后Keras被当作为一个内置API:tf.keras. 并且之前的下载语句会报错. mnist = input_data.read_data_sets('MNIST_data',one_ ...
安装Keras
在cmd窗口运行代码: pip install keras -U --pre 安装Keras: 进入Python环境,运行import keras,检验是否成功安装.
学习笔记TF054:TFLearn、Keras
元框架(metaframework). TFLearn.模块化深度学习框架,更高级API,快速实验,完全透明兼容. TFLearn实现AlexNet.https://github.com/tflear ...

随机推荐

SP1043 GSS1 - Can you answer these queries I 线段树
问题描述 LG-SP1043 题解 GSS 系列第一题. $q$ 个询问,求 $[x,y]$ 的最大字段和. 线段树,维护 $[x,y]$ 的 $lmax,rmax,sum,val$ ...
WPF DataGrid 绑定数据及时更新的处理
原文:WPF DataGrid 绑定数据及时更新的处理默认情况下datagrid 绑定数据源后,在界面编辑某一列后,数据不会及时更新到内存对象中.如在同一行上有一个命令对来获取当前选中行(内存对象 ...
console调试技巧
1.console.log() 我们经常会使用console.log来打印出某个变量的值或者某个实体对象,也可以传入多个变量参数,它会按照传入顺序进行打印: 1. 传入一个变量 const a = 1 ...
Tomcat 设置JVM内存大小
我的服务器的配置: # OS specific support. $var _must_ be set to either true or false. JAVA_OPTS="-Xms10 ...
Ubuntu 16.04 + Realsense D435i + ROS 环境配置
参考: [1] Realsense-Ros: https://github.com/IntelRealSense/realsense-ros#installation-instructions [2] ...
遍历json数据的几种方式
json(JavaScript Object Notation),json是一种多用于存储和交换文本信息的语法.他能够进行数据的传输,通常和ajax一起使用.它具有体积小.速度快,易解析等诸多优点. ...
rsync免交互方法
添加-e "ssh -o StrictHostKeyChecking=no" rsync -avzP -e "ssh -o StrictHostKeyChecking=n ...
Token ，Cookie、Session傻傻分不清楚？
作者 | 王菜鸟1993 来源 | cnblogs.com/JamesWang1993/p/8593494.html 在做接口测试时,经常会碰到请求参数为token的类型,但是可能大部分测试人员对to ...
oracle学习笔记（九） SQL常用函数说明以及使用
SQL常用函数说明以及使用以下补充以下常用的函数,更多的请看oracle函数API文档 to_char to_char(8.58,'9.99') to_char(8.50,'9.00') to_ch ...
ASP.Net MVC 路由及路由调试工具RouteDebug
一.路由规则 1.可以创建多条路由规则,每条路由的name属性不相同 2.路由规则有优先级,最上面的路由规则优先级越高 App_Start文件下的:RouteConfig.cs public stat ...

Keras：