python numpy 三行代码打乱训练数据

今天发现一个用 numpy 随机化数组的技巧。

需求

我有两个数组（ ndarray ）：train_datasets 和 train_labels。其中，train_datasets 的每一行和 train_labels 是一一对应的。现在我要将数组打乱并用于训练，打乱后要求两者的行与行之间必须保持原来的对应关系。

实现

一般的实现思路，应该是先将 train_datasets（或 train_labels ）打乱，并记录被打乱的行号，再通过行号调整 train_labels （或 train_datasets ）的行次序，这样两者的对应关系能保持一致。但代码实现起来会很繁琐，而如果用上 numpy 的话，可以三行代码搞定。

首先，假设我们用如下训练数据（训练数据和标签都是三个）：

>>> train_data = np.ndarray(shape=(3,1,2), dtype=np.int32, buffer=np.asarray((1,2,3,4,5,6), dtype=np.int32))

>>> train_label  = np.ndarray(shape=(3,), dtype=np.int32, buffer=np.asarray((1,2,3), dtype=np.int32))

>>> train_data

array([[[1, 2]],

       [[3, 4]],

       [[5, 6]]], dtype=int32)

>>> train_label

array([1, 2, 3], dtype=int32)

下面，我们用三行代码打乱样本数据：

>>> permutation = np.random.permutation(train_label.shape[0])

>>> shuffled_dataset = train_data[permutation, :, :]

>>> shuffled_labels = train_label[permutation]

稍微解释一下代码：

利用 np.random.permutation 函数，我们可以获得打乱后的行号，输出permutation 为：array([2, 1, 0])。

然后，利用 numpy array 内置的操作 train_data[permutation, :, :] ，我们可以获得打乱行号后的新的训练数据。

我们看看训练数据和标签是不是对应的：

>>> shuffled_dataset

array([[[5, 6]],

       [[3, 4]],

       [[1, 2]]], dtype=int32)

>>> shuffled_labels

array([3, 2, 1], dtype=int32)

没错，完全按照 permutation [2, 1, 0] 的顺序重新调整了。

学会这种技巧，妈妈再也不担心我加班了

python numpy 三行代码打乱训练数据的更多相关文章

GitHub上YOLOv5开源代码的训练数据定义
GitHub上YOLOv5开源代码的训练数据定义代码地址:https://github.com/ultralytics/YOLOv5 训练数据定义地址:https://github.com/ultr ...

caffe 中如何打乱训练数据
第一: 可以选择在将数据转换成lmdb格式时进行打乱: 设置参数--shuffle=1:(表示打乱训练数据) 默认为0,表示忽略,不打乱. 打乱的目的有两个:防止出现过分有规律的数据,导致过拟合或者不 ...

python之三行代码发送邮件
(1)首先进入cmd,输入pip install yagmail (2)思路:1 .连接服务器:yagmail.SMTP(邮箱账号,邮箱密码,邮箱服务器地址,邮箱服务器端口) 2 .准备正文内容:co ...

Python/Numpy大数据编程经验
Python/Numpy大数据编程经验 1.边处理边保存数据,不要处理完了一次性保存.不然程序跑了几小时甚至几天后挂了,就啥也没有了.即使部分结果不能实用,也可以分析程序流程的问题或者数据的特点. ...

Python Numpy中数据的常用的保存与读取方法
在经常性读取大量的数值文件时(比如深度学习训练数据),可以考虑现将数据存储为Numpy格式,然后直接使用Numpy去读取,速度相比为转化前快很多. 下面就常用的保存数据到二进制文件和保存数据到文本文件 ...

代码备份：处理　SUN397 的代码，将其分为　80% 训练数据　以及　20% 的测试数据
处理SUN397 的代码,将其分为80% 训练数据以及20% 的测试数据 2016-07-27 1 %% Code for Process SUN397 Scene Classification 2 ...

Liblinear and Libsvm-rank训练数据的bash代码
Liblinear and Libsvm-rank训练数据的bash代码: for j in "amazon_mp3" "video_surveillance" ...

python 三行代码实现快速排序
python 三行代码实现快速排序最近在看 python cookbook , 里面的例子很精彩,这里就帮过来,做个备忘录主要利用了行数的递归调用和Python的切片特性,解释一下每行代码的含义: ...

Python 入门之代码块、小数据池与深浅拷贝
Python 入门之代码块.小数据池与深浅拷贝 1.代码块 (1)一个py文件,一个函数,一个模块,终端中的每一行都是代码块 (代码块是防止我们频繁的开空间降低效率设计的,当我们定一个变量需要开辟 ...

随机推荐

mysql加速source导入数据
mysql加速source导入数据 # 进入mysql中执行如下 ; ; ; ; -- 你的sql语句1 -- 你的sql语句2 -- 你的sql语句3 ; ; ; ;

Pyhton对象解释
python的docstring提供了对每一个类.函数.方法的解释,在他们的定义下面可以有一行Python的标准字符串,该行字符串需要和下面的代码一样的缩进. docstring可以用单引号(')或者 ...

Linux系统CPU相关信息查询
Linux系统CPU相关信息查询作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 一.lscpu常用参数介绍 1>.查看帮助信息 [root@node105 ~]# lscpu ...

Java并发注解Annotation
Java并发编程中,用到了一些专门为并发编程准备的 Annotation. 主要包括三类: 1.类 Annotation(注解) 就像名字一样,这些注解是针对类的.主有要以下三个: @Immutabl ...

xml实体注入学习
好久没学习技术了很多东西都忘了复习一下测试代码 <?php $xml = file_get_contents("php://input"); $data = sim ...

HDU - 6444 Neko's loop(循环节+最大子段和)
http://acm.hdu.edu.cn/showproblem.php?pid=6444 题意一个有n个数的环,每次循环走k步,走到每个点都有具体的权值,问在任意点出发最多走m步的情况下,一开始 ...

HDU - 6315(2018 Multi-University Training Contest 2) Naive Operations (线段树区间操作)
http://acm.hdu.edu.cn/showproblem.php?pid=6315 题意 a数组初始全为0,b数组为1-n的一个排列.q次操作,一种操作add给a[l...r]加1,另一种操 ...

LeetCode（192. Word Frequency）
192. Word Frequency Write a bash script to calculate the frequency of each word in a text file words ...

关于selenium的那些坑
selenium 辅助工具 splinter 总有人看不明白,以防万一,先在开头大写加粗说明一下: frameset不用切,frame需层层切! 很多人在用selenium定位页面元素的时候会遇到定位 ...

ArcGis Python脚本——要素图斑自动编号，自上而下，从左到右
原理: 利用图斑最小外包矩形的左上角坐标(数学坐标)Y坐标将序.X坐标升序的方式获取自上而下,从左到右的要素记录排序,然后遍历编号. "!shape.extent.xmin!"计算 ...

python numpy 三行代码打乱训练数据

需求

实现

python numpy 三行代码打乱训练数据的更多相关文章

随机推荐

热门专题