机器学习入门-数值特征-数字映射和one-hot编码 1.LabelEncoder(进行数据自编码) 2.map(进行字典的数字编码映射) 3.OnehotEncoder(进行one-hot编码) 4.pd.get

1.LabelEncoder() # 用于构建数字编码

2 .map(dict_map) 根据dict_map字典进行数字编码的映射

3.OnehotEncoder() # 进行one-hot编码，输入的参数必须是二维的，因此需要做reshape,同时使用toarray() 转换为列表形式

3 pd.get_dummies（feature，drop_first=False）如果填单个特征的话，只对一个特征做one-hot编码映射， drop_first表示去除one-hot编码后的第一列数据

对于一些离散的文本标签，通常我们可以使用两种编码方式

比如存在['小明', '小红’, '小花', '小明']

数字编码：

对于数字映射的编码方式，存在一个编码映射表：比如{‘小明’: 0, '小红': 1, '小花': 2}

那么上述的特征可以通过数字编码映射为[0, 1, 2, 1]

one-hot编码：

对于one-hot编码而言：通常使用特征作为列名，如果存在该特征，对应的列名为1，其他列名为0

即上述的one-hot编码的结果为

小明小红小花

0 1 0 0

1 0 1 0

2 0 0 1

3 1 0 0

代码：

数字编码：

第一种方法：导入LabelEncoder() 进行编码:

第二种方式：构建数字映射字典，使用.map完成映射

one-hot编码：

第一种方法：使用OnehotEncoder()，对某列样本特征进行编码，使用toarray()获得列表的格式，构建字典，变换为DataFrame格式，通过pd.concat([], axis=1) 完成DataFrame格式的拼接

第二种方法：导入pd.get_dummies(feature, drop_first=False) 对某一列文本特征进行onehot编码的映射，使用pd.concat完成DataFrame格式的拼接，如果不填参单个特征，将对所有的文本特征都进行onehot编码操作

import numpy as np

import pandas as pd

vg_df = pd.read_csv('datasets/vgsales.csv', encoding = "ISO-8859-1")

# print(vg_df[['Name', 'Platform', 'Year', 'Genre', 'Publisher']].iloc[1:7])

# 第一种方法数字映射编码方式：

# 使用LabelEncoder() 进行编码

from sklearn.preprocessing import LabelEncoder

Gen_encode = LabelEncoder()

Gen_labels = Gen_encode.fit_transform(vg_df['Genre'])

Gen_map = {encode: label for label, encode in enumerate(Gen_encode.classes_)}

print(Gen_map)

vg_df['Genre_en'] = Gen_labels

print(vg_df[['Name', 'Platform', 'Year', 'Genre', 'Genre_en']].iloc[1:7])

# 第二种方法:使用map进行直接的数字编码映射

map_dict = {'Action': 0, 'Adventure': 1, 'Fighting': 2, 'Misc': 3, 'Platform': 4, 'Puzzle': 5, 'Racing': 6, 'Role-Playing': 7, 'Shooter': 8, 'Simulation': 9, 'Sports': 10, 'Strategy': 11}

vg_df['Genre_en'] = vg_df['Genre'].map(map_dict)

print(vg_df[['Name', 'Platform', 'Year', 'Genre', 'Genre_en']].iloc[1:7])

# One-hot编码方式

# 第一种方式

# 使用onehot对离散值进行编码，使用的是OneHotEncoder

from sklearn.preprocessing import OneHotEncoder, LabelEncoder

One_encode = OneHotEncoder()

label_encode = LabelEncoder()

poke_df = pd.read_csv('datasets/Pokemon.csv', encoding='utf-8')

# 将数据进行打乱

poke_df = poke_df.sample(frac=1, random_state=1).reset_index(drop=False)

label_classes = label_encode.fit_transform(poke_df['Generation'])

# 打印出类别

print(label_encode.classes_)

One_val = One_encode.fit_transform(poke_df['Generation'].values.reshape(-1, 1)).toarray()

One_dict_encode = {label_encode.classes_[j]: One_val[:, j] for j in range(len(label_encode.classes_))}

One_pd_encode = pd.DataFrame(One_dict_encode)

print(One_pd_encode)

# 将两个pd进行组合

poke_df[One_pd_encode.columns] = One_pd_encode[One_pd_encode.columns]

Leg_label = label_encode.fit_transform(poke_df['Legendary'])

Leg_classes = label_encode.classes_

Leg_one = One_encode.fit_transform(poke_df['Legendary'].values.reshape(-1, 1)).toarray()

# 作为每一列的类名

Leg_name = ['Leg_'+str(Leg_class) for Leg_class in Leg_classes]

Leg_dict = {Leg_name[j]:Leg_one[:, j] for j in range(len(Leg_name))}

Leg_pd = pd.DataFrame(Leg_dict)

# 使用pd.concat也可以进行组合

poke_df = pd.concat([poke_df, Leg_pd], axis=1)

# poke_df[Leg_pd.columns] = Leg_pd[Leg_pd.columns]

print(poke_df.head())

# 使用onehot编码的第二种方法:使用pd.get_dummies

poke_df = pd.read_csv('datasets/Pokemon.csv', encoding='utf-8')

poke_dummy_feature = pd.get_dummies(poke_df['Generation'], drop_first=True)

poke_df = pd.concat([poke_df, poke_dummy_feature], axis=1)

print(poke_df.head())

机器学习入门-数值特征-数字映射和one-hot编码 1.LabelEncoder(进行数据自编码) 2.map(进行字典的数字编码映射) 3.OnehotEncoder(进行one-hot编码) 4.pd.get_dummies(直接对特征进行one-hot编码)的更多相关文章

机器学习入门-数值特征-数据四分位特征 1.quantile(用于求给定分数位的数值) 2.plt.axvline(用于画出竖线) 3.pd.pcut(对特征进行分位数切分，生成新的特征)
函数说明: 1. .quantile(cut_list) 对DataFrame类型直接使用,用于求出给定列表中分数的数值,这里用来求出4分位出的数值 2. plt.axvline() # 用于画 ...
机器学习入门-数值特征-进行多项式变化(将特征投影到高维度上) 1.PolynomialFeatures(将数据变化为多项式特征)
函数说明: 1. PolynomialFeatures(degree=2, interaction_only=False, include_bias=False) 参数说明:degree=2,表示多项 ...
机器学习入门-数值特征-对数据进行log变化
对于一些标签和特征来说,分布不一定符合正态分布,而在实际的运算过程中则需要数据能够符合正态分布因此我们需要对特征进行log变化,使得数据在一定程度上可以符合正态分布进行log变化,就是对数据使用n ...
机器学习入门-数值特征-连续数据离散化(进行分段标记处理) 1.hist(Dataframe格式直接画直方图)
函数说明: 1. .hist 对于Dataframe格式的数据,我们可以使用.hist直接画出直方图对于一些像年龄和工资一样的连续数据,我们可以对其进行分段标记处理,使得这些连续的数据变成离散化就 ...
机器学习入门-数值特征-进行二值化变化 1.Binarizer(进行数据的二值化操作)
函数说明: 1. Binarizer(threshold=0.9) 将数据进行二值化,threshold表示大于0.9的数据为1,小于0.9的数据为0 对于一些数值型的特征:存在0还有其他的一些数二 ...
机器学习入门-随机森林温度预测的案例 1.datetime.datetime.datetime(将字符串转为为日期格式) 2.pd.get_dummies(将文本标签转换为one-hot编码) 3.rf.feature_importances_(研究样本特征的重要性) 4.fig.autofmt_xdate(rotation=60) 对标签进行翻转
在这个案例中: 1. datetime.datetime.strptime(data, '%Y-%m-%d') # 由字符串格式转换为日期格式 2. pd.get_dummies(features) ...
机器学习入门 - Google机器学习速成课程 - 笔记汇总
机器学习入门 - Google机器学习速成课程 https://www.cnblogs.com/anliven/p/6107783.html MLCC简介前提条件和准备工作完成课程的下一步机器学 ...
机器学习入门-随机森林温度预测-增加样本数据 1.sns.pairplot(画出两个关系的散点图) 2.MAE(平均绝对误差) 3.MAPE(准确率指标)
在上一个博客中,我们构建了随机森林温度预测的基础模型,并且研究了特征重要性. 在这个博客中,我们将从两方面来研究数据对预测结果的影响第一方面:特征不变,只增加样本的数据第二方面:增加特征数,增加样 ...
Pythoncookbook（数据结构与算法）在字典中将键映射到多个值上的方法
Python cookbook(数据结构与算法)在字典中将键映射到多个值上的方法本文实例讲述了Python在字典中将键映射到多个值上的方法.分享给大家供大家参考,具体如下: 问题:一个能将键(key ...

随机推荐

Codeforces Round #243 (Div. 2)——Sereja and Swaps
版权声明:本文为博主原创文章,未经博主同意不得转载. https://blog.csdn.net/u012476429/article/details/24665103 题目链接题意: 给定一个整数 ...
ASP.NET 5 & MVC6系列教程
本系列的大部分内容来自于微软源码的阅读和网络,大部分测试代码都是基于VS RC版本进行测试的. 解读ASP.NET 5 & MVC6系列(1):ASP.NET 5简介解读ASP.NET 5 ...
HTML/CSS/Javascript代码在线压缩、格式化(美化)工具
CSS 格式化 ProCSSor - http://procssor.com/ CSS 压缩 CSS Compressor - http://www.cssdrive.com/index.php/ ...
理解git
为了真正了解git,我们从底部.底层开始,了解git核心,知其然并知其所以然. 为什么要进行版本控制呢? 因为编写文件不可能一次到位,文件总是有不同的状态需要保存下来,方便以后出错回滚. git 是目 ...
mysql和redis加入到windows服务
mysql加入到windows服务: mysqld --install Mysql5.6 mysqld --remove mysql5.6 从windows的服务中删除mysql服务 net st ...
罗技 M558 鼠标维修记录
罗技 M558 鼠标维修记录故障现象按键不灵敏拆机内部图前进键后退键左键右键中键自定义功能键使用的是 OMRON 按键,好东西,质量可以. 但毕竟是机械的东西,还是有老化,用万用表 ...
SpringMVC请求参数注解两个小问题
今天遇到使用SpringMVC请求注解遇到的两个小问题: 如果用@requestBody注解,则请求体内容类型一般要为application/json,如果其类型为multipart/form-dat ...
Nginx+redis部署tomcat集群
一.部署环境: 两个tomcat实例部署在Ubuntu 14上,IP地址分别为192.168.1.110和192.168.1.111,Nginx和redis部署在windows7上,IP地址为192. ...
JUC集合之 CopyOnWriteArrayList
CopyOnWriteArrayList介绍它相当于线程安全的ArrayList.和ArrayList一样,它是个可变数组:但是和ArrayList不同的时,它具有以下特性: 它最适合于具有以下特征 ...
C# Web Service 初级教学
原文连接:http://www.codeproject.com/cs/webservices/myservice.asp作者:Chris Maunder Introduction Creating y ...

机器学习入门-数值特征-数字映射和one-hot编码 1.LabelEncoder(进行数据自编码) 2.map(进行字典的数字编码映射) 3.OnehotEncoder(进行one-hot编码) 4.pd.get_dummies(直接对特征进行one-hot编码)

机器学习入门-数值特征-数字映射和one-hot编码 1.LabelEncoder(进行数据自编码) 2.map(进行字典的数字编码映射) 3.OnehotEncoder(进行one-hot编码) 4.pd.get_dummies(直接对特征进行one-hot编码)的更多相关文章

随机推荐

热门专题