模型预处理层介绍（1）

预处理的作用主要在于将难以表达的string或者数组转换成模型容易训练的向量表示，其中转化过程大多是形成一张查询表用来查询。

常见的预处理方式包括：

class Discretization: Buckets data into discrete ranges.
class Hashing: Implements categorical feature hashing, also known as "hashing trick".
class IntegerLookup: Maps integers from a vocabulary to integer indices.
class Normalization: Feature-wise normalization of the data.
class StringLookup: Maps strings from a vocabulary to integer indices.

接下来，本文将介绍下这些常用的预处理方式的作用和内容

Discretization

离散化层。该层将其输入数据的每个元素放入几个连续的范围之一，并输出一个整数索引，指示每个元素位于哪个范围。这个索引也就是索引编号，通过分桶边界值判断输入的数字属于哪个分桶，以此给出桶号。

换句话说，它的作用在于将连续的数值特征转换为整数分类特征。

在2.5版本的tf当中，该层的入参只有一个分桶边界bins，用法为：

tf.keras.layers.experimental.preprocessing.Discretization(

    bins, **kwargs

)

在2.11版本的tf当中,Discretization层被定义为

tf.keras.layers.Discretization(

    bin_boundaries=None,

    num_bins=None,

    epsilon=0.01,

    output_mode='int',

    sparse=False,

    **kwargs

)

其中多了一个epsilon，用来作为误差容忍度，通常是一个接近于零的小分数(例如0.01)。较大的epsilon值会增加分位数近似，从而导致更多不相等的桶，但可以提高性能和资源消耗。

另外还多了一个output_mode:

"int":直接返回离散化的bin索引。
"one_hot":将输入中的每个元素编码到与num_bins大小相同的数组中，在输入的bin索引处包含一个1。如果最后一个维度的大小为1，则对该维度进行编码。如果最后一个维度的大小不是1，则将为编码后的输出追加一个新维度。
"multi_hot":将输入中的每个样本编码到与num_bins大小相同的单个数组中，为样本中出现的每个bin索引索引包含一个1。将最后一个维度作为样本维度，如果输入形状为(…, sample_length)，输出形状将是(…, num_tokens)。
"count":作为"multi_hot"，但int数组包含bin索引在示例中出现次数的计数。

举一个现有的官方的例子：

>>> input = np.array([[-1.5, 1.0, 3.4, .5], [0.0, 3.0, 1.3, 0.0]])

>>> layer = tf.keras.layers.experimental.preprocessing.Discretization(

...          bins=[0., 1., 2.])

>>> layer(input)

<tf.Tensor: shape=(2, 4), dtype=int32, numpy=

array([[0, 1, 3, 1],

       [0, 3, 2, 0]], dtype=int32)>

在这个例子中，传入的参数 bins=[0., 1., 2.] 代表着该层以0、1、2 作为数值边界进行分桶，所以整体的查询表大概如下所示：

bin	<0	0~1	1~2	>2
index	0	1	2	3

结合着官方的例子，处于边界值上的数值，会被归于前一个桶。比如第一行第二个数字数值为1，会被分桶成编号为1。

其中Discretization层调用了bucket进行分桶

要注意的是，这些层是不可训练的。它们的状态在训练期间没有设置;它必须在训练之前设置，或者通过从预先计算的常数初始化它们，或者通过在数据上“调整”它们。

模型预处理层介绍（1） - Discretization的更多相关文章

OSI模型——传输层
OSI模型——传输层运输层运输层概述运输层提供应用层端到端通信服务,通俗的讲,两个主机通讯,也就是应用层上的进程之间的通信,也就是转换为进程和进程之间的通信了,我们之前学到网络层,IP协议能将分 ...
C++11 并发指南七(C++11 内存模型一：介绍)
第六章主要介绍了 C++11 中的原子类型及其相关的API,原子类型的大多数 API 都需要程序员提供一个 std::memory_order(可译为内存序,访存顺序) 的枚举类型值作为参数,比如:a ...
ThinkPHP 的模型使用详细介绍--模型的核心(七)
原文:ThinkPHP 的模型使用详细介绍--模型的核心(七) 注意:本节是ThinkPhp框架对数据操作的核心处理部分大家还是在这里看清楚可以将其剪切放到代码编辑器中查看本章节给大家着重介绍模型 ...
服务器端IO模型的简单介绍及实现
https://mp.weixin.qq.com/s?src=3&timestamp=1541726441&ver=1&signature=xPSye3v7miF7aVeLHb ...
UIView的层介绍
UIView的层介绍 subview在西安市到屏幕上时,是位于superview上层的. 同一个view的subview时依照增加的顺序显示相应层的.越晚增加的subview显示在越上层,反之也是如此 ...
Django基础之模型(models)层(上)
目录 Django基础之模型(models)层单表查询必知必会13条神奇的双下划线查询多表查询外键的字段的增删改查表与表之间的关联查询基于双下划线的跨表查询(连表查询) 补充知识 Dja ...
服务器端IO模型的简单介绍及实现阻塞 / 非阻塞 VS 同步 / 异步内核实现的拷贝效率
小结: 1.在多线程的基础上,可以考虑使用"线程池"或"连接池","线程池"旨在减少创建和销毁线程的频率,其维持一定合理数量的线程,并让空闲 ...
18 网络编程-TCP/IP各层介绍（5层模型讲解）
1.TCP/IP五层协议讲解物理层--数据链路层--网络层--传输层--应用层我们将应用层,表示层,会话层并作应用层,从tcp/ip五层协议的角度来阐述每层的由来与功能,搞清楚了每层的主要协议就 ...
网络编程-TCP/IP各层介绍（5层模型讲解）
1.TCP/IP五层协议讲解物理层--数据链路层--网络层--传输层--应用层我们将应用层,表示层,会话层并作应用层,从tcp/ip五层协议的角度来阐述每层的由来与功能,搞清楚了每层的主要协议就 ...
caffe学习系列（3）：数据层介绍
一个模型由多个层构成,如Data,conv,pool等.其中数据层是模型的最底层,是模型的入口. 提供数据的输入,也提供数据从Blobs转换成别的格式进行保存输出还包括数据的预处理(如减去均值, 放 ...

随机推荐

perl哈希嵌套和引用的使用
数组,哈希嵌套数组,哈希的引用 1.哈希的嵌套和引用 %hash = ( 'group1', {'fruit', 'banana', 'drink', 'orange juice', 'vegeta ...
IIS 配置集中式证书模块实现网站自动绑定证书文件
在 Windows 环境下如果采用 IIS 作为网站服务器时,常规的网站绑定 HTTPS 需要一个一个站点手动选择对应的证书绑定,而且证书过期之后更换证书时也是需要一个个重新绑定操作,无法便捷的做到 ...
2022春每日一题：Day 16
题目:不同子串个数这题需要利用后缀数组求出的height的性质,我们发现对于每个后缀,他的height后的所有子串就是算在答案里,因此答案只需要求出n-height[i]-sa[i]+1的和就可以了 ...
kubeedge架构与核心设计---https://bbs.huaweicloud.com/webinar/100009
今天是kubeedge的第一节课,今天主要带大家回顾一下云原生和边缘计算的发展历程然后我们会重点介绍一下kubeedge这个项目,他的设计背景和核心理念与我们整体的架构首先是我们来简单回归一下云原 ...
.NET性能优化-使用内存+磁盘混合缓存
我们回顾一下上一篇文章中的内容,有一个朋友问我这样一个问题: 我的业务依赖一些数据,因为数据库访问慢,我把它放在Redis里面,不过还是太慢了,有什么其它的方案吗? 其实这个问题比较简单的是吧?Red ...
npm 依赖下载报错：主机名/IP与证书的altname不匹配
npm 依赖下载报错:主机名/IP与证书的altname不匹配: //取消ssl验证 npm set strict-ssl false npm config set registry http://r ...
关于linux配置java环境变量问题
前言这几天一直在学java, 所以配置环境变量是必不可少的步骤,然后我简单的研究了一下,当然也只是皮毛而已环境变量的就近原则我电脑下载了oracle公司的jdk(手动配置环境变量), 和直接源里 ...
数据结构学习——BST删除特定节点
BST删除特定节点前言一个平常的星期三晚上,一节通选课中,在老师放的视频和极寒空调的折磨之下,想着做点别的什么的我,打开了博客园.想起来做题下午数据结构课中老师最后在讲BST删除节点的操作,并且以 ...
opencv-python学习之旅
opencv-python 操作 *注:在此笔记中只记录下各种函数的使用,规则详细讲解见https://opencv.apachecn.org/#/docs/4.0.0/2.1-tutorial_p ...
[OpenCV实战]16 使用OpenCV实现多目标跟踪
目录 1 背景介绍 2 基于MultiTracker的多目标跟踪 2.1 创建单个对象跟踪器 2.2 读取视频的第一帧 2.3 在第一帧中确定我们跟踪的对象 2.4 初始化MultiTrackerer ...

模型预处理层介绍（1） - Discretization

Discretization

模型预处理层介绍（1） - Discretization的更多相关文章

随机推荐

热门专题