es分词器

1、默认的分词器

standard

standard tokenizer：以单词边界进行切分
standard token filter：什么都不做
lowercase token filter：将所有字母转换为小写
stop token filer（默认被禁用）：移除停用词，比如a the it等等

2、修改分词器的设置

启用english停用词token filter

PUT /my_index
{
　　"settings": {
　　　　"analysis": {
　　　　　　"analyzer": {
　　　　　　　　"es_std": {
　　　　　　　　　　"type": "standard",
　　　　　　　　　　"stopwords": "_english_"
　　　　　　　　}
　　　　　　}
　　　　}
　　}
}

GET /my_index/_analyze
{
　　"analyzer": "standard",
　　"text": "a dog is in the house"
}

GET /my_index/_analyze
{
　　"analyzer": "es_std",
　　"text":"a dog is in the house"
}

3、定制化自己的分词器

PUT /my_index
{
　　"settings": {
　　　　"analysis": {
　　　　　　"char_filter": {
　　　　　　　　"&_to_and": {
　　　　　　　　　　"type": "mapping",
　　　　　　　　　　"mappings": ["&=> and"]
　　　　　　　　}
　　　　　　},
　　　　　　"filter": {
　　　　　　　　"my_stopwords": {
　　　　　　　　　　　　"type": "stop",
　　　　　　　　　　　　"stopwords": ["the", "a"]
　　　　　　　　}
　　　　　　},
　　　　　　"analyzer": {
　　　　　　　　"my_analyzer": {
　　　　　　　　　　"type": "custom",
　　　　　　　　　　"char_filter": ["html_strip", "&_to_and"],
　　　　　　　　　　"tokenizer": "standard",
　　　　　　　　　　"filter": ["lowercase", "my_stopwords"]
　　　　　　　　}
　　　　　　}
　　　　}
　　}
}

GET /my_index/_analyze
{
　　"text": "tom&jerry are a friend in the house, <a>, HAHA!!",
　　"analyzer": "my_analyzer"
}

PUT /my_index/_mapping/my_type
{
　　"properties": {
　　　　"content": {
　　　　　　"type": "text",
　　　　　　"analyzer": "my_analyzer"
　　　　}
　　}
}

es分词器的更多相关文章

es 分词器介绍
按照单词切分,不做处理 GET _analyze { "analyzer": "standard", "text": "2 run ...
ElasticSearch 分词器，了解一下
这篇文章主要来介绍下什么是 Analysis ,什么是分词器,以及 ElasticSearch 自带的分词器是怎么工作的,最后会介绍下中文分词是怎么做的. 首先来说下什么是 Analysis: 什么是 ...
Elasticsearch简介、倒排索引、文档基本操作、分词器
lucene.Solr.Elasticsearch 1.倒排序索引 2.Lucene是类库 3.solr基于lucene 4.ES基于lucene 一.Elasticsearch 核心术语特点: 1 ...
ES 09 - 定制Elasticsearch的分词器 (自定义分词策略)
目录 1 索引的分析 1.1 分析器的组成 1.2 倒排索引的核心原理-normalization 2 ES的默认分词器 3 修改分词器 4 定制分词器 4.1 向索引中添加自定义的分词器 4.2 测 ...
ES系列一、CentOS7安装ES 6.3.1、集成IK分词器
Elasticsearch 6.3.1 地址: wget https://artifacts.elastic.co/downloads/elasticsearch/elasticsearch-6.3. ...
安装ik分词器以及版本和ES版本的兼容性
一.查看自己ES的版本号与之对应的IK分词器版本 https://github.com/medcl/elasticsearch-analysis-ik/blob/master/README.md 二. ...
es的分词器analyzer
analyzer 分词器使用的两个情形: 1,Index time analysis. 创建或者更新文档时,会对文档进行分词2,Search time analysis. 查询时,对查询语句 ...
es 修改拼音分词器源码实现汉字/拼音/简拼混合搜索时同音字不匹配
[版权声明]:本文章由danvid发布于http://danvid.cnblogs.com/,如需转载或部分使用请注明出处在业务中经常会用到拼音匹配查询,大家都会用到拼音分词器,但是拼音分词器匹配的 ...
es 5.0 拼音分词器 mac
安装方法和ik中文分词器一样, 先下载: https://github.com/medcl/elasticsearch-analysis-pinyin 执行: mvn package; 打包成功以后, ...

随机推荐

Android控件源码分析--AndroidResideMenu菜单
说明早上看到一篇文章介绍了ResideMenu得使用,这是一个类似SlidingMenu的控件,感觉有点高尚大,反正我之前没见过,本着凑热闹的好奇心,立马clone把玩下,项目地址奉上: https ...
(原)关于获取ffmpeg解析rtsp流sdp中带有sps,pps的情况
转载请注明出处:http://www.cnblogs.com/lihaiping/p/6612511.html 今天同事准备在android下使用ffmpeg来获取rtsp流,问我如何获取获取sps ...
iOS中支付宝钱包具体解释/第三方支付韩俊强的博客
每日更新关注:http://weibo.com/hanjunqiang 新浪微博! iOS开发人员交流QQ群: 446310206 一.在app中成功完毕支付宝支付的过程 1.申请支付宝钱包.參考网 ...
WPF之Menu绑定XML
一.XML文件 <?xml version="1.0" encoding="utf-8" ?> <MenuData xmlns="& ...
sohu_news搜狐新闻类型分类
数据获取数据是从搜狐新闻开放的新闻xml数据,经过一系列的处理之后,生成的一个excel文件该xml文件的处理有单独的处理过程,就是用pandas处理,该过程在此省略 import numpy a ...
vue 数据管道
文档https://cn.vuejs.org/v2/guide/filters.html html 片段 <div class="app"> <div>{{ ...
AJAX基本操作 + 登录 + 删除 + 模糊查询
AJAX练习显示页面 <!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http:// ...
logback logback.xml常用配置详解（一）<configuration> and <logger>
logback logback.xml常用配置详解(一)<configuration> and <logger> 博客分类: Log java loglogback 原创文章 ...
spring的自生一个bug
<?xml version="1.0" encoding="UTF-8"?> <beans xmlns="http://www.sp ...
day3 三、基本数据类型和运算符
一.多行注释和单行注释 """ 多行注释多行注释多行注释 """ # 单行注释 # print('hello world') # pri ...

es分词器

es分词器的更多相关文章

随机推荐

热门专题