字典树(Trie树)实现与应用

一、概述

　　1、基本概念

　　字典树，又称为单词查找树，Tire数，是一种树形结构，它是一种哈希树的变种。

　　2、基本性质

根节点不包含字符，除根节点外的每一个子节点都包含一个字符
从根节点到某一节点。路径上经过的字符连接起来，就是该节点对应的字符串
每个节点的所有子节点包含的字符都不相同

　　3、应用场景

　　典型应用是用于统计，排序和保存大量的字符串(不仅限于字符串)，经常被搜索引擎系统用于文本词频统计。

　　4、优点

　　利用字符串的公共前缀来减少查询时间，最大限度的减少无谓的字符串比较，查询效率比哈希树高。

二、构建过程

　　1、字典树节点定义

class TrieNode // 字典树节点

    {

        private int num;// 有多少单词通过这个节点,即由根至该节点组成的字符串模式出现的次数

        private TrieNode[] son;// 所有的儿子节点

        private boolean isEnd;// 是不是最后一个节点

        private char val;// 节点的值

        TrieNode()

        {

            num = 1;

            son = new TrieNode[SIZE];

            isEnd = false;

        }

    }

　　2、字典树构造函数

    Trie() // 初始化字典树

    {

        root = new TrieNode();

    }

　　3、建立字典树

// 建立字典树

    public void insert(String str) // 在字典树中插入一个单词

    {

        if (str == null || str.length() == 0)

        {

            return;

        }

        TrieNode node = root;

        char[] letters = str.toCharArray();//将目标单词转换为字符数组

        for (int i = 0, len = str.length(); i < len; i++)

        {

            int pos = letters[i] - 'a';

            if (node.son[pos] == null)  //如果当前节点的儿子节点中没有该字符，则构建一个TrieNode并复值该字符

            {

                node.son[pos] = new TrieNode();

                node.son[pos].val = letters[i];

            }

            else   //如果已经存在，则将由根至该儿子节点组成的字符串模式出现的次数+1

            {

                node.son[pos].num++;

            }

            node = node.son[pos];

        }

        node.isEnd = true;

    }

　　4、在字典树中查找是否完全匹配一个指定的字符串

    // 在字典树中查找一个完全匹配的单词.

    public boolean has(String str)

    {

        if(str==null||str.length()==0)

        {

            return false;

        }

        TrieNode node=root;

        char[]letters=str.toCharArray();

        for(int i=0,len=str.length(); i<len; i++)

        {

            int pos=letters[i]-'a';

            if(node.son[pos]!=null)

            {

                node=node.son[pos];

            }

            else

            {

                return false;

            }

        }

        //走到这一步，表明可能完全匹配，也可能部分匹配，如果最后一个字符节点为末端节点，则是完全匹配，否则是部分匹配

        return node.isEnd;

    }

　　5、前序遍历字典树

　　// 前序遍历字典树.

    public void preTraverse(TrieNode node)

    {

        if(node!=null)

        {

            System.out.print(node.val+"-");

            for(TrieNode child:node.son)

            {

                preTraverse(child);

            }

        }

    }

　　6、计算单词前缀的数量

　　// 计算单词前缀的数量

    public int countPrefix(String prefix)

    {

        if(prefix==null||prefix.length()==0)

        {

            return-1;

        }

        TrieNode node=root;

        char[]letters=prefix.toCharArray();

        for(int i=0,len=prefix.length(); i<len; i++)

        {

            int pos=letters[i]-'a';

            if(node.son[pos]==null)

            {

                return 0;

            }

            else

            {

                node=node.son[pos];

            }

        }

        return node.num;

    }

　　完整代码：

package com.xj.test;

public class Trie

{

    private int SIZE = 26;

    private TrieNode root;// 字典树的根

    class TrieNode // 字典树节点

    {

        private int num;// 有多少单词通过这个节点,即由根至该节点组成的字符串模式出现的次数

        private TrieNode[] son;// 所有的儿子节点

        private boolean isEnd;// 是不是最后一个节点

        private char val;// 节点的值

        TrieNode()

        {

            num = 1;

            son = new TrieNode[SIZE];

            isEnd = false;

        }

    }

    Trie() // 初始化字典树

    {

        root = new TrieNode();

    }

    // 建立字典树

    public void insert(String str) // 在字典树中插入一个单词

    {

        if (str == null || str.length() == 0)

        {

            return;

        }

        TrieNode node = root;

        char[] letters = str.toCharArray();//将目标单词转换为字符数组

        for (int i = 0, len = str.length(); i < len; i++)

        {

            int pos = letters[i] - 'a';

            if (node.son[pos] == null)  //如果当前节点的儿子节点中没有该字符，则构建一个TrieNode并复值该字符

            {

                node.son[pos] = new TrieNode();

                node.son[pos].val = letters[i];

            }

            else   //如果已经存在，则将由根至该儿子节点组成的字符串模式出现的次数+1

            {

                node.son[pos].num++;

            }

            node = node.son[pos];

        }

        node.isEnd = true;

    }

    // 计算单词前缀的数量

    public int countPrefix(String prefix)

    {

        if(prefix==null||prefix.length()==0)

        {

            return-1;

        }

        TrieNode node=root;

        char[]letters=prefix.toCharArray();

        for(int i=0,len=prefix.length(); i<len; i++)

        {

            int pos=letters[i]-'a';

            if(node.son[pos]==null)

            {

                return 0;

            }

            else

            {

                node=node.son[pos];

            }

        }

        return node.num;

    }

    // 打印指定前缀的单词

    public String hasPrefix(String prefix)

    {

        if (prefix == null || prefix.length() == 0)

        {

            return null;

        }

        TrieNode node = root;

        char[] letters = prefix.toCharArray();

        for (int i = 0, len = prefix.length(); i < len; i++)

        {

            int pos = letters[i] - 'a';

            if (node.son[pos] == null)

            {

                return null;

            }

            else

            {

                node = node.son[pos];

            }

        }

        preTraverse(node, prefix);

        return null;

    }

    // 遍历经过此节点的单词.

    public void preTraverse(TrieNode node, String prefix)

    {

        if (!node.isEnd)

        {

            for (TrieNode child : node.son)

            {

                if (child != null)

                {

                    preTraverse(child, prefix + child.val);

                }

            }

            return;

        }

        System.out.println(prefix);

    }

    // 在字典树中查找一个完全匹配的单词.

    public boolean has(String str)

    {

        if(str==null||str.length()==0)

        {

            return false;

        }

        TrieNode node=root;

        char[]letters=str.toCharArray();

        for(int i=0,len=str.length(); i<len; i++)

        {

            int pos=letters[i]-'a';

            if(node.son[pos]!=null)

            {

                node=node.son[pos];

            }

            else

            {

                return false;

            }

        }

        //走到这一步，表明可能完全匹配，可能部分匹配，如果最后一个字符节点为末端节点，则是完全匹配，否则是部分匹配

        return node.isEnd;

    }

    // 前序遍历字典树.

    public void preTraverse(TrieNode node)

    {

        if(node!=null)

        {

            System.out.print(node.val+"-");

            for(TrieNode child:node.son)

            {

                preTraverse(child);

            }

        }

    }

    public TrieNode getRoot()

    {

        return this.root;

    }

    public static void main(String[]args)

    {

        Trie tree=new Trie();

        String[]strs= {"banana","band","bee","absolute","acm",};

        String[]prefix= {"ba","b","band","abc",};

        for(String str:strs)

        {

            tree.insert(str);

        }

        System.out.println(tree.has("abc"));

        tree.preTraverse(tree.getRoot());

        System.out.println();

        //tree.printAllWords();

        for(String pre:prefix)

        {

            int num=tree.countPrefix(pre);

            System.out.println(pre+"数量:"+num);

        }

    }

}

　　执行结果截图：

三、简单应用

　　下面讲一个简单的应用，问题是这样的：

　　现在有一个英文字典(每个单词都是由小写的a-z组成)，单词量很大，而且还有很多重复的单词。

　　此外，我们还有一些Document，每个Document包含一些英语单词。下面是问题：

　　(问题1)请你选择合适的数据结构，将所有的英文单词生成一个字典Dictionary？

　　(问题2)给定一个单词，判断这个单词是否在字典Dictionary中，如果在单词库中，输出这个单词出现总共出现的次数，否则输出NO？

package com.xj.test;

import java.io.BufferedReader;

import java.io.File;

import java.io.FileInputStream;

import java.io.FileNotFoundException;

import java.io.IOException;

import java.io.InputStreamReader;

import java.util.HashMap;

import java.util.Map;

public class Trie

{

    private int SIZE = 26;

    private TrieNode root;// 字典树的根

    class TrieNode // 字典树节点

    {

        private int num;// 有多少单词通过这个节点,即由根至该节点组成的字符串模式出现的次数

        private TrieNode[] son;// 所有的儿子节点

        private boolean isEnd;// 是不是最后一个节点

        private char val;// 节点的值

        TrieNode()

        {

            num = 1;

            son = new TrieNode[SIZE];

            isEnd = false;

        }

    }

    Trie() // 初始化字典树

    {

        root = new TrieNode();

    }

    // 建立字典树

    public void insert(String str) // 在字典树中插入一个单词

    {

        if (str == null || str.length() == 0)

        {

            return;

        }

        TrieNode node = root;

        char[] letters = str.toCharArray();//将目标单词转换为字符数组

        for (int i = 0, len = str.length(); i < len; i++)

        {

            int pos = letters[i] - 'a';

            if (node.son[pos] == null)  //如果当前节点的儿子节点中没有该字符，则构建一个TrieNode并复值该字符

            {

                node.son[pos] = new TrieNode();

                node.son[pos].val = letters[i];

            }

            else   //如果已经存在，则将由根至该儿子节点组成的字符串模式出现的次数+1

            {

                node.son[pos].num++;

            }

            node = node.son[pos];

        }

        node.isEnd = true;

    }

    // 计算单词前缀的数量

    public int countPrefix(String prefix)

    {

        if(prefix==null||prefix.length()==0)

        {

            return-1;

        }

        TrieNode node=root;

        char[]letters=prefix.toCharArray();

        for(int i=0,len=prefix.length(); i<len; i++)

        {

            int pos=letters[i]-'a';

            if(node.son[pos]==null)

            {

                return 0;

            }

            else

            {

                node=node.son[pos];

            }

        }

        return node.num;

    }

    // 打印指定前缀的单词

    public String hasPrefix(String prefix)

    {

        if (prefix == null || prefix.length() == 0)

        {

            return null;

        }

        TrieNode node = root;

        char[] letters = prefix.toCharArray();

        for (int i = 0, len = prefix.length(); i < len; i++)

        {

            int pos = letters[i] - 'a';

            if (node.son[pos] == null)

            {

                return null;

            }

            else

            {

                node = node.son[pos];

            }

        }

        preTraverse(node, prefix);

        return null;

    }

    // 遍历经过此节点的单词.

    public void preTraverse(TrieNode node, String prefix)

    {

        if (!node.isEnd)

        {

            for (TrieNode child : node.son)

            {

                if (child != null)

                {

                    preTraverse(child, prefix + child.val);

                }

            }

            return;

        }

        System.out.println(prefix);

    }

    // 在字典树中查找一个完全匹配的单词.

    public boolean has(String str)

    {

        if(str==null||str.length()==0)

        {

            return false;

        }

        TrieNode node=root;

        char[]letters=str.toCharArray();

        for(int i=0,len=str.length(); i<len; i++)

        {

            int pos=letters[i]-'a';

            if(node.son[pos]!=null)

            {

                node=node.son[pos];

            }

            else

            {

                return false;

            }

        }

        //走到这一步，表明可能完全匹配，可能部分匹配，如果最后一个字符节点为末端节点，则是完全匹配，否则是部分匹配

        return node.isEnd;

    }

    // 前序遍历字典树.

    public void preTraverse(TrieNode node)

    {

        if(node!=null)

        {

            System.out.print(node.val+"-");

            for(TrieNode child:node.son)

            {

                preTraverse(child);

            }

        }

    }

    public TrieNode getRoot()

    {

        return this.root;

    }

    public static void main(String[]args) throws IOException

    {

        Trie tree=new Trie();

        String[] dictionaryData= {"hello","student","computer","sorry","acm","people","experienced","who","reminds","everyday","almost"};

        //构建字典

        for(String str:dictionaryData)

        {

            tree.insert(str);

        }

        String filePath="C:\\Users\\Administrator\\Desktop\\sourceFile.txt";

        File file=new File(filePath);

        if(file.isFile() && file.exists())

        {

            InputStreamReader read = new InputStreamReader(new FileInputStream(file));

            BufferedReader bufferedReader = new BufferedReader(read);

            String lineTxt = null;

            Map<String,Integer> countMap=new HashMap<String,Integer>();

            while((lineTxt = bufferedReader.readLine())!= null)

            {

                if(tree.has(lineTxt))

                {

                    if(countMap.containsKey(lineTxt))

                    {

                        countMap.put(lineTxt, countMap.get(lineTxt)+1);

                    }

                    else

                    {

                        countMap.put(lineTxt, 1);

                    }

                }

                else

                {

                    System.out.println(lineTxt+"不在字典中！");

                }

            }

            for(String s:countMap.keySet())

            {

                System.out.println(s+"出现的次数"+countMap.get(s));

            }

            read.close();

        }

    }   

}

　　其中text文件内容为：

　　程序执行结果为：

四、参考资料

　　1、http://baike.baidu.com/link?url=X0XQ-obbacAS3GsVN1ktZtaVEPp0u7J1aClFdwdq-DiFjS-kSE-Ce1-q9_dLXb58PDyOkQxK0kB2l1PFUpB36_

字典树(Trie树)实现与应用的更多相关文章

字典树(Trie树)的实现及应用
>>字典树的概念 Trie树,又称字典树,单词查找树或者前缀树,是一种用于快速检索的多叉树结构,如英文字母的字典树是一个26叉树,数字的字典树是一个10叉树.与二叉查找树不同,Trie树的 ...
[POJ] #1002# 487-3279 : 桶排序/字典树(Trie树)/快速排序
一. 题目 487-3279 Time Limit: 2000MS Memory Limit: 65536K Total Submissions: 274040 Accepted: 48891 ...
Atitit 常见的树形结构红黑树二叉树 B树 B+树 Trie树 attilax理解与总结
Atitit 常见的树形结构红黑树二叉树 B树 B+树 Trie树 attilax理解与总结 1.1. 树形结构-- 一对多的关系1 1.2. 树的相关术语: 1 1.3. 常见的树形结构 ...
洛谷$P4585\ [FJOI2015]$火星商店问题线段树+$trie$树
正解:线段树+$trie$树解题报告: 传送门$QwQ$ $umm$题目有点儿长我先写下题目大意趴$QwQ$,就说有$n$个初始均为空的集合和$m$次操作,每次操作为向某个集合内加入一个数$x$,或 ...
luoguP6623 [省选联考 2020 A 卷] 树(trie树)
luoguP6623 [省选联考 2020 A 卷] 树(trie树) Luogu 题外话: ...想不出来啥好说的了. 我认识的人基本都切这道题了. 就我只会10分暴力. 我是傻逼. 题解时间先不 ...
[转载]字典树(trie树)、后缀树
(1)字典树(Trie树) Trie是个简单但实用的数据结构,通常用于实现字典查询.我们做即时响应用户输入的AJAX搜索框时,就是Trie开始.本质上,Trie是一颗存储多个字符串的树.相邻节点间的边 ...
Luogu P2922 [USACO08DEC]秘密消息Secret Message 字典树 Trie树
本来想找$01Trie$的结果找到了一堆字典树水题...算了算了当水个提交量好了. 直接插入模式串,维护一个$Trie$树的子树$sum$大小,求解每一个文本串匹配时走过的链上匹配数和终点 ...
字典树 trie树学习
一字典树字典树,又称单词查找树,Trie树,是一种树形结构,哈希表的一个变种二.性质根节点不包含字符,除根节点以外的每一个节点都只包含一个字符: 从根节点到某一节点,路径上经过的字符串连接起 ...
【字符串算法】字典树(Trie树)
什么是字典树基本概念字典树,又称为单词查找树或Tire树,是一种树形结构,它是一种哈希树的变种,用于存储字符串及其相关信息. 基本性质 1.根节点不包含字符,除根节点外的每一个子节点都包含一个字符 ...
字典树 Trie树
什么是Trie树? 形如其中从根节点到红色节点的路径上的字母所连成的字符串即为一个Trie树上所存的字符串. 比如,这个trie树上有ab,abc,bd,dda这些字符串. 至于怎么构建和查找或添加 ...

随机推荐

leveldb - 并发写入处理
在并发写入的时候,leveldb巧妙地利用一个时间窗口做batch写入,这部分代码值得一读: Status DBImpl::Write(const WriteOptions& options, ...
java利用透明的图片轮廓抠图
需要处理的图片: 1.png(空白区域为透明) 2.png 处理后的结果图片:result.png 代码如下: import java.awt.Graphics2D; import java.awt. ...
Html5 localstorage解决Ajax回退的坑
A页面通过ajax加载数据,并且是滚动加载效果,当滚动几个屏幕之后,进入新的链接页面B,再返回到A的时候,A页面的数据有需要重新加载,从头开始了,体验非常不好. 解决办法:1)hash:2)html5 ...
ViewPager中使用PhotoView时出现pointerIndex out of range异常
问题描述: 当PhotoView 和 ViewPager 组合时 ,用双指进行放大时是没有问题的,但是用双指进行缩小的时候,程序就会崩掉,并且抛出java.lang.IllegalArgumentE ...
Flink 案例整合
1.概述 Flink 1.1.0 版本已经在官方发布了,官方博客于 2016-08-08 更新了 Flink 1.1.0 的变动.在这 Flink 版本的发布,添加了 SQL 语法这一特性.这对于业务 ...
git删除远程文件夹或文件的方法
由于本地修改了文件夹大全名大小写的原因,同步到git上并不区分大小写,造成了一些文件同步不了,所以要先把git远程库上文件夹删除掉,然后再重新同步如下,我把src里的全部移除,但是本地文件还保留. ...
Java中利用标签跳出外层循环break
直接看代码: class ForLoop{ public static void main(String[] args){ //jump from outer loop outer:for(int i ...
批量Ping IP
刚刚接触Python 想做点什么听说Python 在网络方便很厉害后来总结如下: 第一:发现公司都固定IP 每次新来同事都要猜一个没有人用的IP 很费劲第二:我们公司有的IP可以上QQ 有的不 ...
CreateProcessAsUser,C#写的windows服务弹框提示消息或者启动子进程
服务(Service)对于大家来说一定不会陌生,它是Windows 操作系统重要的组成部分.我们可以把服务想像成一种特殊的应用程序,它随系统的“开启-关闭”而“开始-停止”其工作内容,在这期间无需任何 ...
各种UserAgent的列表
User Agent是浏览器用于 HTTP 请求的用户代理头的值.更换User Agent能更好的模拟出不同的系统和浏览器信息. Android Name User Agent Nexus 7 (Ta ...

字典树(Trie树)实现与应用

一、概述

1、基本概念

2、基本性质

3、应用场景

4、优点

二、构建过程

1、字典树节点定义

2、字典树构造函数

3、建立字典树

4、在字典树中查找是否完全匹配一个指定的字符串

5、前序遍历字典树

6、计算单词前缀的数量

三、简单应用

四、参考资料

字典树(Trie树)实现与应用的更多相关文章

随机推荐

热门专题

　　1、基本概念

　　2、基本性质

　　3、应用场景

　　4、优点

　　1、字典树节点定义

　　2、字典树构造函数

　　3、建立字典树

　　4、在字典树中查找是否完全匹配一个指定的字符串

　　5、前序遍历字典树

　　6、计算单词前缀的数量