NLTK学习笔记(五):分类和标注词汇

词性标注器
标注语料库
自动标注
N-gram标注
基于转换的标注：Brill标注器

词性标注器

之后的很多工作都需要标注完的词汇。nltk自带英文标注器pos_tag

import nltk

text = nltk.word_tokenize("And now for something compleyely difference")

print(text)

print(nltk.pos_tag(text))

标注语料库

表示已经标注的标识符:`nltk.tag.str2tuple('word/类型')`

text = "The/AT grand/JJ is/VBD ."

print([nltk.tag.str2tuple(t) for t in text.split()])

读取已经标注的语料库

nltk语料库ue肚脐提供了统一接口，可以不必理会不同的文件格式。格式:语料库.tagged_word()/tagged_sents()。参数可以指定categories和fields

print(nltk.corpus.brown.tagged_words())

名词、动词、形容词等

这里以名词为例

from nltk.corpus import brown

word_tag = nltk.FreqDist(brown.tagged_words(categories="news"))

print([word+'/'+tag for (word,tag)in word_tag if tag.startswith('V')])

################下面是查找money的不同标注#################################

wsj = brown.tagged_words(categories="news")

cfd = nltk.ConditionalFreqDist(wsj)

print(cfd['money'].keys())

尝试找出每个名词类型中最频繁的名词

def findtag(tag_prefix,tagged_text):

    cfd = nltk.ConditionalFreqDist((tag,word) for (word,tag) in tagged_text if tag.startswith(tag_prefix))

    return dict((tag,list(cfd[tag].keys())[:5]) for tag in cfd.conditions())#数据类型必须转换为list才能进行切片操作

tagdict = findtag('NN',nltk.corpus.brown.tagged_words(categories="news"))

for tag in sorted(tagdict):

    print(tag,tagdict[tag])

探索已经标注的语料库

需要nltk.bigrams()和nltk.trigrams()，分别对应2-gram模型和3-gram模型。

brown_tagged = brown.tagged_words(categories="learned")

tags = [b[1] for (a,b) in nltk.bigrams(brown_tagged) if a[0]=="often"]

fd = nltk.FreqDist(tags)

fd.tabulate()

自动标注

默认标注器

最简单的标注器是为每个标识符分配统一标记。下面就是一个将所有词都变成NN的标注器。并且用evaluate()进行检验。当很多词语是名词时候，它有利于第一次分析并提高稳定性。

brown_tagged_sents = brown.tagged_sents(categories="news")

raw = 'I do not like eggs and ham, I do not like them Sam I am'

tokens = nltk.word_tokenize(raw)

default_tagger = nltk.DefaultTagger('NN')#创建标注器

print(default_tagger.tag(tokens)) # 调用tag()方法进行标注

print(default_tagger.evaluate(brown_tagged_sents))

正则表达式标注器

注意这里规则是固定（由自己决定）。当规则越来越完善的时候，精确度越高。

patterns = [

    (r'.*ing$','VBG'),

    (r'.*ed$','VBD'),

    (r'.*es$','VBZ'),

    (r'.*','NN')#为了方便，只有少量规则

]

regexp_tagger = nltk.RegexpTagger(patterns)

regexp_tagger.evaluate(brown_tagged_sents)

查询标注器

这里和书里是有差别的，不同于python2，注意调试。而查询标注器就是存储最有可能的标记，并且可以设置backoff参数，不能标记的情况下，就使用这个标注器（这个过程是回退）

fd = nltk.FreqDist(brown.words(categories="news"))

cfd = nltk.ConditionalFreqDist(brown.tagged_words(categories="news"))

##############################################python2和3的区别#########

most_freq_words = fd.most_common(100)

likely_tags = dict((word,cfd[word].max()) for (word,times) in most_freq_words)

#######################################################################

baseline_tagger = nltk.UnigramTagger(model=likely_tags,backoff=nltk.DefaultTagger('NN'))

baseline_tagger.evaluate(brown_tagged_sents)

N-gram标注

基础的一元标注器

一元标注器的行为和查找标注器很相似，建立一元标注器的技术，为训练。

这里我们的标注器只是记忆训练集，而不是建立一般模型，那么吻合很好，但是不能推广到新文本。

size = int(len(brown_tagged_sents)*0.9)

train_sents = brown_tagged_sents[:size]

test_sents = brown_tagged_sents[size+1:]

unigram_tagger = nltk.UnigramTagger(train_sents)

unigram_tagger.evaluate(test_sents)

一般的N-gram标注器

N元标注器，就是检索index= n 的 word，并且检索n-N<=index<=n-1 的 tag。即通过前面词的tag标签，进一步确定当前词汇的tag。类似于nltk.UnigramTagger()，自带的二元标注器为:nltk.BigramTagger()用法一致。

组合标注器

很多时候，覆盖范围更广的算法比精度更高的算法更有用。利用backoff指明回退标注器,来实现标注器的组合。而参数cutoff显式声明为int型，则会自动丢弃只出现1-n次的上下文。

t0 = nltk.DefaultTagger('NN')

t1 = nltk.UnigramTagger(train_sents,backoff=t0)

t2 = nltk.BigramTagger(train_sents,backoff=t1)

t2.evaluate(test_sents)

可以发现，和原来比较之后，精确度明显提高

跨句子边界标注

对于句首的单词，没有前n个单词。解决方法：通过已标记的tagged_sents来训练标注器。

基于转换的标注：Brill标注器

较上面的都优秀。实现的思路：以大笔化开始，然后修复细节，一点点进行细致改变。
不仅占用内存小，而且关联上下文，并且根据问题的变小，实时修正错误，而不是一成不变的。当然，在python3和python2的调用有所不同。

from nltk.tag import brill

brill.nltkdemo18plus()

brill.nltkdemo18()

欢迎进一步交流本博文相关内容：

博客园地址 : http://www.cnblogs.com/AsuraDong/

CSDN地址 : http://blog.csdn.net/asuradong

也可以致信进行交流 : xiaochiyijiu@163.com

欢迎转载 , 但请指明出处 : )

NLTK学习笔记(五):分类和标注词汇的更多相关文章

莫烦PyTorch学习笔记(五)——分类
import torch from torch.autograd import Variable import torch.nn.functional as F import matplotlib.p ...
C#可扩展编程之MEF学习笔记(五)：MEF高级进阶
好久没有写博客了,今天抽空继续写MEF系列的文章.有园友提出这种系列的文章要做个目录,看起来方便,所以就抽空做了一个,放到每篇文章的最后. 前面四篇讲了MEF的基础知识,学完了前四篇,MEF中比较常用 ...
（转）Qt Model/View 学习笔记 (五)——View 类
Qt Model/View 学习笔记 (五) View 类概念在model/view架构中,view从model中获得数据项然后显示给用户.数据显示的方式不必与model提供的表示方式相同,可以与 ...
java之jvm学习笔记五(实践写自己的类装载器)
java之jvm学习笔记五(实践写自己的类装载器) 课程源码:http://download.csdn.net/detail/yfqnihao/4866501 前面第三和第四节我们一直在强调一句话,类 ...
Learning ROS for Robotics Programming Second Edition学习笔记(五) indigo computer vision
中文译著已经出版,详情请参考:http://blog.csdn.net/ZhangRelay/article/category/6506865 Learning ROS for Robotics Pr ...
Typescript 学习笔记五：类
中文网:https://www.tslang.cn/ 官网:http://www.typescriptlang.org/ 目录: Typescript 学习笔记一:介绍.安装.编译 Typescrip ...
ES6学习笔记<五> Module的操作——import、export、as
import export 这两个家伙对应的就是es6自己的 module功能. 我们之前写的Javascript一直都没有模块化的体系,无法将一个庞大的js工程拆分成一个个功能相对独立但相互依赖的小 ...
muduo网络库学习笔记(五) 链接器Connector与监听器Acceptor
目录 muduo网络库学习笔记(五) 链接器Connector与监听器Acceptor Connector 系统函数connect 处理非阻塞connect的步骤: Connetor时序图 Accep ...
python3.4学习笔记(五) IDLE显示行号问题，插件安装和其他开发工具介绍
python3.4学习笔记(五) IDLE显示行号问题,插件安装和其他开发工具介绍 IDLE默认不能显示行号,使用ALT+G 跳到对应行号,在右下角有显示光标所在行.列.pycharm免费社区版.Su ...

随机推荐

解析Qt元对象系统(五) Q_INVOKABLE与invokeMethod（automatic connection从Qt4.8开始的解释已经与之前不同，发送对象驻足于哪一个线程并不重要，起到决定作用的是接收者对象所驻足的线程以及发射信号（该信号与接受者连接）的线程是不是在同一个线程）good
概述查看Qt源码可知,Q_INVOKABLE是个空宏,目的在于让moc识别. 使用Q_INVOKABLE来修饰成员函数,目的在于被修饰的成员函数能够被元对象系统所唤起. Q_INVOKABLE与QMe ...
【BZOJ 3620】似乎在梦中见过的样子
[题目链接] https://www.lydsy.com/JudgeOnline/problem.php?id=3620 [算法] KMP [代码] #include<bits/stdc++.h ...
HP Unix vsftp服务配置
HP Unix vsftp 服务配置: /opt/ssh/utils/ssh_chroot_setup.sh 运行脚本,会提示输入要建立的vsftp账号和要限制的家目录, 比如要限制的家目录为/Jia ...
纯CSS 实现关闭图标 icon
本文介绍关闭 icon 的实现.具体如下 1.html部分 <span id="close"></span> 2.css部分 #close { displa ...
捣鼓TinyMCE粘贴图片并上传+Flask后台
好久没有编程了,最近需要完成一个小功能,为了方便,需要粘贴图片后上传到后台.前台编辑器用tinymce(N年前用过,我也就知道这个编辑器而已.这次使用下来感觉文档更丰富了),后台我用的Flask.昨天 ...
Cash Machine(多重背包)
http://poj.org/problem?id=1276 #include <stdio.h> #include <string.h> ; #define Max(a,b) ...
alipay.trade.refund (统一收单交易退款接口)[支付宝退款]
首页官网退款的api: https://doc.open.alipay.com/docs/api.htm?spm=a219a.7395905.0.0.UTBitT&docType=4& ...
ROS-导航功能-Gazebo
前言:仿真的整体思路,先启动仿真环境,再启动导航功能. 前提:已下载并编译了相关功能包集,如还未下载,可通过git下载:https://github.com/huchunxu/ros_explorin ...
【Codeforces】Codeforces Round #374 (Div. 2) -- C. Journey （DP）
C. Journey time limit per test3 seconds memory limit per test256 megabytes inputstandard input outpu ...
Java中Ajaxa中文乱码问题
客户端: url='test/queryList?itemName='+itemName; //如果只转一次url=encodeURI(toUrl); 到后台时:乱码 servlet里dec ...

NLTK学习笔记(五):分类和标注词汇

词性标注器

标注语料库

表示已经标注的标识符:nltk.tag.str2tuple('word/类型')

读取已经标注的语料库

名词、动词、形容词等

尝试找出每个名词类型中最频繁的名词

探索已经标注的语料库

自动标注

默认标注器

正则表达式标注器

查询标注器

N-gram标注

基础的一元标注器

一般的N-gram标注器

组合标注器

跨句子边界标注

基于转换的标注：Brill标注器

NLTK学习笔记(五):分类和标注词汇的更多相关文章

随机推荐

热门专题

表示已经标注的标识符:`nltk.tag.str2tuple('word/类型')`