TF-IDF算法——原理及实现

TF-IDF算法是一种用于信息检索与数据挖掘的常用加权技术。TF的意思是词频(Term - frequency),IDF的意思是逆向文件频率（inverse Document frequency）.

TF-IDF是传统的统计算法，用于评估一个词在一个文档集中对于某一个文档的重要程度。它与这个词在当前文档中的词频成正比，与文档集中的其他词频成反比。

首先说一下TF（词频）的计算方法，TF指的是当前文档的词频，，在这个公式中，分子表示的是改词在某一文档中出现的次数，分母表示在该文档中所有关键词出现的次数之和。

然后来说下IDF(逆向词频)的计算方法，IDF指的是某个词汇普遍性的度量。，这个公式中，log内的部分，分子表示的是文档集中文档的个数，分母表示的是包含当前关键词的文档的个数，对于这个分数取对数，得到的就是，当前词汇的IDF的值。

下面，我来介绍下通过python对TF-IDF算法的设计及实现：

对象1：文章集（属性：文章对象的集合，包含关键字的文章数）

对象1：文章（属性：关键词对象的集合；关键词出现的总次数；关键词对应对象的字典）

对象2：文章-关键词（属性：关键词名称；关键词在当前文章中出现的次数；TF_IDF）

实现流程：

1、创建文章对象，初始关键字的Map集

2、遍历关键字，每遍历一个关键字，

2.1 关键词出现的总次数加一

2.2 判断文章关键字中是够存在当前关键字，如果存在，找出他，加一，如果不存在，创建一个文章关键字对象，塞到文章的关键字的集中去；

2.3 若果这个关键字是第一次出现，则记录关键字出现的文章数(如果关键字在关键字-文章数字典中存在，则文章数+1，否则将其加入到关键字-文章数字典中，并赋初始值1)

2.4 遍历完成，文章的关于关键词的Map集装载完成，然后将当前的文章add到文章集的对象中去

3 遍历文章集，计算出关键字对应的TF-IDF，并输出

实现代码：（实现代码以读取一个文件模拟多个文档）

# TF_IDF.py

# -*- coding: utf-8 -*-

import  jieba

import  math

class DocumentSet():

    documentList = []

    key_Count = {}  #关键词对应的文章数

class Document():

     docKeySumCount=0  #文章中所有关键词总次数

     docKeySet={}  #关键词对象列表

     def __init__(self,docid):

         self.docid = docid

class DocKey():

    docKeyCount = 1 #当前关键词在当前文章中出现的次数

    TF_IDF = 0  #当前关键词的TF-IDF值

    def __init__(self,word):

        self.word = word

f = open("C:/Users/zw/Desktop/key-words.txt", 'r')

line='start'

docList = DocumentSet()

while line:

    line = f.readline()

    datafile = line.split('\t')

    if(datafile.__len__()>=2):

        doc = Document(datafile[0])

        wordList = list(jieba.cut(datafile[1]))

        for i in wordList:

            doc.docKeySumCount = doc.docKeySumCount + 1

            if i not in doc.docKeySet.keys():

                doc.docKeySet[i] = DocKey(i)

            else:

                doc.docKeySet[i].docKeyCount = doc.docKeySet[i].docKeyCount+1

            #记录包含关键词的文章数

            if doc.docKeySet[i].docKeyCount <= 1:

                if i not in docList.key_Count.keys():

                    docList.key_Count[i]=1

                else:

                    docList.key_Count[i]=docList.key_Count[i]+1

    docList.documentList.append(doc)

f.close()

for d in docList.documentList:

    for k in d.docKeySet.keys():

        d.docKeySet[k].TF_IDF = d.docKeySet[k].docKeyCount/d.docKeySumCount + math.log(docList.documentList.__len__()/docList.key_Count[k])

        print ('文章id :%s  关键字【%s】的TF-IDF值为:%s',d.docid ,k,  d.docKeySet[k].TF_IDF)

TF-IDF算法——原理及实现的更多相关文章

Elasticsearch由浅入深（十）搜索引擎：相关度评分 TF&IDF算法、doc value正排索引、解密query、fetch phrase原理、Bouncing Results问题、基于scoll技术滚动搜索大量数据
相关度评分 TF&IDF算法 Elasticsearch的相关度评分(relevance score)算法采用的是term frequency/inverse document frequen ...
tf–idf算法解释及其python代码实现(下)
tf–idf算法python代码实现这是我写的一个tf-idf的简单实现的代码,我们知道tfidf=tf*idf,所以可以分别计算tf和idf值在相乘,首先我们创建一个简单的语料库,作为例子,只有四 ...
tf–idf算法解释及其python代码实现(上)
tf–idf算法解释 tf–idf, 是term frequency–inverse document frequency的缩写,它通常用来衡量一个词对在一个语料库中对它所在的文档有多重要,常用在信息 ...
55.TF/IDF算法
主要知识点: TF/IDF算法介绍查看es计算_source的过程及各词条的分数查看一个document是如何被匹配到的一.算法介绍 relevance score算法,简单来说 ...
tf–idf算法解释及其python代码
tf–idf算法python代码实现这是我写的一个tf-idf的简单实现的代码,我们知道tfidf=tf*idf,所以可以分别计算tf和idf值在相乘,首先我们创建一个简单的语料库,作为例子,只有四 ...
25.TF&IDF算法以及向量空间模型算法
主要知识点: boolean model IF/IDF vector space model 一.boolean model 在es做各种搜索进行打分排序时,会先用boolean mo ...
Elasticsearch学习之相关度评分TF&IDF
relevance score算法,简单来说,就是计算出,一个索引中的文本,与搜索文本,他们之间的关联匹配程度 Elasticsearch使用的是 term frequency/inverse doc ...
基于TF/IDF的聚类算法原理
一.TF/IDF描述单个term与特定document的相关性TF(Term Frequency): 表示一个term与某个document的相关性. 公式为这个term在document中出 ...
信息检索中的TF/IDF概念与算法的解释
https://blog.csdn.net/class_brick/article/details/79135909 概念 TF-IDF(term frequency–inverse document ...
广告系统中weak-and算法原理及编码验证
wand(weak and)算法基本思路一般搜索的query比较短,但如果query比较长,如是一段文本,需要搜索相似的文本,这时候一般就需要wand算法,该算法在广告系统中有比较成熟的应该,主要 ...

随机推荐

牛客网暑期ACM多校训练营（第三场） A PACM Team 01背包记录路径
链接:https://www.nowcoder.com/acm/contest/141/A来源:牛客网 Eddy was a contestant participating in ACM ICPC ...
JavaScript数组和伪数组
伪数组和数组记住一句话: 伪数组是一个Object,数组是Array. 对象和数组之间的关系 JavaScript的内置函数继承与 Object.prototype. 可以认为new Array() ...
ORACLE官网JAVA学习文档
Trails Covering the Basics 1 Getting Started 1.1 The Java Technology Phenomenon 1.1.1 About the Ja ...
Python(Head First)学习笔记：一
目录: 1 认识Python:Python的特点.安装.开发环境搭建 2 共享代码:连接共享社区.语法.函数.技巧 3 文件与异常:调试.处理错误.迭代.改进.完善 4 持久存储:文件存储.读写 5 ...
HTML5有哪些新特性，移除了哪些元素？如何处理HTML5新标签的浏览器兼容性问题？如何区分HTML和HTML5？
HTML5现在已经不是SGML的子集,主要是关于图像,位置,存储,多任务等功能的增加. 绘画canvas: 用于媒介回放的video和audio元素: 本地离线存储localStorage长期存储数据 ...
java PDF转word的初步实现
package com.springboot.springboot.util; import java.io.File; import java.io.FileOutputStream; import ...
Redis是否安装
1.Redis对否安装(安装好了会出现下面对应的代码) [lk@localhost /]$ whereis redis-cli redis-cli: /usr/local/bin/redis-cli ...
大数据平台搭建 - Mysql在linux上的安装
一.简介 MySQL是一个关系型数据库系统,由瑞典MySQL AB 公司开发,目前属于 Oracle 旗下产品.MySQL 是最流行的关系型数据库管理系统之一,在 WEB 应用方面,MySQL是最好的 ...
[Linux] Linux中重命名文件和文件夹的方法（mv命令和rename命令）
原文链接在Linux下重命名文件或目录,可以使用mv命令或rename命令,这里分享下二者的使用方法. mv命令既可以重命名,又可以移动文件或文件夹. 例子:将目录A重命名为B mv A B 例子: ...
夯实Java基础系列3：一文搞懂String常见面试题，从基础到实战，更有原理分析和源码解析！
目录目录 string基础 Java String 类创建字符串 StringDemo.java 文件代码: String基本用法创建String对象的常用方法 String中常用的方法,用法如 ...

TF-IDF算法——原理及实现

TF-IDF算法——原理及实现的更多相关文章

随机推荐

热门专题