机器学习综合库gensim 简单搞定文本相似度

不废话直接代码吧

# 1.模块导入

import jieba

import gensim

from gensim import corpora

from gensim import models

from gensim import similarities

# 2.制作问题库

# 2.制作问题库

l1 = ["你叫什么名字", "你的姓名是什么", "你的体重是多少", "你的年龄是多少"]  # 问题库

# 3.对问题样本和问题库分词处理

a = "请问你的名称"  # 问题样本

all_doc_list = []

for doc in l1:

    doc_list = [word for word in jieba.cut(doc)]

    all_doc_list.append(doc_list)

doc_test_list = [word for word in jieba.cut(a)]

print(all_doc_list)

print(doc_test_list)

# 4.制作语料库

dictionary = corpora.Dictionary(all_doc_list)  # 制作词袋

# 词袋的理解

# 词袋就是将很多很多的词,进行排列形成一个 词(key) 与一个 标志位(value) 的字典

# 例如: {'什么': 0, '你': 1, '叫': 2, '名字': 3, '姓名': 4, '是': 5, '的': 6, '体重': 7, '多少': 8, '年龄': 9}

print("token2id", dictionary.token2id)

print("dictionary", dictionary, type(dictionary))

# -->问题库的语料库

corpus = [dictionary.doc2bow(doc) for doc in all_doc_list]

# 语料库:

# 这里是将all_doc_list 中的每一个列表中的词语 与 dictionary 中的Key进行匹配

# 得到一个匹配后的结果,例如['你', '叫', '什么', '名字']

# 就可以得到 [(0, 1), (1, 1), (2, 1), (3, 1)]

# 依次:0代表的的是 你 1代表出现一次, 1代表的是 叫  1代表出现了一次, 以此类推

print("corpus", corpus, type(corpus))

# -->问题的语料库

# 将需要寻找相似度的分词列表 做成 语料库 doc_test_vec

doc_test_vec = dictionary.doc2bow(doc_test_list)

print("doc_test_vec", doc_test_vec, type(doc_test_vec))

# 5. 将corpus语料库(初识语料库) 使用Lsi模型进行训练

lsi = models.LsiModel(corpus)

# 模型有很多,这里的只是需要学习Lsi模型来了解的,这里不做阐述

print("lsi", lsi, type(lsi))

# 语料库corpus的训练结果

print("lsi[corpus]", lsi[corpus])

# 获得语料库doc_test_vec 在 语料库corpus的训练结果 中的 向量表示

print("lsi[doc_test_vec]", lsi[doc_test_vec])

# 6. 获取文本相似度

# 稀疏矩阵相似度 将 主 语料库corpus的训练结果 作为初始值

index = similarities.SparseMatrixSimilarity(lsi[corpus], num_features=len(dictionary.keys()))

print("index", index, type(index))

# 将 语料库doc_test_vec 在 语料库corpus的训练结果 中的 向量表示 与 语料库corpus的 向量表示 做矩阵相似度计算

sim = index[lsi[doc_test_vec]]

print("sim", sim, type(sim))

# 7. 获取相似度最高的结果

# 对下标和相似度结果进行一个排序,拿出相似度最高的结果

# cc = sorted(enumerate(sim), key=lambda item: item[1],reverse=True)

cc = sorted(enumerate(sim), key=lambda item: -item[1])

print(cc)

text = l1[cc[0][0]]

print(a,text)

机器学习综合库gensim 简单搞定文本相似度的更多相关文章

【机器学习】使用gensim 的 doc2vec 实现文本相似度检测
环境 Python3, gensim,jieba,numpy ,pandas 原理:文章转成向量,然后在计算两个向量的余弦值. Gensim gensim是一个python的自然语言处理库,能够将文档 ...
python入门机器学习，3行代码搞定线性回归
本文着重是重新梳理一下线性回归的概念,至于几行代码实现,那个不重要,概念明确了,代码自然水到渠成. “机器学习”对于普通大众来说可能会比较陌生,但是“人工智能”这个词简直是太火了,即便是风云变化的股市 ...
100天搞定机器学习|Day11 实现KNN
机器学习100天|Day1数据预处理 100天搞定机器学习|Day2简单线性回归分析 100天搞定机器学习|Day3多元线性回归 100天搞定机器学习|Day4-6 逻辑回归 100天搞定机器学习|D ...
100天搞定机器学习|Day16 通过内核技巧实现SVM
前情回顾机器学习100天|Day1数据预处理100天搞定机器学习|Day2简单线性回归分析100天搞定机器学习|Day3多元线性回归100天搞定机器学习|Day4-6 逻辑回归100天搞定机器学习| ...
100天搞定机器学习|Day21 Beautiful Soup
前情回顾机器学习100天|Day1数据预处理 100天搞定机器学习|Day2简单线性回归分析 100天搞定机器学习|Day3多元线性回归 100天搞定机器学习|Day4-6 逻辑回归 100天搞定机 ...
100天搞定机器学习|Day22 机器为什么能学习？
前情回顾机器学习100天|Day1数据预处理 100天搞定机器学习|Day2简单线性回归分析 100天搞定机器学习|Day3多元线性回归 100天搞定机器学习|Day4-6 逻辑回归 100天搞定机 ...
100天搞定机器学习|day40-42 Tensorflow Keras识别猫狗
100天搞定机器学习|1-38天 100天搞定机器学习|day39 Tensorflow Keras手写数字识别前文我们用keras的Sequential 模型实现mnist手写数字识别,准确率0. ...
100天搞定机器学习|Day9-12 支持向量机
机器学习100天|Day1数据预处理 100天搞定机器学习|Day2简单线性回归分析 100天搞定机器学习|Day3多元线性回归 100天搞定机器学习|Day4-6 逻辑回归 100天搞定机器学习|D ...
100天搞定机器学习|Day17-18 神奇的逻辑回归
前情回顾机器学习100天|Day1数据预处理 100天搞定机器学习|Day2简单线性回归分析 100天搞定机器学习|Day3多元线性回归 100天搞定机器学习|Day4-6 逻辑回归 100天搞定机 ...

随机推荐

号外！号外！这个敏捷高效的大数据bi看板可以免费使用啦！
随着信息革命的深入推进,数据已经成为国家基础性战略资源,各个行业开始重视数据分析,企业不同,数据分析需求当然不一样,如销售行业需要对商品进行销售分析:网站运营需要进行用户.渠道.流量等信息分析:制造行 ...
C# Struct结构的介绍
C# (Struct)结构的介绍在 C# 中,所有简单值类型都是结构类型.结构类型是一种可封装数据和相关功能的值类型 ,是隐式密封的值类型,不可继承. 使用 struct 关键字定义结构类型.str ...
不知道这10个术语，你还敢说会JavaScript？
每个行业,都有业内"行话",不了解这些行话的人,很难融入到行业中,也永远装不了逼. 从Curry到Closes,有很多JavaScript行话(该领域中使用的特殊词汇)知道这些行话 ...
Git——版本控制器概述
一.版本控制版本控制(Revision contontrol)是一种在开发过程中用于管理修改历史,方便查看更改历史记录,备份以便恢复以前版本的软件工程的技术. 1.实现跨区域多人协同开发 2.追踪和 ...
WARN node unsupported "node@v6.11.2" is ......(windows系统更新node版本)
问题: 使用npm下载文件时报错:WARN node unsupported "node@v6.11.2" is incompatible with electron@^7.1.9 ...
云e办笔记（删减）
1JwtTokenUtils工具 2公共返回对象 3Admin实现UserDetails 4AdminLoginParam 5AdminLoginController 6SecurityConfig ...
PHP防止订单超卖,秒杀,限购,PHP高并发防止超卖代码实践
建表 1.订单表 CREATE TABLE `order` ( `id` int(11) NOT NULL AUTO_INCREMENT, `order_sn` varchar(45) NOT NUL ...
composer.json和composer.lock到底是什么以及区别？
composer方文档:https://docs.phpcomposer.com/04-schema.html我们在做项目的时候,总是要安装一些依赖.composer给我们提供了很多方便.直接运行co ...
tensorflow源码解析之common_runtime-direct_session
目录核心概念 direct_session direct_session.h direct_session.cc 1. 核心概念读过之前文章的读者应该还记得,session是一个执行代理.我们把计 ...
Chrome浏览器打开图标显示空白
复制下面命令存到.bat 文件中,并允许bat文件 taskkill /f /im explorer.exeattrib -h -i %userprofile%\AppData\Local\IconC ...

机器学习综合库gensim 简单搞定文本相似度

不废话直接代码吧

机器学习综合库gensim 简单搞定文本相似度的更多相关文章

随机推荐

热门专题