mongo批量写入es

import pymongo

import math

from elasticsearch import Elasticsearch

from elasticsearch import helpers

import time

HOST = ['ip:端口']

es = Elasticsearch(HOST,timeout=3600) # 链接ES HOST可以是[ip:端口，ip：端口] 的集群

client = pymongo.MongoClient("")  # 链接数据库

db = client["blue_book_news_dev"]["blue_book_news"]

# 统计mongo里面的数量, 计算分页

nums = db.count()

print(nums)

pages = math.ceil(nums/500)

_index = "ai51_main_prod"

start_time = time.time()

for i in range(pages):

    n =  500 * i

    print("第{}多少个500，第{}条".format(i,n))

    l=list(db.find({},projection={'_id':False,'news_url': True,"content":True,"title": True,"publish_time":True}).skip(n).limit(500))

    for line in l:

        actions = []

        if line.get("news_url"):

            action = {

                "_index": _index, #  类似于主键类型

                "_type": "sources", # 类型

                "_id": line["news_url"], # id 如果不自己定义系统会给创建

                "_source": {

                    "page_category": None,

                    "url": line.get("news_url"),

                    "article_title": line.get("title"),

                    "article_content": line.get("content"),

                    "publish_time_raw": line.get("publish_time"),

                    "publish_time_nomalized": None,

                    "summary":None

                }}

            actions.append(action)

        helpers.bulk(es, actions)  # 批量写入

end_time =time.time()

print(start_time-end_time)

mongo批量写入es的更多相关文章

Spring Boot + Elasticsearch 实现索引批量写入
在使用Eleasticsearch进行索引维护的过程中,如果你的应用场景需要频繁的大批量的索引写入,再使用上篇中提到的维护方法的话显然效率是低下的,此时推荐使用bulkIndex来提升效率.批写入数据 ...
Flink从Kafka取数WordCount后TableApi写入ES
一.背景说明需求为从Kafka消费对应主题数据,通过TableApi对数据进行WordCount后,基于DDL写法将数据写入ES. 二.代码部分说明:代码中关于Kafka及ES的连接部分可以抽象到 ...
DataTable数据批量写入数据库三种方法比较
DataTable数据批量写入数据库三种方法比较标签: it 分类: C#1) insert循环插入:2) sqldataadapter.update(dataset,tablename); ...
mysql批量写入
MySQL批量写入语法是: INSERT INTO table (field1,field2,field3) VALUES (“a”,”b”,”c”), (“a1”,”b1”,”c1”),(“a2”, ...
SqlBulkCopy批量写入25万条数据只需3s
Microsoft SQL Server 提供一个称为 bcp 的流行的命令提示符实用工具,用于将数据从一个表移动到另一个表(表既可以在同一个服务器上,也可以在不同服务器上).SqlBulkCopy ...
openerp 产品图片的批量写入
Write a short python script which loops over the image files, encode with base64 and write to OpenER ...
MySQL通用批量写入工具（Python）
背景平台目前的分析任务主要以Hive为主,分析后的结果存储在HDFS,用户通过REST API或者Rsync的方式获取分析结果,这样的方式带来以下几个问题: (1)任务执行结束时间未知,用户 ...
使用XML向SQL Server 2005批量写入数据——一次有关XML时间格式的折腾经历
原文:使用XML向SQL Server 2005批量写入数据——一次有关XML时间格式的折腾经历常常遇到需要向SQL Server插入批量数据,然后在存储过程中对这些数据进行进一步处理的情况.存储过 ...
Python-将json文件写入ES数据库
1.安装Elasticsearch数据库 PS:在此之前需首先安装Java SE环境下载elasticsearch-6.5.2版本,进入/elasticsearch-6.5.2/bin目录,双击执行 ...

随机推荐

驱动备份还原命令——驅動備份還原命令——Driver Backup/Restore
以管理員身份啓動命令提示符,輸入以下命令: 1.驅動備份(备份Backup)命令: Dism /online /export-driver /destionation:D:\DriverBackup ...
【Fiori系列】浅谈SAP Fiori的设计美感与发展历程
公众号:SAP Technical 本文作者:matinal 原文出处:http://www.cnblogs.com/SAPmatinal/ 原文链接:[Fiori系列]浅谈SAP Fiori的设计美 ...
差分约束算法————洛谷P4878 [USACO05DEC] 布局
题目: 不难看出题意主要是给出ml+md个格式为xi-xj<=ak的不等式,xi-xj为i,j俩头牛的距离,要我们求x1-xn的最大值. 经过上下加减我们可以将这几个不等式化成x1-xn< ...
C语言双指针之盛最多水的容器
题目描述给定 n 个非负整数 a1,a2,...,an,每个数代表坐标中的一个点 (i, ai) .在坐标内画 n 条垂直线,垂直线 i 的两个端点分别为 (i, ai) 和 (i, 0).找出其中 ...
Mysql的binlog 和InnoDB的redo-log
来源:https://www.jianshu.com/p/4bcfffb27ed5 mysql日志系统之redo log和bin log Mr林_月生关注 12018.12.02 01:35:06字数 ...
JS中删除数组中的元素方法
删除指定下标数组元素 Array.prototype.del=function(index){ if(isNaN(index)||index>=this.length){ return fals ...
第8课.第一个ARM裸板程序（点亮led）及申引
1.原理图 2.芯片手册 3.几条汇编代码 1.ldr:读内存 ldr R0, [R1] 假设R1的值是x,读取地址x上的数据(4字节),保存到R0中 ldr R0, =0x12345678 (4字节 ...
TemplateView , ListView ，DetailView三种常用类视图用法
参考博客: https://blog.csdn.net/weixin_36571185/article/details/74280102
使用jbc查询数据封装成对象的工具类
适用于获取Connection对象的util package com.briup.myDataSource; import java.io.FileReader; import java.io.Inp ...
Pycharm 误删文件夹
在Linux下操作时误删除了Pycharm项目中的文件夹,打开垃圾桶,居然找不到,立马上网查Linux下怎么恢复文件, 冷静一下,不是还有个Ctrl + Z吗,对着Pycharm 文件浏览器按一下, ...

mongo批量写入es

mongo批量写入es的更多相关文章

随机推荐

热门专题