spark 集成elasticsearch

pyspark读写elasticsearch依赖elasticsearch-hadoop包，需要首先在这里下载，版本号可以通过自行修改url解决。

"""

write data to elastic search

https://starsift.com/2018/01/18/integrating-pyspark-and-elasticsearch/

"""

from __future__ import print_function

import os

import json

from pyspark import SparkContext

from pyspark import SparkConf

os.environ["PYSPARK_PYTHON"] = "/usr/bin/python3"

os.environ["PYSPARK_DRIVER_PYTHON"] = "/usr/bin/python3"

# pay attention here, jars could be added at here

os.environ['PYSPARK_SUBMIT_ARGS'] = \

    '--jars /home/buxizhizhoum/2-Learning/pyspark_tutorial/jars/elasticsearch-hadoop-6.4.2/dist/elasticsearch-spark-20_2.11-6.4.2.jar ' \

    '--packages org.apache.spark:spark-streaming-kafka-0-8_2.11:2.3.1 ' \

    'pyspark-shell'

conf = SparkConf().setAppName("write_es").setMaster("local[2]")

sc = SparkContext(conf=conf)

# config refer: https://www.elastic.co/guide/en/elasticsearch/hadoop/current/configuration.html

es_write_conf = {

    # specify the node that we are sending data to (this should be the master)

    "es.nodes": 'localhost',

    # specify the port in case it is not the default port

    "es.port": '',

    # specify a resource in the form 'index/doc-type'

    "es.resource": 'testindex/testdoc',

    # is the input JSON?

    "es.input.json": "yes",

    # is there a field in the mapping that should be used to specify the ES document ID

    "es.mapping.id": "doc_id"

}

if __name__ == "__main__":

    data = [

        {'': '', 'doc_id': 1},

        {'': '', 'doc_id': 2},

        {'': '', 'doc_id': 3},

        {'': '', 'doc_id': 4},

        {'': '', 'doc_id': 5},

        {'': '', 'doc_id': 6},

        {'': '', 'doc_id': 7},

        {'': '', 'doc_id': 8},

        {'': '', 'doc_id': 9},

        {'': '', 'doc_id': 10}

    ]

    rdd = sc.parallelize(data)

    rdd = rdd.map(lambda x: (x["doc_id"], json.dumps(x)))

    rdd.saveAsNewAPIHadoopFile(

        path='-',

        outputFormatClass="org.elasticsearch.hadoop.mr.EsOutputFormat",

        keyClass="org.apache.hadoop.io.NullWritable",

        valueClass="org.elasticsearch.hadoop.mr.LinkedMapWritable",

        # critically, we must specify our `es_write_conf`

        conf=es_write_conf)

refer: https://starsift.com/2018/01/18/integrating-pyspark-and-elasticsearch/

spark 集成elasticsearch的更多相关文章

Spark：利用Eclipse构建Spark集成开发环境
前一篇文章“Apache Spark学习:将Spark部署到Hadoop 2.2.0上”介绍了如何使用Maven编译生成可直接运行在Hadoop 2.2.0上的Spark jar包,而本文则在此基础上 ...
使用spark访问elasticsearch的数据
使用spark访问elasticsearch的数据,前提是spark能访问hive,hive能访问es http://blog.csdn.net/ggz631047367/article/detail ...
spark集成hive遭遇mysql check失败的问题
问题: spark集成hive,启动spark-shell或者spark-sql的时候,报错: INFO MetaStoreDirectSql: MySQL check failed, assumin ...
springboot集成elasticsearch
在基础阶段学习ES一般是首先是安装ES后借助 Kibana 来进行CURD 了解ES的使用: 在进阶阶段可以需要学习ES的底层原理,如何通过Version来实现乐观锁保证ES不出问题等核心原理: 第 ...
Spark 整合ElasticSearch
Spark 整合ElasticSearch 因为做资料搜索用到了ElasticSearch,最近又了解一下 Spark ML,先来演示一个Spark 读取/写入 ElasticSearch 简单示例. ...
使用Logstash同步数据至Elasticsearch，Spring Boot中集成Elasticsearch实现搜索
安装logstash.同步数据至ElasticSearch 为什么使用logstash来同步,CSDN上有一篇文章简要的分析了以下几种同步工具的优缺点:https://blog.csdn.net/la ...
Spark搭档Elasticsearch
Spark与elasticsearch结合使用是一种常用的场景,小编在这里整理了一些Spark与ES结合使用的方法.一. write data to elasticsearch利用elasticsea ...
SpringBoot 集成 Elasticsearch
前面在 ubuntu 完成安装 elasticsearch,现在我们SpringBoot将集成elasticsearch. 1.创建SpringBoot项目我们这边直接引入NoSql中Spring ...
数据湖应用解析：Spark on Elasticsearch一致性问题
摘要:脏数据对数据计算的正确性带来了很严重的影响.因此,我们需要探索一种方法,能够实现Spark写入Elasticsearch数据的可靠性与正确性. 概述 Spark与Elasticsearch(es ...

随机推荐

ssh连接docker容器
有两种方法: 1.通过宿主机的端口映射访问docker 在宿主机上启动容器,分配端口,启用ssh服务: docker run -p 10022:22 -d sshd:ubuntu /usr/sbin/ ...
【转载】这样去写你的HTML
昨天在 twitter 上说,怎么忍心把页面写得这么难用?是的,这个世界还有一群人等着我们创建出来的东西,可以让他们的生活能过得更容易呢.比如那些需要读屏软件的用户.作为一个前端,我们又怎么会忍心呢. ...
c#属性 ——面向对象
String. Format(字符串格式化输出) 相当于Console.WriteLine(字符串格式化输出); 而String.Format是返回一个字符串属性: 因为把字段全public,会非常 ...
游戏设计思考：对COK的理解和思考
转自:http://www.gameres.com/804983.html 一.前言发此文的起因是最近加入了一个游戏研究群,受到大家对游戏研究热情的感染,也想将自己对游戏的理解和感悟发出来和大家一起 ...
windows 日志解决方法
1.sql server 2012 报错 MSSQLSERVER 服务无法使用当前配置的密码以 .\MSSQL_SF_A9JGSK 身份登录,错误原因如下: 此帐户的密码已过期. 要确保服务配置正确, ...
第2章 GNS3和PacketTracer网络模拟器（3）_搭建Packet tracer实验环境
3. Packet tracer实验环境 3.1 设置网络拓扑图 (1)配置路由器局域网和广域网接口,如上图(可双击相应的图标,然后在命令行或图形界面上进行IP地址等配置) ①本例采用“Generic ...
(转)SQL知识_Sql日期时间格式转换
原文地址:http://www.cnblogs.com/Gavinzhao/archive/2009/11/10/1599690.html sql server2000中使用convert来取得dat ...
cocos源码分析--LayerColor的绘制过程
1开始,先创建一个LayerColor Scene *scene=Scene::create(); director->runWithScene(scene); //目标 auto layer ...
ElasticSearch索引
简介索引是具有相同结构的文档集合.在Elasticsearch中索引是个非常重要的内容,对Elasticsearch的大部分操作都是基于索引来完成的.同时索引可以类比关系型数据库Mysql中的数据库 ...
Javascript异步编程的4种方法（阮一峰）
转载: http://www.ruanyifeng.com/blog/2012/12/asynchronous%EF%BC%BFjavascript.html 你可能知道,Javascript语言的执 ...

spark 集成elasticsearch

spark 集成elasticsearch的更多相关文章

随机推荐

热门专题