Spark读取HDFS文件，文件格式为GB2312，转换为UTF-8

package iie.udps.example.operator.spark;

import scala.Tuple2;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.io.LongWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.lib.input.TextInputFormat;

import org.apache.spark.SparkConf;

import org.apache.spark.api.java.JavaPairRDD;

import org.apache.spark.api.java.JavaRDD;

import org.apache.spark.api.java.JavaSparkContext;

import org.apache.spark.api.java.function.FlatMapFunction;

import org.apache.spark.api.java.function.Function;

import org.apache.spark.api.java.function.Function2;

import org.apache.spark.api.java.function.PairFunction;

import java.io.UnsupportedEncodingException;

import java.nio.charset.Charset;

import java.util.Arrays;

import java.util.regex.Pattern;

/**

 * 利用Spark框架读取HDFS文件，文件格式为GB2312，转换为UTF-8，实现WordCount示例

 *

 * 执行命令：spark-submit --class iie.hadoop.hcatalog.TextFileSparkTest --master

 * yarn-cluster /tmp/sparkTest.jar hdfs://192.168.8.101/test/words

 * hdfs://192.168.8.101/test/spark/out

 *

 *

 */

public final class SparkChangeTextCharsetTest {

	private static final Pattern SPACE = Pattern.compile(",");

	@SuppressWarnings("serial")

	public static void main(String[] args) throws Exception {

		if (args.length < 2) {

			System.err.println("Usage: JavaWordCount <file>");

			System.exit(1);

		}

		String inputSparkFile = args[0];

		String outputSparkFile = args[1];

		SparkConf sparkConf = new SparkConf().setAppName("SparkWordCount");

		JavaSparkContext ctx = new JavaSparkContext(sparkConf);

		Configuration conf = new Configuration();

		JavaPairRDD<LongWritable, Text> contents = ctx.newAPIHadoopFile(

				inputSparkFile, TextInputFormat.class, LongWritable.class,

				Text.class, conf);

		JavaRDD<String> lines = contents

				.map(new Function<Tuple2<LongWritable, Text>, String>() {

					public String call(Tuple2<LongWritable, Text> x) {

						String lines = null;

						try {

							lines = new String(x._2().getBytes(), 0, x._2()

									.getLength(), "GB2312");

						} catch (UnsupportedEncodingException e) {

							e.printStackTrace();

						}

						return lines;

					}

				});

		// JavaRDD<String> changeLines = lines

		// .filter(new Function<String, Boolean>() {

		// public Boolean call(String s) {

		// return s.contains("234");

		// }

		// });

		 JavaRDD<String> words = lines

		 .flatMap(new FlatMapFunction<String, String>() {

		 @Override

		 public Iterable<String> call(String s) {

		 return Arrays.asList(SPACE.split(s));

		 }

		 });

		 JavaPairRDD<String, Integer> ones = words

		 .mapToPair(new PairFunction<String, String, Integer>() {

		 @Override

		 public Tuple2<String, Integer> call(String s) {

		 return new Tuple2<String, Integer>(s, 1);

		 }

		 });

		 JavaPairRDD<String, Integer> counts = ones

		 .reduceByKey(new Function2<Integer, Integer, Integer>() {

		 @Override

		 public Integer call(Integer i1, Integer i2) {

		 return i1 + i2;

		 }

		 });

		 counts.map(new Function<Tuple2<String, Integer>, String>() {

		 @Override

		 public String call(Tuple2<String, Integer> arg0) throws Exception {

		 return arg0._1.toUpperCase() + ": " + arg0._2;

		 }

		 }).saveAsTextFile(outputSparkFile);

		ctx.stop();

	}

}

Spark读取HDFS文件，文件格式为GB2312，转换为UTF-8的更多相关文章

Spark读取HDFS文件，任务本地化(NODE_LOCAL)
Spark也有数据本地化的概念(Data Locality),这和MapReduce的Local Task差不多,如果读取HDFS文件,Spark则会根据数据的存储位置,分配离数据存储最近的Execu ...
问题记录：spark读取hdfs文件出错
错误信息: scala> val file = sc.textFile("hdfs://kit-b5:9000/input/README.txt") 13/10/29 16: ...
Spark读取HDFS中的Zip文件
1. 任务背景近日有个项目任务,要求读取压缩在Zip中的百科HTML文件,经分析发现,提供的Zip文件有如下特点(=>指代对应解决方案): (1) 压缩为分卷文件 => 只需将解压缩在同 ...
spark读hdfs文件实现wordcount并将结果存回hdfs
package iie.udps.example.operator.spark; import scala.Tuple2; import org.apache.spark.SparkConf; imp ...
记录一次读取hdfs文件时出现的问题java.net.ConnectException: Connection refused
公司的hadoop集群是之前的同事搭建的,我(小白一个)在spark shell中读取hdfs上的文件时,执行以下指令 >>> word=sc.textFile("hdfs ...
大数据学习day20-----spark03-----RDD编程实战案例（1 计算订单分类成交金额，2 将订单信息关联分类信息，并将这些数据存入Hbase中，3 使用Spark读取日志文件，根据Ip地址，查询地址对应的位置信息
1 RDD编程实战案例一数据样例字段说明: 其中cid中1代表手机,2代表家具,3代表服装 1.1 计算订单分类成交金额需求:在给定的订单数据,根据订单的分类ID进行聚合,然后管理订单分类名称, ...
Spark设置自定义的InputFormat读取HDFS文件
本文通过MetaWeblog自动发布,原文及更新链接:https://extendswind.top/posts/technical/problem_spark_reading_hdfs_serial ...
spark读取hdfs上的文件和写入数据到hdfs上面
def main(args: Array[String]): Unit = { val conf = new SparkConf() conf.set("spark.master" ...
spark读取本地文件
/** * Read a text file from HDFS, a local file system (available on all nodes), or any * Hadoop-supp ...

随机推荐

was7中文redhat6上安装出现中文乱码解决方案
转:http://blog.csdn.net/w1985g/article/details/8789378 在rhel-server-6.1-x86_64上安装WebSphere 7时,安装界面出现中 ...
C# Lodop实现打印
项目的Debug文件夹下有个template文件夹,里面有用到的js.自己建的要打印的网页和用到的背景图 1.打印方法: class print { public void printzb(strin ...
Code First Migrations更新数据库结构的具体步骤
一.打开程序包管理器控制台当你的实体模型与数据库架构不一致时,引发以下错误:The model backingthe 'SchoolContext' context has changed sinc ...
Memcached 及 Redis 架构分析和比较
Memcached和Redis作为两种Inmemory的key-value数据库,在设计和思想方面有着很多共通的地方,功能和应用方面在很多场合下(作为分布式缓存服务器使用等) 也很相似,在这里把两者放 ...
HMM TOOL
HMM隐马尔科夫模型 MATLAB 工具包对各种数据的处理 HMM 工具包下载地址: http://www.cs.ubc.ca/~murphyk/Software/HMM/hmm.html 工具包使用 ...
IT公司100题-13-求链表中倒数第k个结点
问题描述: 输入一个单向链表,输出该链表中倒数第k个结点.链表倒数第0个节点为NULL. struct list_node { int data; list_node* next; }; 分析: 方法 ...
第一次使用Git心得体会
用书本上的概念讲,Git是一个分布式的版本控制工具,每一个Git的工作目录都是一个完全独立的代码库,并拥有完整的历史记录和版本追踪能力,能够不依赖于网络和中心服务器.也就是说Git能够不需要服务器而在 ...
RPI学习--环境搭建_刷卡+wiringPi库安装
1,镜像地址 http://www.raspberrypi.org/downloads/ 2,Windows下刷写工具 Win32 Disk Imager 3,安装wiringPi库 (这里在连网状态 ...
sql 语句中使用条件判断case then else end
sql 语句中使用条件判断case then else end范例: SELECT les.[nLessonNo] FROM BS_Lesson AS les WHERE les.[sClassCod ...
分布式Nginx缓存清理(PHP的socket编程)
最近,公司要使用康乐的几台自建CDN换成Nginx,在缓存配置上不会有很多的问题,纠结的问题是:Nginx的如何批量进行缓存清理我们都知道Nginx提供了一个第三方的模块"nginx ng ...

Spark读取HDFS文件，文件格式为GB2312，转换为UTF-8

Spark读取HDFS文件，文件格式为GB2312，转换为UTF-8的更多相关文章

随机推荐

热门专题