【Spark】通过Spark实现点击流日志分析

文章目录

数据大致内容及格式
统计PV(PageViews)
统计UV(Unique Visitor)
求取TopN

数据大致内容及格式

194.237.142.21 - - [18/Sep/2013:06:49:18 +0000] "GET /wp-content/uploads/2013/07/rstudio-git3.png HTTP/1.1" 304 0 "-" "Mozilla/4.0 (compatible;)"

183.49.46.228 - - [18/Sep/2013:06:49:23 +0000] "-" 400 0 "-" "-"

163.177.71.12 - - [18/Sep/2013:06:49:33 +0000] "HEAD / HTTP/1.1" 200 20 "-" "DNSPod-Monitor/1.0"

163.177.71.12 - - [18/Sep/2013:06:49:36 +0000] "HEAD / HTTP/1.1" 200 20 "-" "DNSPod-Monitor/1.0"

101.226.68.137 - - [18/Sep/2013:06:49:42 +0000] "HEAD / HTTP/1.1" 200 20 "-" "DNSPod-Monitor/1.0"

101.226.68.137 - - [18/Sep/2013:06:49:45 +0000] "HEAD / HTTP/1.1" 200 20 "-" "DNSPod-Monitor/1.0"

60.208.6.156 - - [18/Sep/2013:06:49:48 +0000] "GET /wp-content/uploads/2013/07/rcassandra.png HTTP/1.0" 200 185524 "http://cos.name/category/software/packages/" "Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/29.0.1547.66 Safari/537.36"

222.68.172.190 - - [18/Sep/2013:06:49:57 +0000] "GET /images/my.jpg HTTP/1.1" 200 19939 "http://www.angularjs.cn/A00n" "Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/29.0.1547.66 Safari/537.36"

……

……

统计PV(PageViews)

就是统计日志文件中有多少条数据

关于点击流日志的各种指标可以查看【Hadoop离线基础总结】网站流量日志数据分析系统

import org.apache.spark.rdd.RDD

import org.apache.spark.{SparkConf, SparkContext}

object PvCount {

  def main(args: Array[String]): Unit = {

    //获取SparkConf

    val sparkConf = new SparkConf().setMaster("local[2]").setAppName("PV-Count").set("spark.driver.host", "localhost")

    //创建SparkContext

    val sparkContext = new SparkContext(sparkConf)

    //读取文件

    val fileRDD: RDD[String] = sparkContext.textFile("/Users/zhaozhuang/Desktop/4、Spark/Spark第二天/第二天教案/资料/运营商日志/access.log")

    //统计数量

    val count = fileRDD.count()

    println("一共有"+count+"行数据")

    sparkContext.stop()

  }

}

经统计后得出，数据有 14619条，也就是说PV量为14619

统计UV(Unique Visitor)

实际工作中，一般推荐用cookie而不是IP地址来对UV进行统计，但这里数据只有IP地址，所以目前就按IP算

import org.apache.spark.rdd.RDD

import org.apache.spark.{SparkConf, SparkContext}

object UvCount {

  def main(args: Array[String]): Unit = {

    //获取SparkConf

    val sparkConf = new SparkConf().setAppName("UV-Count").setMaster("local[2]").set("spark.driver.host","localhost")

    //创建SparkContext

    val sparkContext = new SparkContext(sparkConf)

    //筛选日志

    sparkContext.setLogLevel("WARN")

    //读取文件

    val fileRDD: RDD[String] = sparkContext.textFile("/Users/zhaozhuang/Desktop/4、Spark/Spark第二天/第二天教案/资料/运营商日志/access.log")

    //从所有数据中剔除掉不需要的数据，只拿到IP地址

    val getIpRDD: RDD[String] = fileRDD.map(_.split(" ")(0))

    //对IP地址进行去重，去重后数据减少，就可以将分区缩减为1个

    val distinctedRDD: RDD[String] = getIpRDD.distinct(1)

    //对去重后的数据进行计数统计

    val count: Long = distinctedRDD.count()

    println(count)

    sparkContext.stop()

  }

}

统计得出UV量为1050

求取TopN

有两种方法可以用，take()和top() 都可以

import org.apache.spark.rdd.RDD

import org.apache.spark.{SparkConf, SparkContext}

object GetTopN {

  def main(args: Array[String]): Unit = {

    //获取SparkConf

    val sparkConf = new SparkConf().setMaster("local[2]").set("spark.driver.host", "localhost").setAppName("getTopN")

    //获取SparkContext

    val sparkContext: SparkContext = new SparkContext(sparkConf)

    //读取文件

    val fileRDD: RDD[String] = sparkContext.textFile("/Users/zhaozhuang/Desktop/4、Spark/Spark第二天/第二天教案/资料/运营商日志/access.log")

    //筛选日志

    sparkContext.setLogLevel("WARN")

    //194.237.142.21 - - [18/Sep/2013:06:49:18 +0000] "GET /wp-content/uploads/2013/07/rstudio-git3.png HTTP/1.1" 304 0 "-" "Mozilla/4.0 (compatible;)"

    //以上是数据格式，首先对数据进行切割

    val valueRDD: RDD[Array[String]] = fileRDD.map(x => x.split(" "))

    /*

    数据切割后的形式

    194.237.142.21

    -

    -

    [18/Sep/2013:06:49:18

     +0000]

     "GET

     /wp-content/uploads/2013/07/rstudio-git3.png

     HTTP/1.1"

     304

     0

     "-"

     "Mozilla/4.0

     (compatible;)"

     */

    //日志数据中，下标为10的数据为我们要求取的数据（http_refer），所以切割后数组中少于10条的为无效数据

    //先将无效数据过滤掉

    val filterRDD: RDD[Array[String]] = valueRDD.filter(arr => arr.length > 10)

    //获取每一个http_refer的url，并计作一次

    val urlAndOne: RDD[(String, Int)] = filterRDD.map(x => (x(10), 1))

    //将url相同的次数相加

    val reduceRDD: RDD[(String, Int)] = urlAndOne.reduceByKey(_ + _)

    //将拿到的url+次数进行排序,false为降序，不填或true为升序

    val sortRDD: RDD[(String, Int)] = reduceRDD.sortBy(x => x._2, false)

    //求取TopN，两种方法take(N)或者top(N)

    val topRDD: Array[(String, Int)] = sortRDD.take(10)

    println(topRDD.toBuffer)

    sparkContext.stop()

  }

}

拿到控制台结果为：

ArrayBuffer(("-",5205), (“http://blog.fens.me/category/hadoop-action/”,547), (“http://blog.fens.me/”,377), (“http://blog.fens.me/wp-admin/post.php?post=2445&action=edit&message=10”,360), (“http://blog.fens.me/r-json-rjson/”,274), (“http://blog.fens.me/angularjs-webstorm-ide/”,271), (“http://blog.fens.me/wp-content/themes/silesia/style.css”,228), (“http://blog.fens.me/nodejs-express3/”,198), (“http://blog.fens.me/hadoop-mahout-roadmap/”,182), (“http://blog.fens.me/vps-ip-dns/”,176))

【Spark】通过Spark实现点击流日志分析的更多相关文章

大数据学习——点击流日志每天都10T，在业务应用服务器上，需要准实时上传至（Hadoop HDFS）上
点击流日志每天都10T,在业务应用服务器上,需要准实时上传至(Hadoop HDFS)上 1需求说明点击流日志每天都10T,在业务应用服务器上,需要准实时上传至(Hadoop HDFS)上 2需求分 ...
基于Kafka+Spark Streaming+HBase实时点击流案例
背景 Kafka实时记录从数据采集工具Flume或业务系统实时接口收集数据,并作为消息缓冲组件为上游实时计算框架提供可靠数据支撑,Spark 1.3版本后支持两种整合Kafka机制(Receiver- ...
苏宁基于Spark Streaming的实时日志分析系统实践 Spark Streaming 在数据平台日志解析功能的应用
https://mp.weixin.qq.com/s/KPTM02-ICt72_7ZdRZIHBA 苏宁基于Spark Streaming的实时日志分析系统实践原创: AI+落地实践 AI前线 20 ...
Spark 实践——基于 Spark Streaming 的实时日志分析系统
本文基于<Spark 最佳实践>第6章 Spark 流式计算. 我们知道网站用户访问流量是不间断的,基于网站的访问日志,即 Web log 分析是典型的流式实时计算应用场景.比如百度统计, ...
.Spark Streaming（上）--实时流计算Spark Streaming原理介
Spark入门实战系列--7.Spark Streaming(上)--实时流计算Spark Streaming原理介绍 http://www.cnblogs.com/shishanyuan/p/474 ...
spark提交异常日志分析
java.lang.NoSuchMethodError: org.apache.spark.sql.SQLContext.sql(Ljava/lang/String;)Lorg/apache/spar ...
Spark Streaming揭秘 Day31 集群模式下SparkStreaming日志分析（续）
Spark Streaming揭秘 Day31 集群模式下SparkStreaming日志分析(续) 今天延续昨天的内容,主要对为什么一个处理会分解成多个Job执行进行解析. 让我们跟踪下Job调用过 ...
Spark Streaming揭秘 Day30 集群模式下SparkStreaming日志分析
Spark Streaming揭秘 Day30 集群模式下SparkStreaming日志分析今天通过集群运行模式观察.研究和透彻的刨析SparkStreaming的日志和web监控台. Day28 ...
024 关于spark中日志分析案例
1.四个需求需求一:求contentsize的平均值.最小值.最大值需求二:请各个不同返回值的出现的数据 ===> wordCount程序需求三:获取访问次数超过N次的IP地址需求四:获 ...

随机推荐

Simple Chat Application for Python
一.知识点介绍: asyncore .asynchat模块使用由于 Python 是一门带 GIL 的语言,所以在 Python 中使用多线程处理IO操作过多的任务并不是很好的选择.同时聊天服务器将 ...
第九节：os、sys、json、pickle、shelve模块
OS模块: os.getcwd()获取当前路径os.chdir()改变目录os.curdir返回当前目录os.pardir()父目录os.makedirs('a/b/c')创建多层目录os.remov ...
linux 下强大的 JSON 解析命令 jq
介绍 jq is like sed for JSON data - you can use it to slice and filter and map and transform structure ...
学习Salesforce | Einstein业务机会评分怎么玩
Einstein 业务机会评分(Opportunity Scoring)是销售团队的得力助手,通过分数以及研究影响分数的因素,确定业务机会的优先级,赢得更多交易. Einstein 业务机会评分可以给 ...
1324E - Sleeping Schedule
题目大意:一天有h个小时,一个人喜欢睡觉,一共睡n次,每次都睡h个小时,开始时间为0,间隔a[i]或a[i]-1个小时开始睡第i次觉,每天都有一个最好时间区间,问这n次觉,最多有多少次是在最好时间内睡 ...
Jmeter工具组件简单认识
JMETER 所有的组件(元素)都是基于测试计划的,先有测试计划然后才有 JMETER 组件 JMETER 核心组件1.JMETER中的 Threads 类似与线程数,每一个线程数代表一个虚拟用户:测 ...
IO多路复用小故事
背景故事小王住在某城市, 生活并长大. 最近, 小城引进了一个企业, 邮局. 这个邮局可了不得, 只要你花上几角钱, 就可以将一封信送到千里之外的朋友手中. 小王也趁机体验了一把, 得劲. 这天, ...
liunx常用知识基本命令大全
liunx基础命令使用标签(空格分隔):liunx常用命令网络配置虚拟网卡的绝对路径 /etc/sysconfig/network-scripts/ifcfg-eth0 DEVICE=eth0 ...
详解PHP中instanceof关键字及instanceof关键字有什么作用
来源:https://www.jb51.net/article/74409.htm PHP5的另一个新成员是instdnceof关键字.使用这个关键字可以确定一个对象是类的实例.类的子类,还是实现了某 ...
小程序里button边框有黑线解决办法(自定义button样式)
.go_to_user::after{ border:1px solid transparent; } button的class为go_to_user button{ padding:; box-si ...