flume学习（三）：flume将log4j日志数据写入到hdfs（转）

原文链接：flume学习（三）：flume将log4j日志数据写入到hdfs

在第一篇文章中我们是将log4j的日志输出到了agent的日志文件当中。配置文件如下：

tier1.sources=source1
tier1.channels=channel1
tier1.sinks=sink1
tier1.sources.source1.type=avro
tier1.sources.source1.bind=0.0.0.0
tier1.sources.source1.port=44444
tier1.sources.source1.channels=channel1
tier1.channels.channel1.type=memory
tier1.channels.channel1.capacity=10000
tier1.channels.channel1.transactionCapacity=1000
tier1.channels.channel1.keep-alive=30
tier1.sinks.sink1.type=logger
tier1.sinks.sink1.channel=channel1

本次我们把log4j的日志直接采集输出到hdfs中去。需要修改flume.conf中sink的配置：

tier1.sources=source1
tier1.channels=channel1
tier1.sinks=sink1
tier1.sources.source1.type=avro
tier1.sources.source1.bind=0.0.0.0
tier1.sources.source1.port=44444
tier1.sources.source1.channels=channel1
tier1.channels.channel1.type=memory
tier1.channels.channel1.capacity=10000
tier1.channels.channel1.transactionCapacity=1000
tier1.channels.channel1.keep-alive=30
tier1.sinks.sink1.type=hdfs
tier1.sinks.sink1.channel=channel1
tier1.sinks.sink1.hdfs.path=hdfs://master68:8020/flume/events
tier1.sinks.sink1.hdfs.fileType=DataStream
tier1.sinks.sink1.hdfs.writeFormat=Text
tier1.sinks.sink1.hdfs.rollInterval=0
tier1.sinks.sink1.hdfs.rollSize=10240
tier1.sinks.sink1.hdfs.rollCount=0
tier1.sinks.sink1.hdfs.idleTimeout=60

简单说明一下修改的部分，我们将sink的type由logger变为hdfs，然后指定输出path, 默认是输出到HDFS后为sequencefile,里面的内容无法直接打开浏览，为了便于直观看到我们输出的日志信息，所以我这里将fileType为DataStream, writeFormat=Text,这样就可以直接打开生成的文件进行查看了。

下面几个roll开头的参数都是用来控制滚动日志输出的，官方文档上的说明也很详细，我这里配置的只按文件大小来滚动rollSize=10240,也就是10K滚动生成一个新的文件用来接收新的EVENTS。实际中这个Size应该更大一些，我觉得设置成HDFS的blocksize大小应该挺合适的。

idleTimeout设置为60秒（默认值为0），这里面的原理是这样的，flume里面每生成一个接收文件时的命名规则如：FlumeData.1406251462179.tmp，.tmp表示这个文件正在被使用来接收EVENTS，当满10K之后，这个文件会被rename成FlumeData.1406251462179，把.tmp后缀去掉，但是如果你停止了应用程序后，FlumeData.1406251462179.tmp还没满10K，按照默认的idleTimeout设置，不会将它rename,也就是.tmp后缀一直在，造成了这个文件一直在使用当中的一个假象，这是有问题的，我们设置idleTimeout=60，即60秒后这个文件还没有被写入数据，就会关闭它然后rename它去掉.tmp,以后新进来的events，会新开一个.tmp文件来接收。

我们再运行第一篇文章中的那个示例应用程序，然后去path指定的目录下面就能看到log4j输出的日志信息了。

补充注意点（针对cm安装的flume）：

首先在hdfs上创建/flume目录：hadoop fs -mkdir /flume
给该目录授权给flume用户和组：hadoop fs -chown -R flume:flume /flume

注意给目录授权很重要，不然会报错。

flume学习（三）：flume将log4j日志数据写入到hdfs（转）的更多相关文章

Flume学习应用：Java写日志数据到MongoDB
概述 Windows平台:Java写日志到Flume,Flume最终把日志写到MongoDB. 系统环境操作系统:win7 64 JDK:1.6.0_43 资源下载 Maven:3.3.3下载.安装 ...
flink---实时项目--day01--1. openrestry的安装 2. 使用nginx+lua将日志数据写入指定文件中 3. 使用flume将本地磁盘中的日志数据采集到的kafka中去
1. openrestry的安装 OpenResty = Nginx + Lua,是⼀一个增强的Nginx,可以编写lua脚本实现⾮非常灵活的逻辑 (1)安装开发库依赖 yum install -y ...
用Hbase存储Log4j日志数据：HbaseAppender
业务需求: 需求很简单,就是把多个系统的日志数据统一存储到Hbase数据库中,方便统一查看和监控. 解决思路: 写针对Hbase存储的Log4j Appender,有一个简单的日志储存策略,把Log4 ...
大数据学习——有两个海量日志文件存储在hdfs
有两个海量日志文件存储在hdfs上, 其中登陆日志格式:user,ip,time,oper(枚举值:1为上线,2为下线):访问之日格式为:ip,time,url,假设登陆日志中上下线信息完整,切同一上 ...
Poseidon 系统是一个日志搜索平台——认证看链接ppt，本质是索引的倒排列表和原始日志数据都存在HDFS，而文档和倒排的元数据都在NOSQL里，同时针对单个filed都使用了独立索引，使用MR来索引和搜索
Poseidon 系统是一个日志搜索平台,可以在百万亿条.100PB 大小的日志数据中快速分析和检索.360 公司是一个安全公司,在追踪 APT(高级持续威胁)事件,经常需要在海量的历史日志数据中检索 ...
Flume学习 & Kafka & Storm 等 & Log4J 配置
正在学习这篇文章: http://blog.csdn.net/ymh198816/article/details/51998085 和工作中接触的电商.订单.分析,可以结合起来. 开宗明义,这幅图片: ...
第1节 flume：7、flume的监控文件夹，实现数据收集到hdfs上
1.2.2 采集案例 1.采集目录到HDFS 需求分析结构示意图: 采集需求:某服务器的某特定目录下,会不断产生新的文件,每当有新文件出现,就需要把文件采集到HDFS中去根据需求,首先定义以下3大 ...
Python学习笔记_从CSV读取数据写入Excel文件中
本示例特点: 1.读取CSV,写入Excel 2.读取CSV里具体行.具体列,具体行列的值一.系统环境 1. OS:Win10 64位英文版 2. Python 3.7 3. 使用第三方库:csv. ...
hbase 从hbase上读取数据写入到hdfs
Mapper package cn.hbase.mapreduce.hb2hdfs; import java.io.IOException; import org.apache.hadoop.hbas ...

随机推荐

hdu4347
求与询问点欧几里德距离前m小的点其实就是在kdtree询问的时候用优先队列维护一下就好了好久没写kdtree练一练,注意这道题是多测 #include<bits/stdc++.h> u ...
Java 如何获取系统时间
Java 如何获取系统时间 import java.text.SimpleDateFormat; import java.util.Date; public class Test { public s ...
mysql中行转列与列传行的问题
行转列: 使用cross join 的方式使用case-when的方式列转行: SELECT user_name, REPLACE ( substring_index(mobile, ',', a ...
Spark 源码解析：TaskScheduler的任务提交和task最佳位置算法
上篇文章< Spark 源码解析 : DAGScheduler中的DAG划分与提交 >介绍了DAGScheduler的Stage划分算法. 本文继续分析Stage被封装成TaskSet, ...
【ASP.NET】:Ckeditor+Fckeditor的使用
首先这三个文件:下载ckeditor和ckeditor_aspnet_3.6.4和ckfinder 然后把这三个文件复制到项目根目录下添加引用CKEditor.NET.dll CKFind ...
洛谷P1438 无聊的数列 [zkw线段树]
题目传送门无聊的数列题目背景无聊的YYB总喜欢搞出一些正常人无法搞出的东西.有一天,无聊的YYB想出了一道无聊的题:无聊的数列...(K峰:这题不是傻X题吗) 题目描述维护一个数列{a[i]} ...
mysql概念特性和优化
概念特性基础命令连接监控优化字段索引查询共享锁(shared lock)和排它锁(exclusive lock) 也叫读锁(red lock)和写锁(write lock) 多版本并发 ...
React Native踩坑之启动android模拟器失败
报错 Could not install the app on the device, read the error above for details.Make sure you have an A ...
Unity Shader基础
Unity Shader基础先上代码,代码一般是这样的. void Initialization(){ //先从硬盘加载代码再加载到GPU中 string vertexShaderCode = Lo ...
Lisp em SCU - 4490 (强大的map用法)
Time Limit: 1000 MS Memory Limit: 131072 K Description There are two lists and they may be intersect ...

flume学习（三）：flume将log4j日志数据写入到hdfs（转）

原文链接：flume学习（三）：flume将log4j日志数据写入到hdfs

flume学习（三）：flume将log4j日志数据写入到hdfs（转）的更多相关文章

随机推荐

热门专题