Flume

最新推荐文章于 2022-06-28 11:22:46 发布

mtchy

最新推荐文章于 2022-06-28 11:22:46 发布

阅读量526

点赞数

分类专栏：大数据研发

本文链接：https://blog.csdn.net/Mtchy/article/details/64906541

版权

大数据研发专栏收录该内容

7 篇文章 0 订阅

订阅专栏

Flume

flume是一个分布式日志收集系统。

flume的核心是把数据从数据源(source)收集过来，在将收集到的数据送到指定的目的地(sink)。为了保证输送的过程一定成功，在送到目的地(sink)之前，会先缓存数据(channel),待数据真正到达目的地(sink)后，flume再删除自己缓存的数据。
在整个数据的传输的过程中，流动的是event，即事务保证是在event级别进行的。那么什么是event呢？—–event将传输的数据进行封装，是flume传输数据的基本单位，如果是文本文件，通常是一行记录，event也是事务的基本单位。event从source，流向channel，再到sink，本身为一个字节数组，并可携带headers(头信息)信息。event代表着一个数据的最小完整单元，从外部数据源来，向外部的目的地去。

flume的本身设计就是agent。agent本身是一个java进程，运行在日志收集节点—所谓日志收集节点就是服务器节点。

flume的一些核心概念：
Agent 使用JVM 运行Flume。每台机器运行一个agent，但是可以在一个agent中包含多个sources和sinks。

Client 生产数据，运行在一个独立的线程。

Source 从Client收集数据，传递给Channel。

Sink 从Channel收集数据，运行在一个独立线程。

Channel 连接 sources 和 sinks ，这个有点像一个队列。

Events 可以是日志记录、 avro 对象等。

flume的核心就是一个agent，这个agent对外有两个进行交互的地方，一个是接受数据的输入——source，一个是数据的输出sink，sink负责将数据发送到外部指定的目的地。source接收到数据之后，将数据发送给channel，chanel作为一个数据缓冲区会临时存放这些数据，随后sink会将channel中的数据发送到指定的地方—-例如kafka、HDFS等，注意：只有在sink将channel中的数据成功发送出去之后，channel才会将临时数据进行删除，这种机制保证了数据传输的可靠性与安全性。

下面看一看简单的示例：

假设配置文件名为test.conf

a1.sources = r1
a1.channels = c1
a1.sinks=k1

a1.sources.r1.type = exec
a1.sources.r1.command = tail -F /var/log/secure
a1.sources.r1.channels = c1

a1.channels.c1.type = memory
a1.channels.c1.capacity = 10000
a1.channels.c1.transactionCapacity = 100

a1.sinks.k1.channel = c1
a1.sinks.k1.type = org.apache.flume.sink.kafka.KafkaSink
a1.sinks.k1.kafka.topic = mytopic
a1.sinks.k1.kafka.bootstrap.servers = kafkahost:9092
a1.sinks.k1.serializer.class=kafka.serializer.StringEncoder

运行flume

bin/flume-ng agent --conf conf --conf-file conf/test.conf --name a1 -Dflume.root.logger=INFO,console

具体详情请参考官网：

http://flume.apache.org/FlumeUserGuide.html#

mtchy

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录