Flume高频面试题

本文详细介绍了Flume的组件、事务机制、拦截器、Channel选择器、监控、优化以及常见问题。Flume由Source、Channel和Sink组成,其中File Channel提供高可靠性,Memory Channel提供高速度。Source如Taildir Source支持断点续传,拦截器可实现数据预处理,而Kafka Channel提高了传输效率。监控方面,使用Ganglia进行实时监控。Flume数据传输的可靠性可通过选用File Channel和正确配置参数来保障。在数据丢失和优化方面,Flume提供多种解决方案,如设置合适参数避免丢包,通过HDFS Sink处理小文件问题。
摘要由CSDN通过智能技术生成

1、Flume组成,Put事务,Take事务

Taildir Source:断点续传、多目录。Flume1.6以前需要自己自定义Source记录每次读取文件位置,实现断点续传。

File Channel:数据存储在磁盘,宕机数据可以保存。但是传输速率慢。适合对数据传输可靠性要求高的场景,比如,金融行业。

Memory Channel:数据存储在内存中,宕机数据丢失。传输速率快。适合对数据传输可靠性要求不高的场景,比如,普通的日志数据。

Kafka Channel:减少了Flume的Sink阶段,提高了传输效率。           

Source到Channel是Put事务。

Channel到Sink是Take事务。

1)taildir source

(1)断点续传、多目录

    (2)哪个Flume版本产生的?Apache1.7、CDH1.6

(3)没有断点续传功能时怎么做的? 自定义

(4)taildir挂了怎么办?

     不会丢数:断点续传

     重复数据:

ÿ

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

wespten

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值