大数据开发-FLUME安装部署与实战案例

本文介绍了Flume在大数据开发中的作用,详细讲解了Flume的安装部署过程,并通过案例展示了如何采集文件内容和网站日志上传至HDFS,强调了其高可用性和高可靠性。
摘要由CSDN通过智能技术生成

前言

Flume是Cloudera提供的一个高可用的,高可靠的,分布式的海量日志采集、聚合和传输的系统,Flume支持在日志系统中定制各类数据发送方,用于收集数据;同时,Flume提供对数据进行简单处理,并写到各种数据接受方(可定制)的能力。

Flume-ng最明显的改动就是取消了集中管理配置的 Master 和 Zookeeper,变为一个纯粹的传输工具。Flume-ng另一个主要的不同点是读入数据和写出数据由不同的工作线程处理(称为 Runner)。 在 Flume-og 中,读入线程同样做写出工作(除了故障重试)。如果写出慢的话(不是完全失败),它将阻塞 Flume 接收数据的能力。这种异步的设计使读入线程可以顺畅的工作而无需关注下游的任何问题。

在这里插入图片描述

安装部署

官网:http://flume.apache.org/download.html,下载完成后上传服务器并解压。

[root@hadoop02 soft]# tar -zxvf apache-flume-1.11.0-bin

配置修改

#修改文件名
[root@VM-4-17-centos conf]# mv flume-env.sh.template flume-env.sh
# 修改配置
[root@VM-4-17-centos conf]# vim flume-env.sh
export JAVA_HOME=/usr/local/jdk/jdk1.8.0_201

# 准备conf文件,在官网上可以找到 https://flume.apache.org/releases/content/1.11.0/FlumeUserGuide.html

image-20240308100120676


[root@VM-4-17-centos conf]# vim example.conf

# Name the components on this agent
a1.sources = r1
a1.sinks = k1
a1.channels = c1

# Describe/configure the source
a1.sources.r1.type = netcat
a1.sources.r1.bind = localhost
a1.sources.r1.port = 44444

# Describe the sink
a1.sinks.k1.type = logger

# Use a channel which buffers events in memory
a1.channels.c1.type = memory
a1.channels.c1.capacity = 1000
a1.channels.c1.transactionCapacity 
  • 33
    点赞
  • 6
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

拉霍拉卡

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值