flume采集目录到hdfs

1. 上期补充

[xiaokang@hadoop ~]$ flume-ng agent -n a1 -c /opt/software/flume-1.9.0/conf/ -f flume/telnet-logger.properties -Dflume.root.logger=INFO,console
# 此处很重要,但在上一期教程中我没有解释
# -n a1  指定我们这个 agent 的名字
# -c /opt/software/flume-1.9.0/conf/   指定 flume-1.9.0 自身的配置文件所在目录 
# -f flume/telnet-logger.properties  指定我们所描述的采集方案 
# -Dflume.root.logger=INFO,console  输出打印到控制台

2. 前期准备

hadoop单机伪分布式
flume-1.9.0

3. 命令操作

[xiaokang@hadoop ~]$ vim flume/spooldir-hdfs.properties
#命名组件
a1.sources = r1
a1.sinks = k1
a1.channels = c1

#source:
##注意:不能往监控目录中丢重复同名文件
a1.sources.r1.type = spooldir
a1.sources.r1.spoolDir = /home/xiaokang/logs
a1.sources.r1.fileHeader = true

# sink:
a1.sinks.k1.type = hdfs
a1.sinks.k1.channel = c1
a1.sinks.k1.hdfs.path = /flume/events/%y-%m-%d/%H%M/
a1.sinks.k1.hdfs.filePrefix = events-
a1.sinks.k1.hdfs.round = true
a1.sinks.k1.hdfs.roundValue = 10
a1.sinks.k1.hdfs.roundUnit = minute

#文件的滚动:
#roll控制写入hdfs文件,以何种方式进行滚动
a1.sinks.k1.hdfs.rollInterval = 3#以时间间隔
a1.sinks.k1.hdfs.rollSize = 20#以文件大小
a1.sinks.k1.hdfs.rollCount = 5#以event个数
#如果三个都配置,谁先满足谁触发滚动
#如果不想以某种属性滚动,设置为0即可
#默认值 rollInterval:30s rollSize:1024bytes rollCount:10

a1.sinks.k1.hdfs.batchSize = 1
a1.sinks.k1.hdfs.useLocalTimeStamp = true
a1.sinks.k1.hdfs.fileType = DataStream#生成的文件类型,默认是Sequencefile,可用DataStream,则为普通文本

#channels
a1.channels.c1.type = memory
a1.channels.c1.capacity = 1000#默认该通道中最大的可以存储的event数量
a1.channels.c1.transactionCapacity = 100#每次最大可以从source中拿到或者送到sink中的event数量

a1.sources.r1.channels = c1
a1.sinks.k1.channel = c1
[xiaokang@hadoop ~]$ start-yarn.sh
[xiaokang@hadoop ~]$ start-dfs.sh
[xiaokang@hadoop ~]$ flume-ng agent -n a1 -c /opt/software/flume-1.9.0/conf/ -f flume/spooldir-hdfs.properties -Dflume.root.logger=INFO,console

在另一个会话框内输入以下命令:

# 这里我预先准备了一个log.txt
[xiaokang@hadoop ~]$ cp log.txt logs

打开namenode的web端,如图所示,说明已采集到hdfs

在这里插入图片描述

  • 0
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论
Flume 是一种用于数据采集、聚合和移动的工具,它可以将多种来源的数据收集到 HDFS(Hadoop分布式文件系统)中。通过 Flume,用户可以轻松地配置和管理数据流,确保数据的可靠性和一致性。 首先,用户需要在 Flume 的配置文件中定义数据源,例如日志文件、网络源或其他存储位置。接着,用户需要定义数据的处理流程,包括数据的过滤、转换和路由策略。然后,用户需要指定目的地为 HDFS,并设置 HDFS 的相关参数,包括数据的写入路径、文件格式和压缩方式等。 当 Flume 启动后,它会按照用户定义的规则和流程,从数据源收集数据,并将其经过处理后写入到 HDFS 中。Flume 可以确保数据的高效传输和存储,同时具有容错和重试机制,以保证数据的可靠性和完整性。 在数据采集HDFS 后,用户可以通过 Hadoop 生态系统中的其他工具和框架,如 MapReduce、Spark 等进行数据处理和分析。同时,用户也可以通过 HDFS 提供的 API 和命令行工具,对数据进行管理和检索,以满足各种业务需求和分析任务。 总之,通过 Flume 将数据采集HDFS 中,用户可以实现大规模数据的收集、存储和分析,为企业决策和业务运营提供基础支持。同时,Flume 也为数据工程师和分析师提供了一个灵活、高效的数据采集和处理工具,助力他们更好地利用数据来推动业务发展。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

小刘新鲜事儿

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值