Flume自定义Sink详细操作

自定义Sink介绍

Sink不断地轮询Channel中的事件且批量地移除它们,并将这些事件批量写入到存储或索引系统、或者被发送到另一个Flume Agent。
Sink是完全事务性的。在从Channel批量删除数据之前,每个Sink用Channel启动一个事务。批量事件一旦成功写出到存储系统或下一个Flume Agent,Sink就利用Channel提交事务。事务一旦被提交,该Channel从自己的内部缓冲区删除事件。
Sink组件目的地包括hdfs、logger、avro、thrift、ipc、file、null、HBase、solr、自定义。官方提供的Sink类型已经很多,但是有时候并不能满足实际开发当中的需求,此时我们就需要根据实际需求自定义某些Sink。
官方也提供了自定义source的接口:
https://flume.apache.org/FlumeDeveloperGuide.html#sink根据官方说明自定义MySink需要继承AbstractSink类并实现Configurable接口。
实现相应方法:
configure(Context context)//初始化context(读取配置文件内容)
process()//从Channel读取获取数据(event),这个方法将被循环调用。
使用场景:读取Channel数据写入MySQL或者其他文件系统。

需求

使用flume接收数据,并在Sink端给每条数据添加前缀和后缀,输出到控制台。前后缀可在flume任务配置文件中配置。
流程分析:
image.png

编码

import org.apache.flume.*;
import org.apache.flume.conf.Configurable;
import org.apache.flume.sink.AbstractSink;
import org.slf4j.Logger;
import org.slf4j.LoggerFactory;
public class MySink extends AbstractSink implements Configurable {
 //创建Logger对象
 private static final Logger LOG = LoggerFactory.getLogger(AbstractSink.class);
 private String prefix;
 private String suffix;
 @Override
 public Status process() throws EventDeliveryException {
 //声明返回值状态信息
 Status status;
 //获取当前Sink绑定的Channel
 Channel ch = getChannel();
 //获取事务
 Transaction txn = ch.getTransaction();
 //声明事件
 Event event;
 //开启事务
 txn.begin();
 //读取Channel中的事件,直到读取到事件结束循环
 while (true) {
 event = ch.take();
 if (event != null) {
 break;
 }
 }
 try {
 //处理事件(打印)
 LOG.info(prefix + new String(event.getBody()) + suffix);
 //事务提交
 txn.commit();
 status = Status.READY;
 } catch (Exception e) {
 //遇到异常,事务回滚
 txn.rollback();
 status = Status.BACKOFF;
 } finally {
 //关闭事务
 txn.close();
 }
 return status;
 }
 @Override
 public void configure(Context context) {
 //读取配置文件内容,有默认值
 prefix = context.getString("prefix", "hello:");
 //读取配置文件内容,无默认值
 suffix = context.getString("suffix");
 }
}

测试

  1. 打包
    将写好的代码打包,并放到flume的lib目录(/opt/module/flume)下。
  2. 配置文件
# Name the components on this agent
a1.sources = r1
a1.sinks = k1
a1.channels = c1
# Describe/configure the source
a1.sources.r1.type = netcat
a1.sources.r1.bind = localhost
a1.sources.r1.port = 44444
# Describe the sink
a1.sinks.k1.type = com.liujh.MySink
#a1.sinks.k1.prefix = liujh:
a1.sinks.k1.suffix = :liujh
# Use a channel which buffers events in memory
a1.channels.c1.type = memory
a1.channels.c1.capacity = 1000
a1.channels.c1.transactionCapacity = 100
# Bind the source and sink to the channel
a1.sources.r1.channels = c1
a1.sinks.k1.channel = c1
  1. 开启任务
[liujh@hadoop102 flume]$ pwd
/opt/module/flume
[liujh@hadoop102 flume]$ bin/flume-ng agent -c conf/ -f job/mysink.conf -n a1 -Dflume.root.logger=INFO,console
[liujh@hadoop102 ~]$ nc localhost 44444
hello
OK
liujh
OK
  1. 结果展示
    image.png

关注微信公众号
简书:https://www.jianshu.com/u/0278602aea1d
CSDN:https://blog.csdn.net/u012387141

  • 3
    点赞
  • 7
    收藏
    觉得还不错? 一键收藏
  • 1
    评论
要将CSV文件写入MySQL,可以使用Flume自定义Sink。以下是一些基本步骤: 1. 创建一个自定义Sink类,继承AbstractSink类。 2. 在该类中实现process方法,在该方法中编写将CSV文件数据写入MySQL的逻辑。 3. 在Flume配置文件中指定自定义Sink类,并设置相关参数,例如CSV文件路径、MySQL连接信息等。 下面是一个简单的示例: ```java public class CsvToMysqlSink extends AbstractSink { private String csvPath; private String mysqlUrl; private String mysqlUsername; private String mysqlPassword; private String mysqlTable; private Connection connection; private PreparedStatement statement; @Override public void configure(Context context) { csvPath = context.getString("csvPath"); mysqlUrl = context.getString("mysqlUrl"); mysqlUsername = context.getString("mysqlUsername"); mysqlPassword = context.getString("mysqlPassword"); mysqlTable = context.getString("mysqlTable"); } @Override public void start() { try { Class.forName("com.mysql.jdbc.Driver"); connection = DriverManager.getConnection(mysqlUrl, mysqlUsername, mysqlPassword); statement = connection.prepareStatement("INSERT INTO " + mysqlTable + " VALUES (?, ?, ?)"); } catch (Exception e) { e.printStackTrace(); } } @Override public void stop() { try { statement.close(); connection.close(); } catch (Exception e) { e.printStackTrace(); } } @Override public Status process() throws EventDeliveryException { Status status = null; try { File csvFile = new File(csvPath); BufferedReader br = new BufferedReader(new FileReader(csvFile)); String line; while ((line = br.readLine()) != null) { String[] values = line.split(","); statement.setString(1, values[0]); statement.setString(2, values[1]); statement.setString(3, values[2]); statement.executeUpdate(); } br.close(); status = Status.READY; } catch (Exception e) { e.printStackTrace(); status = Status.BACKOFF; } return status; } } ``` 在Flume配置文件中,可以这样指定自定义Sink类: ```properties agent.sinks.mysqlSink.type = com.example.CsvToMysqlSink agent.sinks.mysqlSink.csvPath = /path/to/csv/file.csv agent.sinks.mysqlSink.mysqlUrl = jdbc:mysql://localhost:3306/mydatabase agent.sinks.mysqlSink.mysqlUsername = myusername agent.sinks.mysqlSink.mysqlPassword = mypassword agent.sinks.mysqlSink.mysqlTable = mytable ``` 这个示例假设CSV文件每行有三个值,分别对应MySQL表中的三个字段。在process方法中,将读取CSV文件中的每一行,并将其分割为三个值,然后使用PreparedStatement将这些值插入到MySQL表中。 注意,这个示例没有包含一些必要的异常处理和错误处理逻辑,需要根据实际情况进行完善。
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值