<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[海鸥~]]></title><description><![CDATA[“海鸥”   不屈不挠，搏击风浪的精神。]]></description><link>https://blog.csdn.net/Charlie_jun</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; Charlie_jun]]></copyright><item><title><![CDATA[Datax系列(一)  MysqlReader → 控制台]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/109260477</link><guid>https://blog.csdn.net/Charlie_jun/article/details/109260477</guid><author>Charlie_jun</author><pubDate>Sat, 24 Oct 2020 15:37:53 +0800</pubDate><description><![CDATA[从mysql读取数据  打印控制台
DataX 是阿里巴巴集团内被广泛使用的异构数据源离线同步工具，致力于实现包括关系型数据库(MySQL、Oracle等)、HDFS、Hive、MaxCompute(原ODPS)、HBase、FTP等各种异构数据源之间稳定高效的数据同步功能。
DataX本身作为离线数据同步框架，采用Framework + plugin架构构建。将数据源读取和写入抽象成为Reader/Writer插件，纳入到整个同步框架中。目前已经有了比较全面的插件体系，主流的RDBMS数据库、NOSQL、]]></description><category></category></item><item><title><![CDATA[Datax系列(二)  MysqlReader → MysqlWriter]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/109260389</link><guid>https://blog.csdn.net/Charlie_jun/article/details/109260389</guid><author>Charlie_jun</author><pubDate>Sat, 24 Oct 2020 15:35:42 +0800</pubDate><description><![CDATA[从mysql数据库读取数据  同步到另一个数据库
DataX 是阿里巴巴集团内被广泛使用的异构数据源离线同步工具，致力于实现包括关系型数据库(MySQL、Oracle等)、HDFS、Hive、MaxCompute(原ODPS)、HBase、FTP等各种异构数据源之间稳定高效的数据同步功能。
DataX本身作为离线数据同步框架，采用Framework + plugin架构构建。将数据源读取和写入抽象成为Reader/Writer插件，纳入到整个同步框架中。目前已经有了比较全面的插件体系，主流的RDBMS数据库]]></description><category></category></item><item><title><![CDATA[大数据面试题之葵花宝典------Flink高级]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/108483233</link><guid>https://blog.csdn.net/Charlie_jun/article/details/108483233</guid><author>Charlie_jun</author><pubDate>Wed, 09 Sep 2020 10:23:34 +0800</pubDate><description><![CDATA[葵花宝典------Flink中级1、Flink是如何支持批流一体的？2、Flink是如何做到高效的数据交换的？3、Flink是如何做容错的？4、Flink 分布式快照的原理是什么？5、Flink是如何保证Exactly-once语义的？6、Flink 的 kafka 连接器有什么特别的地方？7、说说 Flink的内存管理是如何做的?8、说说 Flink的序列化如何做的?9、Flink中的Window出现了数据倾斜，你有什么解决办法？10、Flink中在使用聚合函数 GroupBy、Distinct、Key]]></description><category></category></item><item><title><![CDATA[大数据面试题之葵花宝典------Flink中级]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/108473009</link><guid>https://blog.csdn.net/Charlie_jun/article/details/108473009</guid><author>Charlie_jun</author><pubDate>Tue, 08 Sep 2020 17:30:45 +0800</pubDate><description><![CDATA[葵花宝典------Flink中级1、Flink是如何支持批流一体的？2、Flink是如何做到高效的数据交换的？3、Flink是如何做容错的？4、Flink 分布式快照的原理是什么？5、Flink是如何保证Exactly-once语义的？6、Flink 的 kafka 连接器有什么特别的地方？7、说说 Flink的内存管理是如何做的?8、说说 Flink的序列化如何做的?9、Flink中的Window出现了数据倾斜，你有什么解决办法？10、Flink中在使用聚合函数 GroupBy、Distinct、Key]]></description><category></category></item><item><title><![CDATA[大数据面试题之葵花宝典------Flink初级]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/108455534</link><guid>https://blog.csdn.net/Charlie_jun/article/details/108455534</guid><author>Charlie_jun</author><pubDate>Mon, 07 Sep 2020 21:36:32 +0800</pubDate><description><![CDATA[这里写目录标题1、简单介绍一下 Flink2、Flink相比传统的Spark Streaming区别?3、Flink的组件栈有哪些？4、Flink 的运行必须依赖 Hadoop组件吗？5、你们的Flink集群规模多大？6、Flink的基础编程模型了解吗？7、Flink集群有哪些角色？各自有什么作用？8、说说 Flink 资源管理中 Task Slot 的概念9、说说 Flink 的常用算子？10、说说你知道的Flink分区策略？11、Flink的并行度了解吗？Flink的并行度设置是怎样的？12、Flink]]></description><category></category></item><item><title><![CDATA[大数据面试题之葵花宝典------flume]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/108436880</link><guid>https://blog.csdn.net/Charlie_jun/article/details/108436880</guid><author>Charlie_jun</author><pubDate>Sun, 06 Sep 2020 21:25:39 +0800</pubDate><description><![CDATA[葵花宝典------flume1. Flume组成，Put事务，Take事务2. Flume拦截器3. Flume Channel选择器4. Flume监控器5. Flume采集数据会丢失吗?（防止数据丢失的机制）6. Flume内存7. FileChannel优化
1. Flume组成，Put事务，Take事务
1、Taildir Source：断点续传、多目录。Flume1.6以前需要自己自定义Source记录每次读取文件位置，实现
断点续传。
2、File Channel：数据存储在磁盘，宕机数据可以]]></description><category></category></item><item><title><![CDATA[大数据面试题之葵花宝典------Hadoop]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/108425106</link><guid>https://blog.csdn.net/Charlie_jun/article/details/108425106</guid><author>Charlie_jun</author><pubDate>Sun, 06 Sep 2020 01:09:32 +0800</pubDate><description><![CDATA[葵花宝典------Hadoop1. hdfs读写流程2. hdfs的体系结构3. 一个datanode 宕机,怎么一个流程恢复4. hadoop 的 namenode 宕机,怎么解决5. namenode对元数据的管理6. 元数据的checkpoint7. yarn资源调度流程8. hadoop中combiner和partition的作用9. 用mapreduce怎么处理数据倾斜问题？10. shuffle 阶段,你怎么理解的11. Mapreduce 的 map 数量 和 reduce 数量是由什么决定]]></description><category></category></item><item><title><![CDATA[【Regal大数据】Flink1.11编译Hadoop2.7.2      编译flink-shaded-hadoop-2-uber  jar包依赖]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/108362658</link><guid>https://blog.csdn.net/Charlie_jun/article/details/108362658</guid><author>Charlie_jun</author><pubDate>Thu, 03 Sep 2020 09:38:45 +0800</pubDate><description><![CDATA[从Flink 1.11开始，flink-shaded-hadoop-2-uberFlink项目不再正式支持使用发行版。
如果想建立flink-shaded对供应商特定的Hadoop版本，您必须首先描述配置特定供应商的Maven仓库在本地Maven安装在这里。
运行以下命令以flink-shaded针对所需的Hadoop版本（例如对于version 2.6.5-custom）进行构建和安装：

mvn clean install -Dhadoop.version=2.6.5-custom

完成此步骤后，将f]]></description><category></category></item><item><title><![CDATA[Linux下安装maven环境，并测试使用]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/108374857</link><guid>https://blog.csdn.net/Charlie_jun/article/details/108374857</guid><author>Charlie_jun</author><pubDate>Thu, 03 Sep 2020 09:24:04 +0800</pubDate><description><![CDATA[使用Linux的root用户安装Maven
1. 下载安装包 tar.gz
官网：http://maven.apache.org/download.cgi

2. 修改settings.xml

vi settings.xml

修改自己的仓库地址

修改自己想用的镜像，我这是阿里云

&lt;mirrors&gt;
&lt;mirror&gt;
       &lt;id&gt;alimaven&lt;/id&gt;
      &lt;mirrorOf&gt;central&lt;/mirrorOf&g]]></description><category></category></item><item><title><![CDATA[Call From xx/x.x.x.x .hdp1:9000:java.net.ConnectException:拒绝连接For m...see:http://wiki.apac..Refused]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/108363840</link><guid>https://blog.csdn.net/Charlie_jun/article/details/108363840</guid><author>Charlie_jun</author><pubDate>Wed, 02 Sep 2020 17:28:23 +0800</pubDate><description><![CDATA[问题：

mkdir: Call From hdp1/192.x.x.143 to hdp1:9000 fail...tion exception: java.net.ConnectException: 拒绝连接; For m...see: http://wiki.apac....ConnectionRefused

原因：

在hadoop的配置文件core-site.xml时候必须写自己的ip地址







解决：




...]]></description><category></category></item><item><title><![CDATA[idea快捷键大全(常用的都有)]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/108283407</link><guid>https://blog.csdn.net/Charlie_jun/article/details/108283407</guid><author>Charlie_jun</author><pubDate>Sun, 30 Aug 2020 23:50:10 +0800</pubDate><description><![CDATA[全部快捷键大全链接
idea快捷键一（Ctrl+）
idea快捷键二（Alt+）
idea快捷键三（Shift+）
idea快捷键四（Ctrl + Alt+Shift）
以下的是个别快捷键，详细的点击上方链接查找。




快捷键
详情说明




Alt + Insert
代码自动生成，如生成对象的 set / get 方法，构造函数，toString() 等


Ctrl + +
展开代码


Ctrl + -
折叠代码


Ctrl + J
插入自定义动态代码模板


Ctrl + P
方法参数提示显]]></description><category></category></item><item><title><![CDATA[Docker系列(六)   docker环境下安装flume  实现logs+flume+kafka日志采集    镜像安装]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/107745584</link><guid>https://blog.csdn.net/Charlie_jun/article/details/107745584</guid><author>Charlie_jun</author><pubDate>Sun, 02 Aug 2020 16:20:08 +0800</pubDate><description><![CDATA[以下均为生产环境下亲测使用        如有出入 请私信梁工

一、安装flume
1、docker中查看镜像
docker search flume

2、pull 新版稳定 flume2.0.0
docker pull probablyfine/flume:2.0.0
3、      	创建一个flume文件夹  里面包含 conf  logs

conf  : 文件夹下放我们写的配置文件  sources channel  sink
logs  : 对容器内的logs在本地做映射
以下为 从log.]]></description><category></category></item><item><title><![CDATA[Docker系列(五)   docker 常用操作命令]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/107253640</link><guid>https://blog.csdn.net/Charlie_jun/article/details/107253640</guid><author>Charlie_jun</author><pubDate>Thu, 30 Jul 2020 15:25:20 +0800</pubDate><description><![CDATA[通过docker save命令将镜像保存为文件
docker save -o nacos.tar docker.io/nacos:1.0.0
导入镜像
docker load --input es.tar

]]></description><category></category></item><item><title><![CDATA[LDAP是什么  ?  看看他的原理介绍吧]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/107618920</link><guid>https://blog.csdn.net/Charlie_jun/article/details/107618920</guid><author>Charlie_jun</author><pubDate>Mon, 27 Jul 2020 19:14:11 +0800</pubDate><description><![CDATA[一、什么是LDAP？
（一）在介绍什么是LDAP之前，我们先来复习一个东西：“什么是目录服务？”
1. 目录服务是一个特殊的数据库，用来保存描述性的、基于属性的详细信息，支持过滤功能。
2. 是动态的，灵活的，易扩展的。
如：人员组织管理，电话簿，地址簿。
（二）了解完目录服务后，我们再来看看LDAP的介绍：
LDAP（Light Directory Access Portocol），它是基于X.500标准的轻量级目录访问协议。
目录是一个为查询、浏览和搜索而优化的数据库，它成树状结构组织数据，类似文件目录]]></description><category></category></item><item><title><![CDATA[SQL表达式]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/107533077</link><guid>https://blog.csdn.net/Charlie_jun/article/details/107533077</guid><author>Charlie_jun</author><pubDate>Thu, 23 Jul 2020 12:11:52 +0800</pubDate><description><![CDATA[一、字符串函数
1.  从左开始截取字符串 ：
left(str,n)
例：select left(‘开发技能’,2)
结果为：‘开发’
2.  从右开始截取字符串 ：
right(str,n)
例：select right(‘开发技能’,2)
结果为：‘技能’
3.  substring按指定位置截取字符串 ：
substring(str,pos)——substring(被截取字段，从第几位开始截取）
substring(str,pos,length)——substring(被截取字段，从第几位开始截取，]]></description><category></category></item><item><title><![CDATA[未来大数据发展趋势]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/107496052</link><guid>https://blog.csdn.net/Charlie_jun/article/details/107496052</guid><author>Charlie_jun</author><pubDate>Tue, 21 Jul 2020 18:59:31 +0800</pubDate><description><![CDATA[专家对大数据发展趋势的一些预测是值得企业关注的。
很多人都认为大数据是一种流行技术，并将会继续存在。对于一些人来说，有些事情并不那么明确，这关系到大数据分析的未来发展趋势。很多新兴技术正在迅速发展。对于现在或即将使用它们的企业意味着什么?
那么什么是大数据?它包含了由一个实体保存的结构化和非结构化信息，这些信息对于传统的系统和技术而言规模太大了，它还与处理能力的速度有关。一些企业需要几乎实时的洞察力，大数据软件可以提供这些洞察力，而传统方法则不能。
如果人们听取专家的建议，那么了解大数据技术和用例的未来将变]]></description><category></category></item><item><title><![CDATA[ODM   OEM   OBM 指的是什么   他的理解]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/107485979</link><guid>https://blog.csdn.net/Charlie_jun/article/details/107485979</guid><author>Charlie_jun</author><pubDate>Tue, 21 Jul 2020 12:08:39 +0800</pubDate><description><![CDATA[OBM：A设计，A生产，A品牌，A销售==工厂自己设计自产自销
ODM：B设计，B生产，A品牌，A销售==俗称“贴牌”，就是工厂的产品，别人的品牌
OEM：A设计，B生产，A品牌，A销售==代工，代生产，别人的技术和品牌，工厂只生产

...]]></description><category></category></item><item><title><![CDATA[Docker系列(四)   Docker中kafka各镜像的对比    ----zookeeper  kafka镜像    安装及容器启动]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/107448845</link><guid>https://blog.csdn.net/Charlie_jun/article/details/107448845</guid><author>Charlie_jun</author><pubDate>Sun, 19 Jul 2020 18:20:37 +0800</pubDate><description><![CDATA[zookeeper安装及启动

docker pull wurstmeister/zookeeper

version: '3'
services:
 zk:
  image: zookeeper# 镜像名称
  restart: always # 当发生错误时自动重启
  hostname: junwei
  container_name: zookeeper
  privileged: true
  ports: # 端口
   - 2181:2181
  volumes: # 挂载数据卷
   - .]]></description><category></category></item><item><title><![CDATA[一站式Kafka平台解决方案——KafkaCenter]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/107399714</link><guid>https://blog.csdn.net/Charlie_jun/article/details/107399714</guid><author>Charlie_jun</author><pubDate>Fri, 17 Jul 2020 09:04:49 +0800</pubDate><description><![CDATA[实时流式计算

KafkaCenter是什么
KafkaCenter是一个针对Kafka的一站式，解决方案。用于Kafka集群的维护与管理，生产者和消费者的监控，以及Kafka部分生态组件的使用。
对于Kafka的平台化，一直缺少一个成熟的解决方案，之前比较流行的kafka监控方案，如kafka-manager提供了集群管理与topic管理等等功能。但是对于生产者、消费者的监控，以及Kafka的新生态，如Connect，KSQL还缺少响应的支持。Confluent Control Center功能要完整一.]]></description><category></category></item><item><title><![CDATA[Docker系列(二) Docker容器（centos7）中rpm离线方式安装mysql镜像]]></title><link>https://blog.csdn.net/Charlie_jun/article/details/107197439</link><guid>https://blog.csdn.net/Charlie_jun/article/details/107197439</guid><author>Charlie_jun</author><pubDate>Wed, 08 Jul 2020 09:49:30 +0800</pubDate><description><![CDATA[以mysql 5.6为例进行操作


首先，下载mysql的rpm文件，主要包含3个rpm包：
MySQL-client-5.6.41-1.el7.x86_64.rpm
MySQL-devel-5.6.41-1.el7.x86_64.rpm
MySQL-server-5.6.41-1.el7.x86_64.rpm

3个rpm包的地址
https://download.csdn.net/download/Charlie_jun/12587145
https://download.csdn.net/down.]]></description><category></category></item></channel></rss>