ETL详解

最新推荐文章于 2023-04-30 23:12:13 发布

置顶

特约码农

最新推荐文章于 2023-04-30 23:12:13 发布

阅读量905

点赞数 1

分类专栏： BI 文章标签： ETL BI分析业务智能分析

本文链接：https://blog.csdn.net/zengsir2008/article/details/102932842

版权

ETL是BI项目的关键步骤，涉及数据从源系统到数据仓库的抽取、清洗和加载。文章详细阐述了数据抽取的不同方法，如直接链接、ODBC、文件导入等，并讨论了数据清洗和转换的重要性，包括不完整、错误和重复数据的处理。此外，还介绍了ETL日志和警告发送机制。最后，推荐了几款优秀的ETL工具，如Apache Camel、Kafka和Talend。

摘要由CSDN通过智能技术生成

ETL，是英文Extract-Transform-Load的缩写，用来描述将数据从来源端经过抽取（extract）、转换（transform）、加载（load）至目的端的过程，ETL是BI项目重要的一个环节，目的是将企业中的分散、零乱、标准不统一的数据整合到一起，为企业的决策提供分析依据。

　　ETL的设计分三部分：数据抽取、数据的清洗转换、数据的加载。在设计ETL的时候我们也是从这三部分出发。数据的抽取是从各个不同的数据源抽取到ODS(Operational Data Store，操作型数据存储)中——这个过程也可以做一些数据的清洗和转换)，在抽取的过程中需要挑选不同的抽取方法，尽可能的提高ETL的运行效率。ETL三个部分中，花费时间最长的是“T”(Transform，清洗、转换)的部分，一般情况下这部分工作量是整个ETL的2/3。数据的加载一般在数据清洗完了之后直接写入DW(Data Warehousing，数据仓库)中去。

　　ETL的实现有多种方法，常用的有三种。一种是借助ETL工具(如Oracle的OWB、SQL Server 2000的DTS、SQL Server2005的SSIS服务、Informatic等)实现，一种是SQL方式实现，另外一种是ETL工具和SQL相结合。前两种方法各有各的优缺点，借助工具可以快速的建立起ETL工程，屏蔽了复杂的编码任务，提高了速度，降低了难度，但是缺少灵活性。SQL的方法优点是灵活，提高ETL运行效率，但是编码复杂，对技术要求比较高。第三种是综合了前面二种的优点，会极大地提高ETL的开发速度和效率。

　　一、数据的抽取（Extract）

　　这一部分需要在调研阶段做大量的工作，首先要搞清楚数据是从几个业务系统中来,各个业务系统的数据库服务器运行什么DBMS,是否存在手工数据，手工数据量有多大，是否存在非结构化的数据等等，当收集完这些信息之后才可以进行数据抽取的设计。

　　1、对于与存放DW的数据库系统相同的数据源处理方法

　　这一类数据源在设计上比较容易。一般情况下，DBMS(SQLServer、Oracle)都会提供数据库链接功能，在DW数据库服务器和原业务系统之间建立直接的链接关系就可以写Select 语句直接访问。

　　2、对于与DW数据库系统不同的数据源的处理方法

　　对于这一类数据源，一般情况下也可以通过ODBC的方式建立数据库链接——如SQL Server和Oracle之间。如果不能建