批式CSV数据读取【Alink使用技巧】

基本操作

我们先下载个csv文件用作后面的测试数据。
将数据文件 http://archive.ics.uci.edu/ml/machine-learning-databases/iris/iris.data下载到本地,文件路径为 /Users/yangxu/flinkml/data/iris/iris.data,使用文本编辑器打开如下所示,每行为一条数据,每条数据包括4个数值字段和一个字符串字段,各字段间使用逗号分隔。

读取本地数据

使用CsvSourceBatchOp可以批式读CSV格式文件,其必填的两个参数为:filePath和schemaStr。filePath为CSV格式文件所在的路径;schemaStr为数据各字段的名称和类型。关于Schema String更多的介绍可以参见:

Alink品数:Alink Schema String简介【Alink使用技巧】​zhuanlan.zhihu.com图标

 

可以使用如下脚本,读取数据,并取前5条数据打印显示出来。

source_local = CsvSourceBatchOp()\
    .setFilePath("/Users/yangxu/flinkml/data/iris/iris.data")\
    .setSchemaStr("sepal_length double, sepal_width double, petal_length double, petal_width double, category string")
source_local.firstN(5).print()

数据打印显示如下:

注意:CsvSourceBatchOp必填的参数filePath和schema进行赋值,filePath为本地文件存储路径"/Users/yangxu/flinkml/data/iris/iris.data",schema为iris数据集的列名和类型信息,共有5个字段:sepal_length, sepal_width, petal_length, petal_width, category;其数据类型分别为double, double, double, double, string

读取网络数据

相对于前面介绍的读取本地CSV数据,我们只需将数据存储路径参数filePath,赋值为http路径地址即可。脚本如下:

source_url = CsvSourceBatchOp()\
    .setFilePath("http://archive.ics.uci.edu/ml/machine-learning-databases/iris/iris.data")\
    .setSchemaStr("sepal_length double, sepal_width double, petal_length double, petal_width double, category string")
source_url.firstN(5).print()

数据打印显示如下:

 

参数详细说明

Alink CsvSourceBatchOp提供了丰富的读取功能,具体内容可以参阅其参数说明文档:

https://github.com/alibaba/Alink/blob/master/docs/cn/csvsourcebatchop.md​github.com图标

 

更复杂的例子

对于葡萄酒品质数据集:http://archive.ics.uci.edu/ml/machine-learning-databases/wine-quality/winequality-white.csv,我们将其下载达到本地,可以看到其文件内容。

第一行为数据列名的说明,第二行开始是数据,可以看到都是数值类型,各个数之间用分号“;”进行分隔。

我们可以通过设置参数ignoreFirstLine为True,略过第一行;并且可以设置字段分隔符参数fieldDelimiter为分号“;”。另外,由于列名不能包含空格,所以由文件第一列转化来的列名需要进行相应处理,这里我们将其写为驼峰形式;并加上数据类型,这里都是double类型,构成了数据集的SchemaStr。具体的脚本如下:

wine_url = CsvSourceBatchOp()\
    .setFilePath("http://archive.ics.uci.edu/ml/machine-learning-databases/wine-quality/winequality-white.csv")\
    .setSchemaStr("fixedAcidity double,volatileAcidity double,citricAcid double,residualSugar double,"+\
                  "chlorides double,freeSulfurDioxide double,totalSulfurDioxide double,density double,"+\
                  "pH double,sulphates double,alcohol double,quality double")\
    .setFieldDelimiter(";")\
    .setIgnoreFirstLine(True);
wine_url.firstN(5).print()

数据打印显示如下:

可以看到由于每行的数据较多,在显示的时候进行了分段显示,每段数据可以由其最左方的行索引编号关联。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值