数据集介绍
用到的数据集叫作电离层(Ionosphere),这些数据是由高频天线收集的。这些天线的目 的是侦测在电离层和高层大气中存不存在由自由电子组成的特殊结构。如果一条数据能给出特殊 结构存在的证据,这条数据就属于好的那一类(在数据集中用“g”表示),否则就是坏的(用“b” 表示)。我们要做的就是建立分类器,自动判断这些数据的好坏。
这个数据可以从http://archive.ics.uci.edu/ml/datasets/Ionosphere中的Datafolder中下载,下载 ionosphere.data 和 ionosphere.names
该数据集每行有35个值,前34个为17座天线采集的数据(每座天线采集两个数据)。后一 个值不是“g”就是“b”,表示数据的好坏,即是否提供了有价值的信息。
数据预处理
import os
# #把path中包含的"~"和"~user"转换成用户目录
home_folder = os.path.expanduser("~")
print(home_folder)
通过这种方式就可以很快的定位到用户目录了。输出结果是:
C:\Users\mi
加载数据集前,用Data文件夹路径、数据集所在的文件夹名称和数据集名称组合成数据集文件的完整路径。
# Change this to the location of your dataset
# os.path.join(path1[, path2[, ...]])把目录和文件名合成一个路径
data_folder = os.path.join(home_folder, "Data", "Ionosphere")
data_filename = os.path.join(data_folder, "ionosphere.data")
print(data_folder)
print(data_filename)
输出结果是:
C:\Users\mi\Data\Ionosphere
C