数据集由数据对象组成
一个数据对象代表一个实体(entity)
数据对象又称为样本、实例、数据点、或对象
数据行对应数据对象; 列对应属性
数据对象用属性(attribute)描述
属性(attribute)是一个数据字段,表示数据对象的一个特征
类型
标称属性(nominal)
标称属性(nominal attribute) 其值是一些符号或者事物的名称。
二元属性(binary)
是一种标称属性,只有两个状态:0或1。
对称的(symmetric): 两种状态具有同等价值,携带相同权重。
非对称的(asymmetric): 其状态的结果不是同样重要
序数属性(ordinal)
其可能的值之间具有有意义的序或者秩评定(ranking),但是相继值之间的 差是未知的。
数值属性(numeric)
区间标度(interval-scaled)属性
比率标度(ratio-scaled)属性
离散属性(discrete Attribute)
具有有限或者无限可数个值。
如: 邮编、省份数目具有有限个值,customer_Id是无 限可数的。
可以用或者不用整数表示。
连续属性(Continuous Attribute)
属性值为实数。
一般用浮点变量表示。