1.基本术语
- 数据集 (data set):记录的合集即为数据集,每条记录是关于一个事件或对象的描述,称为一个示例instance或样本sample。
- 属性 (attribute):事件或对象的某个特征。eg:色泽
- 样本空间 (sample space):由属性张成的空间。eg:{色泽,根蒂,敲声}为一个三维样本空间
- 特征向量 (feature vector):样本空间中的一个点对应的坐标向量,即一个样本or记录就是一个特征向量,eg:(色泽=青绿;根蒂=蜷缩;敲声=浊响)为一个特征向量
- 学习or训练:从数据集中学得模型的过程。
Coming Soon:
监督学习Supervised:训练前已知正确答案
分类 (classify) :
决策树(decision-making tree),支持向量机(SVM)…
回归 (regression) :
最小二乘法(Ordinary Least Square),逻辑回归(Logistic Regression)…
无监督学习Unsupervised:训练前不知道正确答案
聚类 (clustering):
K-means…
- 泛化能力 (generalization):算法or模型对新样本的识别能力,从英文generalization来看,就是指模型的普适性。
2.假设空间
除了归纳and演绎,有点没看懂,日后补坑…
3.归纳偏好
Promble:
同一个数据集训练出不同模型,选哪个?哪个模型更好?
Principle:
奥卡姆剃须刀原则 (选其中最简单的模型)
…