1. 概念区分
朴素贝叶斯与贝叶斯估计
朴素贝叶斯: 朴素贝叶斯法是基于贝叶斯定理与特征条件独立假设的分类方法。对于给定的训练数据集,首先基于特征条件独立假设学习输入/输出的联合概率分布;然后基于此模型,对给定的输入 x x ,利用贝叶斯定理求出后验概率最大的输出
.
贝叶斯估计:
先验概率与后验概率
先举个栗子:
假设停电主要有两个原因导致:电路损坏和忘充电卡。
停电的概率 P(停电) P ( 停 电 ) 为先验概率。
假如昨天夜里刮大风了可能导致电路损坏,则由电路损坏导致停电的概率 P(停电|电路损坏) P ( 停 电 | 电 路 损 坏 ) 称为条件概率。
假如已经停电了,则由电路损坏导致的停电的概率是 P(电路损坏|停电) P ( 电 路 损 坏 | 停 电 ) 称为后验概率
朴素贝叶斯理论
朴素贝叶斯法是基于贝叶斯定理与特征条件独立假设的分类方法。是典型的生成学习方法。对于给定的训练数据集,首先基于特征条件独立假设学习输入/输出的联合概率分布;然后基于此模型,对给定的输入 x x ,利用贝叶斯定理求出后验概率最大的输出
.
具体地:利用训练数据学习 P(X|Y) P ( X | Y ) 和 P(Y) P ( Y ) 的估计,得到联合概率分布:
朴素贝叶斯法的基本假设
朴素贝叶斯法的基本假设是条件独立性,
这是一个较强的假设。由于这一假设,模型包含的条件概率的数量大为减少,朴素贝叶斯法的学习与预测大为简化,因而朴素贝叶斯法高效,且易于实现。缺点是分类的性能不一定很高。
条件独立性假设等于是说用于分类的特征在类确定的条件下都是条件独立的,这一假设使朴素贝叶斯法变得简单,但有时会牺牲一定的分类准确率。
朴素贝叶斯模型
设输入空间 X⊆Rn X ⊆ R n 为 n n 维向量的集合,输入空间为类标记集合 .输入为特征向量 x∈X x ∈ X ,输出为类标记 y∈Y y ∈ Y 。 X X 是定义在输入空间 上的随机向量, Y Y 是定义在输出空间 上的随机变量。 P(X,Y) P ( X , Y ) 是 X X 和 的联合概率分布。训练数据集
具体地,先验概率分布
条件概率分布