聚类对象的描述需要建立数据表示模型,聚类算法需要定义在包(bag)的概念之上,包允许相同的元素存在。
在统计自然语言处理中,聚类算法有两个重要的用途,第一个重要用途是用于试探性数据分析(exploratory data analysis ,EDA)。对于任何处理“量化”数据的应用来说,试探性数据分析是非常重要的方法。当我们面临一个新问题,并且希望建立一个概率模型或者仅仅是为了理解现象的基本特征时,这是一个首要步骤。如果我们盲目地开始操作数据,而不对数据对象做任何事先的理解分析,最终结果常常会不如人意。
--------------------------------------------------------------------------
第八章 [color=red]向量空间度量方法[/color]
主要使用词汇-文档矩阵
[table]
| 单词1 单词2 单词3|
|文档1 2 0 0 |
|文档2 1 1 0 |
|...|
[/table]
表中数据表示单词在相应文档中出现的次数
当把单词表示成二元向量的形式,就可以利用各种相似性测量来计算单词之间的相似度
例如单词的向量的表示:
单词1={1,1,...} 单词2={0,1,...} 单词3={0,0,...}
利用余弦度量来计算相似度.cosine = |X∩Y|/√(|X|*|Y|) 分子为两个单词的交集个数,分母为两个单词向量长度的乘积取根号
-------------------------------------------------------------------------
聚类这章讲了
层次聚类中的:单连通,全连通,平均连通聚类
非层次聚类:k平均算法和EM算法。。(EM算法没懂。数学都忘了)
在统计自然语言处理中,聚类算法有两个重要的用途,第一个重要用途是用于试探性数据分析(exploratory data analysis ,EDA)。对于任何处理“量化”数据的应用来说,试探性数据分析是非常重要的方法。当我们面临一个新问题,并且希望建立一个概率模型或者仅仅是为了理解现象的基本特征时,这是一个首要步骤。如果我们盲目地开始操作数据,而不对数据对象做任何事先的理解分析,最终结果常常会不如人意。
--------------------------------------------------------------------------
第八章 [color=red]向量空间度量方法[/color]
主要使用词汇-文档矩阵
[table]
| 单词1 单词2 单词3|
|文档1 2 0 0 |
|文档2 1 1 0 |
|...|
[/table]
表中数据表示单词在相应文档中出现的次数
当把单词表示成二元向量的形式,就可以利用各种相似性测量来计算单词之间的相似度
例如单词的向量的表示:
单词1={1,1,...} 单词2={0,1,...} 单词3={0,0,...}
利用余弦度量来计算相似度.cosine = |X∩Y|/√(|X|*|Y|) 分子为两个单词的交集个数,分母为两个单词向量长度的乘积取根号
-------------------------------------------------------------------------
聚类这章讲了
层次聚类中的:单连通,全连通,平均连通聚类
非层次聚类:k平均算法和EM算法。。(EM算法没懂。数学都忘了)