统计自然语言处理基础_聚类

最新推荐文章于 2024-01-07 02:08:17 发布

iteye_15311

最新推荐文章于 2024-01-07 02:08:17 发布

阅读量176

点赞数

分类专栏： NLP 文章标签：算法

本文链接：https://blog.csdn.net/iteye_15311/article/details/82027797

版权

NLP 专栏收录该内容

8 篇文章 0 订阅

订阅专栏

聚类对象的描述需要建立数据表示模型，聚类算法需要定义在包（bag）的概念之上，包允许相同的元素存在。

在统计自然语言处理中，聚类算法有两个重要的用途，第一个重要用途是用于试探性数据分析（exploratory data analysis ,EDA）。对于任何处理“量化”数据的应用来说，试探性数据分析是非常重要的方法。当我们面临一个新问题，并且希望建立一个概率模型或者仅仅是为了理解现象的基本特征时，这是一个首要步骤。如果我们盲目地开始操作数据，而不对数据对象做任何事先的理解分析，最终结果常常会不如人意。
--------------------------------------------------------------------------
第八章 [color=red]向量空间度量方法[/color]
主要使用词汇-文档矩阵
[table]
| 单词1 单词2 单词3|
|文档1 2 0 0 |
|文档2 1 1 0 |
|...|
[/table]
表中数据表示单词在相应文档中出现的次数

当把单词表示成二元向量的形式，就可以利用各种相似性测量来计算单词之间的相似度
例如单词的向量的表示：
单词1={1,1,...} 单词2={0,1,...} 单词3={0,0,...}

利用余弦度量来计算相似度.cosine = |X∩Y|/√(|X|*|Y|) 分子为两个单词的交集个数，分母为两个单词向量长度的乘积取根号

-------------------------------------------------------------------------

聚类这章讲了
层次聚类中的：单连通，全连通，平均连通聚类
非层次聚类：k平均算法和EM算法。。（EM算法没懂。数学都忘了）

iteye_15311

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
统计自然语言处理基础_聚类

聚类对象的描述需要建立数据表示模型，聚类算法需要定义在包（bag）的概念之上，包允许相同的元素存在。在统计自然语言处理中，聚类算法有两个重要的用途，第一个重要用途是用于试探性数据分析（exploratory data analysis ,EDA）。对于任何处理“量化”数据的应用来说，试探性数据分析是非常重要的方法。当我们面临一个新问题，并且希望建立一个概率模型或者仅仅是为了理解现象的...
复制链接

扫一扫