【文本分类】文本表示 --- VSM

最新推荐文章于 2020-12-30 01:55:53 发布

ccnunlp

最新推荐文章于 2020-12-30 01:55:53 发布

阅读量1k

点赞数 1

分类专栏：自然语言处理技术文章标签：领域模型算法 D语言

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/ccnunlp/article/details/83710652

版权

要使得计算机能高效的处理真实文本，就必须找到一种理想的形式化表示方法，这种表示一方面能真实的反映文档内容(主题、领域或结构等)，另一方面也要有对不同文档的区分能力。

目前文本表示通常采用向量空间模型(vector space model, VSM) 。VSM是20世纪60年代末期由G. Salton等人提出的，是当前自然语言处理中常用的主流模型。

下面首先给出VSM设计的基本概念：

(1) 文档(document)：通常是文章中具有一定规模的字符串。文档通常我们也叫文本。

(2) 特征项 (feature term)：是VSM中最小的不可分的语言单元，可以是字、词、词组、短语等。一个文档内容可以被看成是它含有的特征项的集合。表示为一个向量：D(t1,t2,...,tn)，其中tk是特征项。

(3) 特征项权重 (term weight)：对于含有n个特征项的文档D(t1,t2,..,tn)，每一个特征项tk都依据一定的原则被赋予了一个权重wk，表示该特征相在文档中的重要程度。这样一个文档D可用它含有的特征项及其特征项所对应的权重所表示： D(t1=w1,t2=w2,...,tn=wn)，简记为D(w1,w2,...,wn)，其中wk就是特征项tk的权重。

一个文档在上述约定下可以看成是n维空间中的一个向量，这就是VSM的基本理论基础。

向量空间模型在计算文档间相似程度上应用广泛。我们可以通过向量的内积运算来做到这一点&#

最低0.47元/天解锁文章

关注

1
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
【文本分类】文本表示 --- VSM

要使得计算机能高效的处理真实文本，就必须找到一种理想的形式化表示方法，这种表示一方面能真实的反映文档内容(主题、领域或结构等)，另一方面也要有对不同文档的区分能力。目前文本表示通常采用向量空间模型(vector space model, VSM)。VSM是20世纪60年代末期由G. Salton等人提出的，是当前自然语言处理中常用的主流模型。下面首先给出VSM设计的基本概念...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。