Synonym extraction(同义词提取)阅读笔记

摘要

从语料库中获取同义词对的常用方法通常需要基于两个词之间的上下文信息的相似度度量,例如 cosine similarity(余弦相似度)。此度量使我们能够检索与查询词相似的词,并从同义词候选列表中标识真正的同义词。我们进一步分析由相似度度量引入的词相似度网络,并对同义候选词进行重新排序——a mutual re-ranking method(MRM,一种互重排序方法)。

1、介绍

同义词的获取方法多种多样。其中,最流行的方法是based on distributional hypothesis(基于分布假设(Harris,1985):它指出同义名词共享相似的上下文信息。这一假设如下:

  1. 从语料库中提取每个被认为重要的词的上下文特征的统计信息,然后用这些上下文特征的向量来表示每个词。
  2. 选择一个相似性度量,如余弦相似性,并将其应用于查询词对和同义候选词对,生成按相似度得分排序的同义候选词列表。
  3. 从排名列表中选择最优秀的候选词,他们被视为查询词的同义词。

我们使用的前两种上下文特征是dependency relations(依赖关系),即 the child and parent constituents 子成分和父成分。依存关系一般是指谓语-论据结构,对于英语来说,它包括动词的主语和宾语,以及名词的修饰语。第三种上下文特征是proximity(邻近性)。以同一句子中目标名词的相邻词(进行词和后继词

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值