【主题建模】文本分析:非结构化信息分析科学与应用导论

文本分析:非结构化信息分析科学与应用导论

1.介绍

文本聚类可以将数据(这里即指文本)按照一定规则划分为不同的群组,理想情况下可以从聚类结果中发现一些有趣的模式。不同聚类方法的一致性意义和划分方式也不同。尽管它们有各自的用武之地,但它们无法发现这些群组中任何隐藏结构。

例如,考虑以下国际媒体上的新闻标题,且没有其他的知识来源:

  1. Amazon’s virtual assistant could witness a homicide in Florida.(亚马逊的虚拟助手可以目睹佛罗里达州的一起凶杀案。)
  2. Auto sales in Mexico hit low records due to pandemic.(由于大流行,墨西哥的汽车销量创下新低。)
  3. High-speed trains are close to doubling their speed.(高速列车的速度接近翻倍。)
  4. Flower market in Mexico closed due to covid-19.(墨西哥花卉市场因 covid-19 而关闭。)
  5. Coronavirus could last 3 more years in the United States.(冠状病毒在美国可能还会持续 3 年。)

很容易发现:(1) 和 (3) 是关于技术组成的 Group1,(2)、(4) 和 (5) 是关于 covid-19 的 Group2。当然,任何一种聚类方法应该也会得出同样的结论。现在假设有一个 “隐藏的” 结构,它连接着 Group1 的单词,而另一个结构则连接着 Group2 的单词(即,哪些术语对描述每个组更重要?)。如果能 “

  • 3
    点赞
  • 5
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

G皮T

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值