京东手机评论数据挖掘之一:新词识别

把jieba分词开源的词典作为base,从东上的手机评论中,找出新词。

先从京东上把评论抓下来。京东只让看到每个商品的前1000条评论,经过清洗、大小写转换、简繁体转换、排重后共100M数据。

统计高频词,采集特征。特征包括自由度、左右熵、词频,首尾字的成词能力,3个与词性相关的特征等,共10多个特征。

分别用了随机森林和神经网络(keras平台)来做分类,随机森林的效果好些。

目前识别到的13000多新词(jieba分词的词典没有收录的词):

http://121.89.176.173/new_words.html

京东评论的情感分析结果(目前效果还不太好,持续改进中)

http://121.89.176.173/index.html

 

  • 1
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值