Python——利用jieba库实现分词、剔除特殊字符、扩充词库、存盘

# -*- coding: utf-8 -*-
import jieba
import re


def detailrearrange(line_jieba):
    after_rerange = []
    digit = re.compile('^[0-9]+(.[0-9]{1,3})?$')
    zhPattern = re.compile(u'[\u4e00-\u9fa5]+')
    for i in line_jieba:
        if digit.match(i):
            temp = next(line_jieba)
            if zhPattern.search(temp) and temp != '或':
                after_rerange.append(str(i) + temp)
            else:
                after_rerange.append(i)
                after_rerange.append(temp)
        else:
            after_rerange.append(i)
    lineafter = " ".join(after_rerange)
    return lineafter


def words_divide(readpath, savepath):
    f = open(readpath, encoding='utf-8')
    lines = f.readlines()
    f.close()
    jieba.load_userdict("词库")
    f = open(savepath, "a+")
    for line in lines:
        line_jieba = jieba.cut(line, cut_all=False, HMM=True)
        rerangeline = detailrearrange(line_jieba)
        f.write(rerangeline)
    f.close()


readpath = '打开文件'
savepath = '存储文件'
words_divide(readpath, savepath)

本文的词库文件需要自己建立词库,或者空白文件也是可以的

打开文件就是需要进行jieba处理的文件用其进行分词、剔除、扩充词库的文本

存储文件就是用来显示其jieba分词后的文件,此时的文件是剔除特殊字符串的文件

 

注意:如果出现编码有问题,可以打开相应的文件的记事本将其另存为时更改编码类型

9bb08fa8dbc941d8b534ca154a34dd35.png

fe001a1e7dff43a6bf86f5c73dad433f.png

将ANSI编码方式改为utf8即可

 

  • 0
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值