Python 中文分词工具 ——结巴分词的使用方法总结

最新推荐文章于 2024-01-17 16:14:00 发布

laoyaotask

最新推荐文章于 2024-01-17 16:14:00 发布

阅读量1.3w

点赞数 1

分类专栏：结巴分词 Python

本文链接：https://blog.csdn.net/laoyaotask/article/details/9275837

版权

Python 同时被 2 个专栏收录

37 篇文章 1 订阅

订阅专栏

结巴分词

2 篇文章 0 订阅

订阅专栏

结巴分词工具的安装及基本用法，昨天的博客中已经有所描述。今天要说的内容与实际应用更贴近——从文本中读取中文信息，利用结巴分词工具进行分词及词性标注。

示例代码如下：

#coding=utf-8
import jieba
import jieba.posseg as pseg
import time
t1=time.time()
f=open("t_with_splitter.txt","r") #读取文本
string=f.read().decode("utf-8")

words = pseg.cut(string) #进行分词
result=""  #记录最终结果的变量
for w in words:
     result+= str(w.word)+"/"+str(w.flag) #加词性标注

f=open("t_with_POS_tag.txt","w")  #将结果保存到另一个文档中
f.write(result)
f.close()
t2=time.time()
print("分词及词性标注完成，耗时："+str(t2-t1)+"秒。") #反馈结果

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

laoyaotask

关注关注

1
点赞
踩
9

收藏

觉得还不错? 一键收藏
12
评论
Python 中文分词工具 ——结巴分词的使用方法总结

结巴分词工具的安装及基本用法，昨天的博客中已经有所描述。今天要说的内容与实际应用更贴近——从文本中读取中文信息，利用结巴分词工具进行分词及词性标注。示例代码如下：#coding=utf-8import jiebaimport jieba.posseg as psegimport timet1=time.time()f=open("t_with_splitter.txt","r")
复制链接

扫一扫