开源中文分词工具探析（七）：LTP

浅唱书令

已于 2023-06-01 14:15:48 修改

阅读量681

点赞数

分类专栏：人工智能文章标签：中文分词算法自然语言处理

于 2018-06-11 16:52:00 首次发布

本文链接：https://blog.csdn.net/keyboardlabourer/article/details/130980456

版权

人工智能专栏收录该内容

46 篇文章 9 订阅 ¥19.90 ¥99.00

订阅专栏

本文深入探讨了哈工大开源的LTP中文语言处理系统，包括其分词流程、训练模型和特征。LTP使用结构化感知器进行建模，并通过Viterbi解码进行分词。相比THULAC，LTP在速度上稍慢，主要由于特征检索方式不同。LTP的特征主要包括字符单、双 grams 和字符类型等。

摘要由CSDN通过智能技术生成

LTP是哈工大开源的一套中文语言处理系统，涵盖了基本功能：分词、词性标注、命名实体识别、依存句法分析、语义角色标注、语义依存分析等。

1. 前言

同THULAC一样，LTP也是基于结构化感知器(Structured Perceptron, SP)，以最大熵准则建模标注序列\(Y\)在输入序列\(X\)的情况下的score函数：

\[S(Y,X) = \sum_s \alpha_s \Phi_s(Y,X) \]

其中，\(\Phi_s(Y,X)\)为本地特征函数。中文分词问题等价于给定\(X\)序列，求解score函数最大值对应的\(Y\)序列：

\[\mathop{\arg \max}_Y S(Y,X) \]

2. 分解

以下源码分析基于版本3.4.0。

分词流程

分词流程与其他分词器别无二致，先提取字符特征，计算特征权重值，然后Viterbi解码。代码详见__ltp_dll_segmentor_wrapper::segment()：

int segment(const char *str, std::vector<std::string> &words) {
    ltp::framework::ViterbiFeatureContext ctx;
    ltp::framework::ViterbiScoreMatrix scm;
    ltp::framework::

了解本专栏

浅唱书令

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
打赏
0
评论
开源中文分词工具探析（七）：LTP

LTP是哈工大开源的一套中文语言处理系统，涵盖了基本功能：分词、词性标注、命名实体识别、依存句法分析、语义角色标注、语义依存分析等。【开源中文分词工具探析】系列：开源中文分词工具探析(一)：ICTCLAS (NLPIR)开源中文分词工具探析(二)：Jieba开源中文分词工具探析(三)：Ansj开源中文分词工具探析(四)：THULAC开源中文分词工具探析(五)：FNLP开源中文分...
复制链接

扫一扫