【中文分词】隐马尔可夫模型HMM

浅唱书令

已于 2023-06-01 14:17:38 修改

阅读量149

点赞数

分类专栏：人工智能文章标签：中文分词算法自然语言处理

于 2016-12-12 13:37:00 首次发布

本文链接：https://blog.csdn.net/keyboardlabourer/article/details/130980556

版权

45 篇文章 8 订阅 ¥19.90 ¥99.00

订阅专栏

Nianwen Xue在《Chinese Word Segmentation as Character Tagging》中将中文分词视作为序列标注问题(sequence tagging problem)，由此引入监督学习算法来解决分词问题。

1. HMM

首先，我们将简要地介绍HMM(主要参考了李航老师的《统计学习方法》)。HMM包含如下的五元组：

状态值集合\(Q=\{q_1, q_2, \cdots, q_N\}\)，其中\(N\)为可能的状态数；
观测值集合\(V=\{v_1, v_2, \cdots, v_M\}\)，其中\(M\)为可能的观测数；
转移概率矩阵\(A=\left[ a_{ij} \right]\)，其中\(a_{ij}\)表示从状态\(i\)转移到状态\(j\)的概率；
发射概率矩阵(在[2]中称之为观测概率矩阵)\(B=\left[ b_{j}(k) \right]\)，其中\(b_{j}(k)\)表示在状态\(j\)的条件下生成观测\(v_k\)的概率；
初始状态分布\(\pi\).

一般地，将HMM表示为模型\(\lambda = (A, B, \pi)\)，状态序列为\(I\)，对应测观测序列为\(O\)。对于这三个基本参数，HMM有三个基本问题：

了解本专栏

关注