Nianwen Xue在《Chinese Word Segmentation as Character Tagging》中将中文分词视作为序列标注问题(sequence tagging problem),由此引入监督学习算法来解决分词问题。
1. HMM
首先,我们将简要地介绍HMM(主要参考了李航老师的《统计学习方法》)。HMM包含如下的五元组:
- 状态值集合\(Q=\{q_1, q_2, \cdots, q_N\}\),其中\(N\)为可能的状态数;
- 观测值集合\(V=\{v_1, v_2, \cdots, v_M\}\),其中\(M\)为可能的观测数;
- 转移概率矩阵\(A=\left[ a_{ij} \right]\),其中\(a_{ij}\)表示从状态\(i\)转移到状态\(j\)的概率;
- 发射概率矩阵(在[2]中称之为观测概率矩阵)\(B=\left[ b_{j}(k) \right]\),其中\(b_{j}(k)\)表示在状态\(j\)的条件下生成观测\(v_k\)的概率;
- 初始状态分布\(\pi\).
一般地,将HMM表示为模型\(\lambda = (A, B, \pi)\),状态序列为\(I\),对应测观测序列为\(O\)。对于这三个基本参数,HMM有三个基本问题:
- 概率计算问题,在模型\(\lambda\)下观测序列\(O\)出现的概率;
- 学习问题,已知观测序列\(O\),估计模型\(\lambda\)的参数,使得在该模型下观测序列\(P(O|\lambda)\)最大;