multi-head attention(1231,23,3),把 X 切分成 8 块(8 个子空间),这样一个原先在一个位置上的 X,去了空间上 8 个位置,通过对 8 个点进行寻找,找到更合适的位置。给定一个 X,通过自注意力模型,得到一个 Z,这个 Z 就是对 X 的新的表征(词向量),Z 这个词向量相比较 X 拥有了句法特征和语义特征。Z 相比较 X 有了提升,通过 Multi-Head Self-Attention,得到的。多头自注意力,问题来了,多头是什么,多头的个数用 h 表示,一般。