pyhanlp 繁简转换，拼音转换与字符正则化

最新推荐文章于 2023-04-19 14:20:53 发布

lanlantian123456

最新推荐文章于 2023-04-19 14:20:53 发布

阅读量334

点赞数

繁简转换
HanLP几乎实现了所有我们需要的繁简转换方式，并且已经封装到了HanLP中，使得我们可以轻松的使用，而分词器中已经默认支持多种繁简格式或者混合。这里我们不再做过多描述。

说明
HanLP能够识别简繁分歧词，比如打印机=印表機。许多简繁转换工具不能区分“以后”“皇后”中的两个“后”字，HanLP可以。
算法详解
《汉字转拼音与简繁转换的Java实现》
from pyhanlp import *

繁简转化

print(HanLP.convertToTraditionalChinese("“以后等你当上皇后，就能买草莓庆祝了”。发现一根白头发"))
print(HanLP.convertToSimplifiedChinese(“憑藉筆記簿型電腦寫程式HanLP”))

简体转台湾繁体

print(HanLP.s2tw(“hankcs在台湾写代码”))

台湾繁体转简体

print(HanLP.tw2s(“hankcs在臺灣寫程式碼”))

简体转香港繁体

print(HanLP.s2hk(“hankcs在香港写代码”))

香港繁体转简体

print(HanLP.hk2s(“hankcs在香港寫代碼”))

香港繁体转台湾繁体

print(HanLP.hk2tw(“hankcs在臺灣寫代碼”))

台湾繁体转香港繁体

print(HanLP.tw2hk(“hankcs在香港寫程式碼”))

香港/台湾繁体和HanLP标准繁体的互转

print(HanLP.t2tw(“hankcs在臺灣寫代碼”))
print(HanLP.t2hk(“hankcs在臺灣寫代碼”))

print(HanLP.tw2t(“hankcs在臺灣寫程式碼”))
print(HanLP.hk2t(“hankcs在台灣寫代碼”))

「以後等你當上皇后，就能買草莓慶祝了」。發現一根白頭髮
凭借笔记本电脑写程序HanLP
hankcs在臺灣寫程式碼
hankcs在台湾写代码
hankcs在香港寫代碼
hankcs在香港写代码
hankcs在臺灣寫程式碼
hankcs在香港寫代碼
hankcs在臺灣寫程式碼
hankcs在台灣寫代碼
hankcs在臺灣寫代碼
hankcs在臺灣寫代碼

汉字转拼音
HanLP中的汉字转拼音功能也十分的强大。

说明
HanLP不仅支持基础的汉字转拼音，还支持声母、韵母、音调、音标和输入法首字母首声母功能。
HanLP能够识别多音字，也能给繁体中文注拼音。
最重要的是，HanLP采用的模式匹配升级到AhoCorasickDoubleArrayTrie，性能大幅提升，能够提供毫秒级的响应速度！
算法详解
《汉字转拼音与简繁转换的Java实现》

汉字转拼音

Pinyin = JClass(“com.hankcs.hanlp.dictionary.py.Pinyin”)
text = “重载不是重任！”
pinyin_list = HanLP.convertToPinyinList(text)

print(“原文，”, end=" “)
print(text)
print(“拼音（数字音调），”, end=” “)
print(pinyin_list)
print(“拼音（符号音调），”, end=” “)
for pinyin in pinyin_list:
print(”%s," % pinyin.getPinyinWithToneMark(), end=" “)
print(”\n拼音（无音调），", end=" “)
for pinyin in pinyin_list:
print(”%s," % pinyin.getPinyinWithoutTone(), end=" “)
print(”\n声调，", end=" “)
for pinyin in pinyin_list:
print(”%s," % pinyin.getTone(), end=" “)
print(”\n声母，", end=" “)
for pinyin in pinyin_list:
print(”%s," % pinyin.getShengmu(), end=" “)
print(”\n韵母，", end=" “)
for pinyin in pinyin_list:
print(”%s," % pinyin.getYunmu(), end=" “)
print(”\n输入法头，", end=" “)
for pinyin in pinyin_list:
print(”%s," % pinyin.getHead(), end=" ")

print()

拼音转换可选保留无拼音的原字符

print(HanLP.convertToPinyinString(“截至2012年，”, " ", True))
print(HanLP.convertToPinyinString(“截至2012年，”, " ", False))

原文，重载不是重任！
拼音（数字音调）， [chong2, zai3, bu2, shi4, zhong4, ren4, none5]
拼音（符号音调）， chóng, zǎi, bú, shì, zhòng, rèn, none,
拼音（无音调）， chong, zai, bu, shi, zhong, ren, none,
声调， 2, 3, 2, 4, 4, 4, 5,
声母， ch, z, b, sh, zh, r, none,
韵母， ong, ai, u, i, ong, en, none,
输入法头， ch, z, b, sh, zh, r, none,
jie zhi none none none none nian none
jie zhi 2 0 1 2 nian ，

拼音转中文
HanLP中的数据结构和接口是灵活的，组合这些接口，可以自己创造新功能，我们可以使用AhoCorasickDoubleArrayTrie实现的最长分词器，需要用户调用setTrie()提供一个AhoCorasickDoubleArrayTrie

StringDictionary = JClass(
“com.hankcs.hanlp.corpus.dictionary.StringDictionary”)
CommonAhoCorasickDoubleArrayTrieSegment = JClass(
“com.hankcs.hanlp.seg.Other.CommonAhoCorasickDoubleArrayTrieSegment”)
Config = JClass(“com.hankcs.hanlp.HanLP$Config”)

TreeMap = JClass(“java.util.TreeMap”)
TreeSet = JClass(“java.util.TreeSet”)

dictionary = StringDictionary()
dictionary.load(Config.PinyinDictionaryPath)
entry = {}
m_map = TreeMap()
for entry in dictionary.entrySet():
pinyins = entry.getValue().replace("[\d,]", “”)
words = m_map.get(pinyins)
if words is None:
words = TreeSet()
m_map.put(pinyins, words)
words.add(entry.getKey())
words = TreeSet()
words.add(“绿色”)
words.add(“滤色”)
m_map.put(“lvse”, words)

segment = CommonAhoCorasickDoubleArrayTrieSegment(m_map)
print(segment.segment(“renmenrenweiyalujiangbujianlvse”))
print(segment.segment(“lvsehaihaodajiadongxidayinji”))

[renmenrenweiyalujiangbujian/null, lvse/[滤色, 绿色]]
[lvse/[滤色, 绿色], haihaodajiadongxidayinji/null]

字符正则化
演示正规化字符配置项的效果（繁体->简体，全角->半角，大写->小写）。
该配置项位于hanlp.properties中，通过Normalization=true来开启（现在直接通过HanLP.Config.Normalization开启即可）。

切换配置后必须删除CustomDictionary.txt.bin缓存，否则只影响动态插入的新词。
在我动笔前一个星期，已经有同学添加了，添加自定义词典之后，自动删除缓存的功能。地址请点击https://github.com/hankcs/HanLP/pull/954，现在只需要开启正则化即可

CustomDictionary =JClass(“com.hankcs.hanlp.dictionary.CustomDictionary”)
print(“HanLP.Config.Normalization = False\n”)
HanLP.Config.Normalization = False
CustomDictionary.insert(“爱听4G”, “nz 1000”)
print(HanLP.segment(“爱听4g”))
print(HanLP.segment(“爱听4G”))
print(HanLP.segment(“爱听４G”))
print(HanLP.segment(“爱听４Ｇ”))
print(HanLP.segment(“愛聽４Ｇ”))

print(HanLP.segment(“喜欢４Ｇ”))
print(HanLP.segment(“hankcs在臺灣寫代碼”))

print("\nHanLP.Config.Normalization = True\n")
HanLP.Config.Normalization = True
print(HanLP.segment(“爱听4g”))
print(HanLP.segment(“爱听4G”))
print(HanLP.segment(“爱听４G”))
print(HanLP.segment(“爱听４Ｇ”))
print(HanLP.segment(“愛聽４Ｇ”))

print(HanLP.segment(“喜欢４Ｇ”))
print(HanLP.segment(“hankcs在臺灣寫代碼”))

HanLP.Config.ShowTermNature = False
text = HanLP.s2tw(“现在的HanLP已经添加了添加自定义词典之后，自动删除缓存的功能,现在只需要开启正则化即可”)
print(text)
print(HanLP.segment(text))
HanLP.Config.ShowTermNature = False

HanLP.Config.Normalization = False

[爱听4g]
[爱听4G]
[爱, 听, ４, G]
[爱, 听, ４, Ｇ]
[愛, 聽, ４, Ｇ]
[喜欢, ４, Ｇ]
[hankcs, 在, 臺, 灣寫, 代, 碼]

HanLP.Config.Normalization = True

[爱听4g]
[爱听4g]
[爱听4g]
[爱听4g]
[爱听4g]
[喜欢, 4, g]
[hankcs, 在, 台湾, 写, 代码]
現在的HanLP已經新增了新增自定義詞典之後，自動刪除快取的功能,現在只需要開啟正則化即可
[现在, 的, hanlp, 已经, 新增, 了, 新增, 自定义, 词典, 之后, , 自动, 删除, 快, 取, 的, 功能, , 现在, 只, 需要, 开启, 正, 则, 化, 即可]

文章来源于Font Tian的博客

lanlantian123456

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
1
评论
pyhanlp 繁简转换，拼音转换与字符正则化

繁简转换HanLP几乎实现了所有我们需要的繁简转换方式，并且已经封装到了HanLP中，使得我们可以轻松的使用，而分词器中已经默认支持多种繁简格式或者混合。这里我们不再做过多描述。说明HanLP能够识别简繁分歧词，比如打印机=印表機。许多简繁转换工具不能区分“以后”“皇后”中的两个“后”字，HanLP可以。算法详解《汉字转拼音与简繁转换的Java实现》from pyhanlp impor...
复制链接

扫一扫