利用正则表达式分离汉字、英文、数字

在中文分词的过程中需要将英文,数字,汉字分离,数字和英文就不用分割了,主要是将分离出来的汉字进行分词,下面的算法实现利用正则表达式分离汉字、英文、数字:

//获取中文
string chRegS = @"[\u4e00-\u9fa5]+";
Regex chRegR = new Regex(chRegS);
Match chMacth = chRegR.Match(str);
while(chMacth.Success)
{
     CHresult.Add(chMacth.ToString());
     chMacth = chMacth.NextMatch();
}
//英文
string enRegS = @"[a-zA-Z]+";
Regex enRegR = new Regex(enRegS);
Match enMatch = enRegR.Match(str);
while (enMatch.Success)
{
     Enresult.Add(enMatch.ToString());
     enMatch = enMatch.NextMatch();
}
//数字
string numRegS = @"\d+";
Regex numRegR = new Regex(numRegS);
Match numMatch = numRegR.Match(str);
while (numMatch.Success)
{
     Numresult.Add(numMatch.ToString());
     numMatch = numMatch.NextMatch();
}


 

测试字符串:“可复用的WPF或者Silverlight应用程序和组件设计(3)——控件级别”

结果:

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值