js中的正则表达式详解

最新推荐文章于 2022-02-18 21:26:22 发布

w372861232

最新推荐文章于 2022-02-18 21:26:22 发布

阅读量150

点赞数

分类专栏： javascript 文章标签：正则表达式 C# C C++ 编程

本文链接：https://blog.csdn.net/w372861232/article/details/83676498

版权

javascript 专栏收录该内容

2 篇文章 0 订阅

订阅专栏

认识正则表达式
如果原来没有使用过正则表达式，那么可能对这个术语和概念会不太熟悉。不过，它们并不是您想象的那么新奇。请回想一下在硬盘上是如何查找文件的。您肯定会使用 ? 和 * 字符来帮助查找您正寻找的文件。? 字符匹配文件名中的单个字符，而 * 则匹配一个或多个字符。如*.doc 会查出所有以 .doc 结尾的文件。
正则表达式的早期起源
正则表达式的“祖先”可以一直上溯至对人类神经系统如何工作的早期研究。
1956 年, 一位叫 Stephen Kleene(克莱尼) 的美国数学家在 McCulloch(麦卡洛克) 和 Pitts(皮茨) 早期工作的基础上，发表了一篇标题为“神经网事件的表示法”的论文，引入了正则表达式的概念。
随后，发现可以将这一工作应用于使用Ken Thompson(肯汤普森) 的计算搜索算法的一些早期研究，Ken Thompson是Unix 的主要发明人。正则表达式的第一个实用应用程序就是 Unix 中的qed 编辑器。
正则表达式是基于文本的编辑器和搜索工具中的一个重要部分。
正则表达式，可以说是任何一种编程语言都提供的机制，它主要是提供了对字符串的处理能力，对数据有效性验证。
定义正则表达式
1．定义正则表达式有两种形式，一种是普通方式，一种是构造函数方式。
2．普通方式：var reg=/表达式/附加参数
表达式：一个字符串，代表了某种规则，其中可以使用某些特殊字符，来代表特殊的规则，后面会详细说明。
附加参数：用来扩展表达式的含义，目前主要有三个参数：
g：代表可以进行全局匹配。
i：代表不区分大小写匹配。
m：代表可以进行多行匹配。
上面三个参数，可以任意组合，代表复合含义，当然也可以不加参数。
3．构造函数方式：var reg=new RegExp(“表达式”,”附加参数”);
其中“表达式”与“附加参数”的含义与上面那种定义方式中的含义相同。
例子：
var reg=new RegExp(“a*b”);
var reg=new RegExp(“abc+f”,”g”);
4．普通方式与构造函数方式的区别
普通方式中的表达式必须是一个常量字符串，而构造函数中的表达式可以是常量字符串，也可以是一个js变量，例如根据用户的输入来作为表达式参数等等：
var reg=new RegExp(document.forms[0].exprfiled.value,”g”);
表达式模式
1．从规范上讲，表达式模式分为简单模式和复合模式。
2．简单模式：是指通过普通字符的组合来表达的模式，例如
var reg=/abc0d/; 可见简单模式只能表示具体的匹配。
3．复合模式：是指含有通配符来表达的模式，例如：
var reg=/a+b?\w/; 其中的+、?和\w都属于通配符，代表着特殊的含义。因此复合模式可以表达更为抽象化的逻辑。
复合模式中各个通配符的含义及其使用。
\：在许多编程语言里面被用作转义符，一般来说\符号后面如果跟的是普通字符c，那么\c就代表特殊的含义，例如n本来代表字符n，但\n就代表换行。
\符号后面如果跟的是特殊字符c，那么\c就代表普通字符c，例如\一般用作转义符，但\\则调表普通字符\。
javascript的正则表达式中\的用法与上面相同，只是不同的编程语言，特殊字符表可能不太一样罢了。
定位符
^：匹配输入字符串的起始端，如果是多行匹配，即表达式的附加参数中含有m，则也在一个换行符后匹配。
例子：/^B/匹配 “Bab Bc ”中的第一个B
例子2：/^B/m匹配
          “cadd B
          cdaf
          B dsfB”
         第三行中的第一个B
$：匹配输入字符串的尾端，如果是多行匹配，即表达式的附加参数中含有m，则也在一个换行符前匹配。
与^的用法相反。
例子：/t$/匹配“bat”中的t，但是不匹配“hate”中的t
例子2：/t$/匹配
“tag at
bat”
最后一个t
(x)：表示匹配x(并非特指字符x或者特指一个字符，x表示一个字符串)，而且匹配会被记住，在语法中这种()被称为“capturing parentheses ”，即捕捉用的小括号。
匹配会被记住，是因为在表达式提供的函数中，有些函数返回一个数组，该数组会保存所匹配的所有字符串，例如exec()函数。
另外还要注意()中的x被记住的前提是匹配x。
例子1：
var regx=/a(b)c/; var rs=regx.exec(“abcddd”);
从上面可以看出,/a(b)c/匹配“abcddd”中的“abc”，因为()的原因，b也会记录下来，因此rs返回的数字内容为：
{abc,b}
例子2：
var regx=/a(b)c/; var rs=regx.exec(“acbcddd”);
rs返回null，因为/a(b)c/不匹配“acbcddd”，所以()中的b不会被记录下来（尽管字符串中含有b）
(?:x)：匹配x，但不会记住x，这种格式中的()被称为“non-capturing parentheses ”，即非捕捉用的小括号。
例子：
var regx=/a(?:b)c/; var rs=regx.exec(“abcddd”);
从上面可以看出,/a(?:b)c/匹配“abcddd”中的“abc”，因为(?:)的原因，b不会记录下来，因此rs返回的数字内容为：
{abc}
X(?=y)：匹配x，仅当后面紧跟着y时。如果符合匹配，则只有x会被记住，y不会被记住。
例子：
var regx=/user(?=name)/; var rs=regx.exec(“The username is Mary”);
结果：匹配成功，而且rs的值为{user}
X(?!y)：匹配x，仅当后面不紧跟着y时。如果符合匹配，则只有x会被记住，y不会被记住。
例子1：
var regx=/user(?!name)/; var rs=regx.exec(“The user name is Mary”);
结果：匹配成功，而且rs的值为{user}
例子2：
var regx=/\d+(?!\.)/; var rs=regx.exec(“54.235”);
结果：匹配成果，rs的值为{5}，不匹配54是因为54后面跟着“.”号，当然235也匹配，但是由于exec方法的行为，235不会被返回
x|y：匹配x或y。注意如果x和y都匹配上了，那么只记住x。
例子：
var regx=/beijing|shanghai/; var rs=regx.exec(“I love beijing and shanghai”);
结果：匹配成功，rs的值为{beijing}，虽然shanghai也匹配，但不会被记住。
[xyz]：xyz表示一个字符串，该模式表示匹配[]中的一个字符，形式上[xyz]等同于[x-z]。
例子：
var regx=/a[bc]d/; var rs=regx.exec(“abddgg”); 结果：匹配成功，rs的值为：{abd}
例子2：
var regx=/a[bc]d/; var rs=regx.exec(“abcd”);
结果：匹配失败，rs的值为：null，之所以失败，是因为[bc]表示匹配b或c中的一个，但不会同时匹配。
[^xyz]：该模式表示匹配非[]中的一个字符，形式上[^xyz]等同于[^x-z]。
例子：
var regx=/a[^bc]d/; var rs=regx.exec(“afddgg”);
结果：匹配成功，rs的值为：{afd}
例子2：
var regx=/a[^bc]d/; var rs=regx.exec(“abd”);
结果：匹配失败，rs的值为：null。
较为常用的元字符包括
*：匹配前一个字符0次或多次。
例子：/ab*/匹配 “abbbb”，也匹配“ddda”中的“a”
+：匹配前一个字符1次或多次。
例子：/ab+/ “abbbb”，但不匹配“ddda”
?：?的用法比较特殊，一般来说它用来对前一个字符做0次或1次匹配
.：小数点中的“.”号，匹配任何一个单独的字符，但是换行符除外。
标准中总共有哪些字符？请参考：字符集
例如：/a.b/匹配“acbaa”中的“acb”
{n}：匹配前一个字符的n次出现。
n必须是一个非负数，当然如果是一个负数或小数也不会报语法错误。
例子：
var regx=/ab{2}c/; var rs=regx.exec(“abbcd”);
结果：匹配成功，rs的值为：{abbc}。
{n,}：匹配前一个字符的至少n次出现。
例子：
var regx=/ab{2,}c/; var rs=regx.exec(“abbcdabbbc”);
结果：匹配成功，rs的值为：{abbc}。
{n,m}：匹配前一个字符的至少n次最多m次的出现。
只要n与m为数字，而且m>=n就不会报语法错误。
例子：
var regx=/ab{2,5}c/; var rs=regx.exec(“abbbcd”);
结果：匹配成功，rs的值为：{abbbc}。
例子2：
var regx=/ab{2,2}c/; var rs=regx.exec(“abbcd”);
结果：匹配成功，rs的值为：{abbc}。
例子3：
var regx=/ab(2,5)/; var rs=regx.exec(“abbbbbbbbbb”);
结果：匹配失败
var regx=/ab(2,5)c/; var rs=regx.exec(“abbbbbbbbbbc”);
结果：匹配失败，rs的值为：null，为什么匹配失败，因为b多于5个则b(2,5)会匹配前5个b，，而表达式/ab(2,5)c/中b后面是c，但字符串中5个b之后还是b所以会报错。
\b：匹配一个词的边界符，例如空格和换行符等等，当然匹配换行符时，表达式应该附加参数m。
例子：
var regx=/\bc./; var rs=regx.exec(“Beijing is a beautiful city”);
结果：匹配成功，rs的值为：{ci}，注意c前边的空格不会匹配到结果中，即{ ci}是不正确的。
\B：代表一个非单词边界。
例子：
var regx=/\Bi./; var rs=regx.exec(“Beijing is a beautiful city”);
结果：匹配成功，rs的值为：{ij}，即匹配了Beijing中的ij。
\d：匹配一个数字字符，等同于[0-9]。
例子：
var regx=/user\d/; var rs=regx.exec(“user1”);
结果：匹配成功，rs的值为：{user1}
\D：匹配一个非数字字符，等同于[^0-9]。
例子：
var regx=/user\D/; var rs=regx.exec(“userA”);
结果：匹配成功，rs的值为：{userA}
\n：匹配一个换行符。因为是换行符，所以在表达式中要加入m参数。
例子：
var regx=/a\r\nbc/;
       var str=“a
               bc”;
       var rs=regx.exec(str);
       结果：匹配成功在一般的编辑器中一个”Enter”键代表着“回车换行”，而非“换行回车”，至少在textarea域中是这样的。
\r：匹配一个回车符
\s：匹配一个空格符
例子：
var regx=/\si/; var rs=regx.exec(“Beijing is a city”);
结果：匹配成功，rs的值为：{ i}
\S：匹配一个非空格符
例子：
var regx=/\Si/; var rs=regx.exec(“Beijing is a city”);
结果：匹配成功，rs的值为：{ei}
\t：匹配一个tab
例子：
var regx=/a\tb/; var rs=regx.exec(“a bc”);
结果：匹配成功，rs的值为： {a       bc}
\w：匹配一个数字、_或字母表字符，即[A-Za-z0-9_ ]。
例子：
var regx=/\w/; var rs=regx.exec(“$25.23”);
结果：匹配成功，rs的值为：{2}
\W：匹配一个非数字、_或字母表字符，即[^A-Za-z0-9_ ]。
例子：
var regx=/\w/; var rs=regx.exec(“$25.23”);
结果：匹配成功，rs的值为：{$}
表达式操作
exec(str)，返回str中与表达式相匹配的第一个字符串，而且以数组的形式表现，当然如果表达式中含有捕捉用的小括号，则返回的数组中也可能含有()中的匹配字符串，例如：
var regx=/\d+/; var rs=regx.exec(“3432ddf53”);
返回的rs值为：{3432}
var regx2=new RegExp(“ab(\d+)c”); var rs2=regx2.exec(“ab234c44”);
返回的rs值为：{ab234c,234}
test(str)，判断字符串str是否匹配表达式，返回一个布尔值。例如：
var regx=/user\d+/g;
var flag=regx.test(“user12dd”); flag的值为true。
String对象方法
match(expr)，返回与expr相匹配的一个字符串数组，如果没有加参数g，则返回第一个匹配，加入参数g则返回所有的匹配
例子：
var regx=/user\d/g; var str=“user13userddduser345”; var rs=str.match(regx);
rs的值为：{user1,user3}
search(expr)，返回字符串中与expr相匹配的第一个匹配的index值。
例子：
var regx=/user\d/g; var str=“user13userddduser345”; var rs=str.search(regx);
rs的值为：0
replace(expr,str)，将字符串中匹配expr的部分替换为str。另外在replace方法中，str中可以含有一种变量符号$，格式为$n，代表匹配中被记住的第n的匹配字符串（注意小括号可以记忆匹配）。
例子：
var regx=/user\d/g; var str=“user13userddduser345”; var rs=str.replace(regx,”00”);
rs的值为：003userddd0045
例子2：
var regx=/u(se)r\d/g; var str=“user13userddduser345”; var rs=str.replace(regx,”$1”);
rs的值为：se3userdddse45
对于replace(expr,str)方法还要特别注意一点，如果expr是一个表达式对象则会进行全局替换（此时表达式必须附加参数g，否则也只是替换第一个匹配），如果expr是一个字符串对象，则只会替换第一个匹配的部分，例如：
var regx=“user”
var str=“user13userddduser345”; var rs=str.replace(regx,”00”);
rs的值为： 0013userddduser345
split(expr)，将字符串以匹配expr的部分做分割，返回一个数组，而且表达式是否附加参数g都没有关系，结果是一样的。
例子：
var regx=/user\d/g; var str=“user13userddduser345”; var rs=str.split(regx);
rs的值为：{3userddd,45}
优先级顺序
1． \ 转义符
2．（）、（？：）、（？＝）、[] 圆括号和方括号
3． * + ? {n} {n,} {n,m} 限定符
4． ^ $ 位置和顺序
5． |   或操作
实际应用
1）实际应用一
描述：有一表单，其中有一个“用户名”input域
要求：汉字，而且不能少于2个汉字，不能多于4个汉字。
实现：
<script>
function checkForm(obj){
     var username=obj.username.value;
     var regx=/^[\u4e00-\u9fa5]{2,4}$/g
     if(!regx.test(username)){
               alert(“Invalid username!”);
               return false;
     }
     return true;
}
</script>
<form name=“myForm”onSubmit=“return checkForm(this)”>
    <input type=“text” name=“username”/>
    <input type=“submit” vlaue=“submit”/>
</form>
2）实际应用二
描述：给定一个含有html标记的字符串，要求将其中的html标记去掉。
实现：
<script>
function toPlainText(htmlStr){
     var regx=/<[^>]*>|<\/[^>]*>/gm;
     var str=htmlStr.replace(regx,"");
     return str;
}
</script>
<form name=“myForm”>
    <textarea id=“htmlInput”></textarea>
    <input type=“button” value=“submit” οnclick=“toPlainText(document.getElementById(‘htmlInput’).value)”/>
</form>
//校验登录名：只能输入5-20个以字母开头、可带数字、“_”、“.”的字串
var patrn=/^[a-zA-Z]{1}([a-zA-Z0-9]|[._]){4,19}$/;
//校验用户姓名：只能输入1-30个以字母开头的字串
var patrn=/^[a-zA-Z]{1,30}$/;
//校验密码：只能输入6-20个字母、数字、下划线
var patrn=/^(\w){6,20}$/;
匹配国内电话号码：/^(\d{3}-\d{8})|(\d{4}-\d{7}) $/
评注：匹配形式如 0511-4405222 或 021-87888822
匹配中国邮政编码：/^ [1-9]\d{5} $/
评注：中国邮政编码为6位数字
//email地址
var patrn=/^\w+([-+.]\w+)*@\w+([-.]\w+)*\.\w+([-.]\w+)*$/;
//url
var patrn=/^http:\/\/([\w]{3}\.)[\w]+(\.\w+)$/
总结1：附件参数g的用法
表达式加上参数g之后，表明可以进行全局匹配，注意这里“可以”的含义。我们详细叙述：
1）对于表达式对象的exec方法，不加入g，则只返回第一个匹配，无论执行多少次均是如此，如果加入g，则第一次执行也返回第一个匹配，再执行返回第二个匹配，依次类推。例如
var regx=/user\d/;
var str=“user18dsdfuser2dsfsd”;
var rs=regx.exec(str);//此时rs的值为{user1}
var rs2=regx.exec(str);//此时rs的值依然为{user1}
如果regx=/user\d/g；则rs的值为{user1}，rs2的值为{user2}
通过这个例子说明：对于exec方法，表达式加入了g，并不是说执行exec方法就可以返回所有的匹配，而是说加入了g之后，我可以通过某种方式得到所有的匹配，这里的“方式”对于exec而言，就是依次执行这个方法即可。
2）对于表达式对象的test方法，加入g于不加上g没有什么区别。
3）对于String对象的match方法，不加入g，也只是返回第一个匹配，一直执行match方法也总是返回第一个匹配，加入g，则一次返回所有的匹配（注意这与表达式对象的exec方法不同，对于exec而言，表达式即使加上了g，也不会一次返回所有的匹配）。例如：
var regx=/user\d/;
var str=“user1sdfsffuser2dfsdf”;
var rs=str.match(regx);//此时rs的值为{user1}
var rs2=str.match(regx);//此时rs的值依然为{user1}
如果regx=/user\d/g，则rs的值为{user1,user2}，rs2的值也为{user1,user2}
4）对于String对象的replace方法，表达式不加入g，则只替换第一个匹配，如果加入g，则替换所有匹配。
5）对于String对象的split方法，加上g与不加g是一样的，即：
var sep=/user\d/;
var array=“user1dfsfuser2dfsf”.split(sep);
则array的值为{dfsf, dfsf}
此时sep=/user\d/g，返回值是一样的。
6）对于String对象的search方法，加不加g也是一样的。
总结2：附加参数m的用法
附加参数m，表明可以进行多行匹配，但是这个只有当使用^和$模式时才会起作用，在其他的模式中，加不加入m都可以进行多行匹配（其实说多行的字符串也是一个普通字符串），我们举例说明这一点
1）使用^的例子
var regx=/^b./g;
var str=“bd76 dfsdf
         sdfsdfs dffs
         b76dsf sdfsdf”;
var rs=str.match(regx);
此时加入g和不加入g，都只返回第一个匹配{bd}，如果regx=/^b./gm，则返回所有的匹配{bd,b7}，注意如果regx=/^b./m，则也只返回第一个匹配。所以，加入m表明可以进行多行匹配，加入g表明可以进行全局匹配，综合到一起就是可以进行多行全局匹配
2）使用其他模式的例子，例如
var regx=/user\d/;
var str=“sdfsfsdfsdf
         sdfsuser3 dffs
         b76dsf user6”;
var rs=str.match(regx);
此时不加参数g，则返回{user3}，加入参数g返回{user3,user6}，加不加入m对此没有影响。
3）因此对于m我们要清楚它的使用，记住它只对^和$模式起作用，在这两种模式中，m的作用为：如果不加入m，则只能在第一行进行匹配，如果加入m则可以在所有的行进行匹配。我们再看一个^的例子
var regx=/^b./;
var str=“ret76 dfsdf
         bjfsdfs dffs
         b76dsf sdfsdf”;
var rs=str.match(regx);
此时rs的值为null，如果加入g，rs的值仍然为null，如果加入m，则rs的值为{bj}（也就是说，在第一行没有找到匹配，因为有参数m，所以可以继续去下面的行去找是否有匹配），如果m和g都加上，则返回{bj,b7}（只加m不加g说明，可以去多行进行匹配，但是找到一个匹配后就返回，加入 g表明将多行中所有的匹配返回，当然对于match方法是如此，对于exec呢，则需要执行多次才能依次返回）
总结3：在HTML的textarea输入域中，按一个Enter键，对应的控制字符为“\r\n”，即“回车换行”，而不是“\n\r”，即“换行回车”，我们看一个前面我们举过的例子：
var regx=/a\r\nbc/;
var str=“a
         bc”;
var rs=regx.exec(str);
结果：匹配成功，rs的值为：{      }，如果表达式为/a\n\rbc/，则不会被匹配，因此在一般的编辑器中一个”Enter”键代表着“回车换行”，而非“换行回车”，至少在textarea域中是这样的。

w372861232

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
js中的正则表达式详解

认识正则表达式如果原来没有使用过正则表达式，那么可能对这个术语和概念会不太熟悉。不过，它们并不是您想象的那么新奇。请回想一下在硬盘上是如何查找文件的。您肯定会使用 ? 和 * 字符来帮助查找您正寻找的文件。? 字符匹配文件名中的单个字符，而 * 则匹配一个或多个字符。如*.doc 会查出所有以.doc 结尾的文件。正则表达式的早期起源正则表达式的“祖先”可以一直上溯至对人类神经...
复制链接

扫一扫