python网络爬虫学习(四)正则表达式的使用之re的其他方法

原创 2016年05月26日 22:55:54

在上一篇文章中,我们学习了re的match方法,那么掌握了match方法,其他的方法学起来就相对轻松许多,下面对这些方法进行介绍

re.search

search方法与match方法最大的不同在于,match方法要求必须是从字符串的起始开始匹配,而search则会扫描整个字符串进行匹配。下面给出示例代码:

# -*-coding=utf-8 -*-
import re
pattern=re.compile(r'world')
match=re.search(pattern,r'hello world')
if match:
    print match.group()
else:
    print '匹配失败'

运行结果

world

re.split

split方法是按能够匹配的字符串将string分割,以列表形式返回

pattern3=re.compile(r'\d+')//匹配到数字,分割
match3=re.findall(pattern3,r'one1two2three2four')
print match3

结果

['one', 'two', 'three', 'four']

re.findall

搜索string,以列表返回所有匹配的字符串

pattern3=re.compile(r'\d+')
match3=re.findall(pattern3,r'one1two2three2four')
print match3

结果

['1', '2', '3']

re.finditer

搜索string,返回一个顺序访问每一个匹配结果(Match对象)的迭代器

for match4 in re.finditer(pattern4,r'one1two2three3four'):
    print match4.group()

结果

1
2
3

re.sub(pattern, repl, string[, count])

sub方法使用repl替换string中每一个匹配的子串后返回替换后的字符串。
当repl是一个字符串时,可以使用\id或\g、\g引用分组,但不能使用编号0。
当repl是一个方法时,这个方法应当只接受一个参数(Match对象),并返回一个字符串用于替换(返回的字符串中不能再引用分组)。
count用于指定最多替换次数,不指定时全部替换,代码示例:

s=r'i say,hello world'
pattern=re.compile(r'(\w+) (\w+)')
match=re.sub(pattern,r'\2 \1',s)
print match

运行结果

say i,world hello

re.subn

返回sub替换的次数

count=re.subn(pattern,r'\2 \1',s)
print count

运行结果

('say i,world hello', 2)

如果只需要次数,代码如下:

count=re.subn(pattern,r'\2 \1',s)
print count[1]
版权声明:本文为博主原创文章,未经博主允许不得转载。

相关文章推荐

[python] 常用正则表达式爬取网页信息及分析HTML标签总结

这篇文章主要是介绍Python爬取网页信息时,经常使用的正则表达式及方法。它是一篇总结性文章,实用性比较大,主要解决自己遇到的爬虫问题,也希望对你有所帮助~ 1.获取标签之间内容 2.获取超链接之间内...

python正则表达式——re模块的使用

python正则表达式——学习re模块 本文所有的代码使用的python版本为python3.5.1,运行环境为Ubuntu 16.04 LTS, GCC 5.3.1. 本文参考的python文档版...

python网络爬虫学习(三)正则表达式的使用之re.match方法

一.为什么要学习正则表达式很好,我们现在已经能够写出获得网站源代码的程序了,我们有了第一个问题:如何从杂乱的代码中找到我们所需的信息呢?此时,正则表达式的学习就显得很有必要了。有人打趣说,当你想到用正...

Python网络爬虫——Re库

正则表达式语法正则表达式的常用操作符 操作符 说明 实例 [ ] 字符集,对单个字符给出取值范围 [abc]表示a、b、c,[a-z]表示a到z单个字符 [^] 非字符集...

Python网络爬虫中的网页中文正则表达式匹配小心得

这是第一篇博客,关于在正则表达式的情况下通过python的re模块对爬虫爬下的网页数据进行正则表达式,匹配得出所有中文字符 #!/usr/bin/python # -*- coding: utf-...

python网络爬虫及正则表达式

python网络爬虫及正则表达式 模拟浏览器爬取网页 做爬虫经常需要用到正则表达式,匹配查找内容. 本文提供几段python的正则表达式代码示范,包括: 查找包含中文和英文 限制中文字个数的查找 查找...

Python 网络爬虫 009 (编程) 通过正则表达式来获取一个网页中的所有的URL链接,并下载这些URL链接的源代码

通过 正则表达式 来获取一个网页中的所有的 URL链接,并下载这些 URL链接 的源代码使用的系统:Windows 10 64位 Python 语言版本:Python 2.7.10 V 使用的编程...

Python 正则表达式的使用(re findall finditer match search)- 千月的python linux 系统管理指南学习笔记(13)

Python 使用正则表达式 正则表达式(Regular Expression),正则表达式通常被用来检索、替换那些符合某个模式(规则)的文本。在对文本的复杂匹配中起到了非常重要的作用。 Pyt...

python3 网络爬虫(四)如何查找以及使用cookies

环境:python3.4 win7 框架:scrapy在日常的爬虫工作中,有时候我们在爬取网站内容之前需要进行登录,在登登录之后才能看到我们想要找到的网站内容,这时,利用cookies来模拟登...

转载自android 开发--抓取网页解析网页内容的若干方法(网络爬虫)(正则表达式)

转载自http://blog.csdn.net/sac761/article/details/48379173 android 开发--抓取网页解析网页内容的若干方法(网络爬虫)(正则表达式) ...
内容举报
返回顶部
收藏助手
不良信息举报
您举报文章:python网络爬虫学习(四)正则表达式的使用之re的其他方法
举报原因:
原因补充:

(最多只允许输入30个字)