python网络爬虫学习(四)正则表达式的使用之re的其他方法

原创 2016年05月26日 22:55:54

在上一篇文章中,我们学习了re的match方法,那么掌握了match方法,其他的方法学起来就相对轻松许多,下面对这些方法进行介绍

re.search

search方法与match方法最大的不同在于,match方法要求必须是从字符串的起始开始匹配,而search则会扫描整个字符串进行匹配。下面给出示例代码:

# -*-coding=utf-8 -*-
import re
pattern=re.compile(r'world')
match=re.search(pattern,r'hello world')
if match:
    print match.group()
else:
    print '匹配失败'

运行结果

world

re.split

split方法是按能够匹配的字符串将string分割,以列表形式返回

pattern3=re.compile(r'\d+')//匹配到数字,分割
match3=re.findall(pattern3,r'one1two2three2four')
print match3

结果

['one', 'two', 'three', 'four']

re.findall

搜索string,以列表返回所有匹配的字符串

pattern3=re.compile(r'\d+')
match3=re.findall(pattern3,r'one1two2three2four')
print match3

结果

['1', '2', '3']

re.finditer

搜索string,返回一个顺序访问每一个匹配结果(Match对象)的迭代器

for match4 in re.finditer(pattern4,r'one1two2three3four'):
    print match4.group()

结果

1
2
3

re.sub(pattern, repl, string[, count])

sub方法使用repl替换string中每一个匹配的子串后返回替换后的字符串。
当repl是一个字符串时,可以使用\id或\g、\g引用分组,但不能使用编号0。
当repl是一个方法时,这个方法应当只接受一个参数(Match对象),并返回一个字符串用于替换(返回的字符串中不能再引用分组)。
count用于指定最多替换次数,不指定时全部替换,代码示例:

s=r'i say,hello world'
pattern=re.compile(r'(\w+) (\w+)')
match=re.sub(pattern,r'\2 \1',s)
print match

运行结果

say i,world hello

re.subn

返回sub替换的次数

count=re.subn(pattern,r'\2 \1',s)
print count

运行结果

('say i,world hello', 2)

如果只需要次数,代码如下:

count=re.subn(pattern,r'\2 \1',s)
print count[1]
版权声明:本文为博主原创文章,未经博主允许不得转载。 https://blog.csdn.net/kelvinmao/article/details/51511331

Python3爬虫简易实例1(Requests正则)

抓取某电影网TOP100 1.分析源码,以便于写正则表达式 这里是网页关键部分的源码: 然后针对它写正则表达式: pattern = re.compile('.*?boar...
  • qq_41144008
  • qq_41144008
  • 2017-12-15 18:06:04
  • 254

python爬虫爬取各大直播平台的女主播图片

目标: 各大网络直播平台的妹纸照片~~~~(斗鱼,熊猫,虎牙,全民,战旗等) python爬虫入门级别!所需模块: re, urllib, os 均为python内置模块或许每...
  • wf134
  • wf134
  • 2017-11-20 18:18:38
  • 2869

python定向爬虫——爬取某代理Ip网站上的所有ip

爬取一个网站的基本过程 确定目标 –> 分析目标 –> 编写程序 -> 执行爬虫 分析目标: url 格式 数据格式 网页编码 分析目标数据在源代码里的结构,以便在后去整...
  • lowerxiaoshen
  • lowerxiaoshen
  • 2017-08-13 15:43:04
  • 810

python网络爬虫学习(三)正则表达式的使用之re.match方法

一.为什么要学习正则表达式很好,我们现在已经能够写出获得网站源代码的程序了,我们有了第一个问题:如何从杂乱的代码中找到我们所需的信息呢?此时,正则表达式的学习就显得很有必要了。有人打趣说,当你想到用正...
  • kelvinmao
  • kelvinmao
  • 2016-05-23 23:37:42
  • 13752

Python网络爬虫(2)处理网页数据find和findall函数

findAll(tag, attributes, recursive, text, limit, keywords) find(tag, attributes, recursive, text, k...
  • GenteelDevil
  • GenteelDevil
  • 2017-01-07 17:28:32
  • 1555

python爬虫之re正则表达式库

python之正则表达式re库正则表达式是用来简洁表达一组字符串的表达式,编译:将符合正则表达式语法的字符串转换成正则表达式特征操作符 说明 实...
  • qq_22186119
  • qq_22186119
  • 2017-06-14 21:20:12
  • 892

Python 正则re模块之compile()和findall()详解

下面是Python3.5官方文档里关于的compile的说明: re.compile(pattern, flags=0) Compile a regular expression pattern in...
  • drdairen
  • drdairen
  • 2016-04-12 16:41:13
  • 44663

python爬虫(1.find和findAll函数提取文本)

from urllib.request import urlopen from bs4 import BeautifulSoup html = urlopen("http://www.pythonsc...
  • dawen1937
  • dawen1937
  • 2016-12-29 16:11:45
  • 622

Python3,通过re模块中的sub()和findall()2个方法提升爬虫提取数据的效率

直接上Demo: 测试数据 - HTML: '''" "各种汽车" "" "各种汽车列表" "" "" "奥迪TT" "" "CC" ...
  • wympqlamz15422
  • wympqlamz15422
  • 2017-12-07 11:43:50
  • 256

git使用之四——windows下github桌面版的安装

git使用之四——windows下github桌面版的安装
  • u010331406
  • u010331406
  • 2015-10-14 18:11:15
  • 1389
收藏助手
不良信息举报
您举报文章:python网络爬虫学习(四)正则表达式的使用之re的其他方法
举报原因:
原因补充:

(最多只允许输入30个字)