pythonrequests作者_requests库的作者又发布了一个新库requests-htmlpython爬虫 requests

最新推荐文章于 2024-02-03 11:18:50 发布

Sevens Chan

最新推荐文章于 2024-02-03 11:18:50 发布

阅读量229

点赞数

文章标签： pythonrequests作者

本文链接：https://blog.csdn.net/weixin_30915487/article/details/112953074

版权

昨天写了requests库好！最近requests库的作者又发布了一个新库，叫做requests-html，看名字也能猜出来，这是一个解析HTML的库，而且用起来和requests一样爽，下面就来介绍一下它。

一、安装

pip install requests-html

二、基本使用

获取网页

from requests_html import HTMLSession

session = HTMLSession()

r = session.get('')

// 查看页面内容

print(r.html.html)

获取链接

links和absolute_links两个属性分别返回HTML对象所包含的所有链接和绝对链接(均不包含锚点)。

#获取链接print(r.html.links)print(r.html.absolute_links)

结果如下

{'/article/104353012', '/article/120616112', '/users/32331196/'}

{'https://www.qiushibaike.com/imgrank/', 'https://www.qiushibaike.com/article/120669516', 'https://www.qiushibaike.com/article/120682041'}

获取元素

request-html支持CSS选择器和XPATH两种语法来选取HTML元素。首先先来看看CSS选择器语法，它需要使用HTML的find函数，该函数有5个参数，作用如下：selector，要用的CSS选择器；

clean，布尔值，如果为真会忽略HTML中style和script标签造成的影响(原文是sanitize，大概这么理解);

containing，如果设置该属性，会返回包含该属性文本的标签；

first，布尔值，如果为真会返回第一个元素，否则会返回满足条件的元素列表；

_encoding，编码格式。

例子：

#首页菜单文本print(r.html.find('div#menu', first=True).text)#首页菜单元素print(r.html.find('div#menu a'))#段子内容print(list(map(lambda x: x.text, r.html.find('div.content span'))))

结果如下，

热门 24小时热图文字穿越糗图新鲜

[, , , , , , ]

['有一次，几位大城市的朋友来家里玩，我招待他们吃风干羊肉做臊子的饸饹面，这是我们老家最具特色的美食！饭快熟的时候，老婆让我在园子里摘点“芫荽 ”，朋友问我，“芫荽”是什么东东？我给他们翻译解释说：我们本地土话叫“芫荽”，你们城里人讲普通话叫香菜，他们还大笑了一场。\n前天下雨没事儿干，翻看新华字典，突然发现“芫荽”才是香菜的学名，Tm香菜才是土话！而且我们地方方言就这两个字发音还特别标准！', '昨天晚上跟老婆吵架，他抓起我的手机就摔了。我立马摔了他的，结果我的还能用，他的坏了。高潮是人家立刻出门买了个新的！我艹，是不是中计了？？', '小姨要去高铁站，我看着大大小小的箱子说：坐公交车要转车，转来转去要一个多小时，太不方便了，不如我开车送你吧。\n小姨迟疑了一下，同意了。\n我准时把小姨送到了高铁站，正好赶上检票。\n小姨高兴地说：自己开车就是方便，不过幸好你妈聪明，让我们提前两个多小时就出发了！'

XPAT语法，需要另一个函数xpath的支持，它有4个参数：selector，要用的XPATH选择器；

clean，布尔值，如果为真会忽略HTML中style和script标签造成的影响(原文是sanitize，大概这么理解);

first，布尔值，如果为真会返回第一个元素，否则会返回满足条件的元素列表；

_encoding，编码格式。

还是上面的例子，不过这次使用XPATH语法：

print(r.html.xpath("//div[@id='menu']", first=True).text)print(r.html.xpath("//div[@id='menu']/a"))print(r.html.xpath("//div[@class='content']/span/text()"))

输出和上面那个几乎一样，之所以说是“几乎”，因为第三个输出会多出几个换行符，不知道什么原因。需要注意的一点是如果XPATH中包含text()或@href这样的子属性，那么结果相应的会变成简单的字符串类型，而不是HTML元素。

['\n\n\n我一份文件忘家里了，又懒得回家取，就给小姨子发短信息: 帮我把文件送来，晚上我谢谢你。等半天也没送来文件，我只好打个车回家自己拿，到家一进屋，我就发现气氛不对劲，老婆铁青着脸，两手掐着腰，小姨子站旁边对我怒目而视。']

元素内容

糗事百科首页LOGO的HTML代码如下所示：

糗事百科

我们来选取这个元素：

e = r.html.find("div#hd_logo", first=True)

要获取元素的文本内容，用text属性：

print(e.text)#糗事百科

要获取元素的attribute，用attr属性：

print(e.attrs)#{'class': ('logo',), 'id': 'hd_logo'}

要获取元素的HTML代码，用html属性：

print(e.html)#

糗事百科

要搜索元素的文本内容，用search函数，比如说我们现在想知道是糗事什么科：

print(e.search("糗事{}科")[0])#百

最后还有前面提到的两个链接属性：

print(e.absolute_links)print(e.links)#{'https://www.qiushibaike.com/'}#{'/'}

三、进阶用法

JavaScript支持

有些网站是使用JavaScript渲染的，这样的网站爬取到的结果只有一堆JS代码，这样的网站requests-html也可以处理，关键一步就是在HTML结果上调用一下render函数，它会在用户目录(默认是~/.pyppeteer/)中下载一个chromium，然后用它来执行JS代码。下载过程只在第一次执行，以后就可以直接使用chromium来执行了。

render函数还有一些参数，顺便介绍一下(这些参数有的还有默认值，直接看源代码方法参数列表即可)：retries: 加载页面失败的次数

script: 页面上需要执行的JS脚本(可选)

wait: 加载页面钱的等待时间(秒)，防止超时(可选)

scrolldown: 页面向下滚动的次数

sleep: 在页面初次渲染之后的等待时间

reload: 如果为假，那么页面不会从浏览器中加载，而是从内存中加载

keep_page: 如果为真，允许你用r.html.page访问页面

比如说简书的用户页面上用户的文章列表就是一个异步加载的例子，初始只显示最近几篇文章，如果想爬取所有文章，就需要使用scrolldown配合sleep参数模拟下滑页面，促使JS代码加载所有文章。

智能分页

有些网站会分页显示内容，例如reddit。

>>> r = session.get('https://reddit.com')

>>> for html in r.html:

... print(html)

…

请求下一个网页就很容易了

>>> r = session.get('https://reddit.com')

>>> r.html.next()'https://www.reddit.com/?count=25&after=t3_81pm82'

直接使用HTML

前面介绍的都是通过网络请求HTML内容

>>> from requests_html import HTML

>>> doc = """"""

>>> html = HTML(html=doc)

>>> html.links

{''}

直接渲染JS代码也可以：

#和上面一段代码接起来>>> script = """() => {

return {

width: document.documentElement.clientWidth,

height: document.documentElement.clientHeight,

deviceScaleFactor: window.devicePixelRatio,

}

}""">>> val = html.render(script=script, reload=False)

>>> print(val)

{'width': 800, 'height': 600, 'deviceScaleFactor': 1}

>>> print(html.html)

自定义请求

前面都是简单的用GET方法获取请求，如果需要登录等比较复杂的过程，就不能用get方法了。HTMLSession类包含了丰富的方法，可以帮助我们完成需求。下面介绍一下这些方法。

自定义用户代理

有些网站会使用UA来识别客户端类型，有时候需要伪造UA来实现某些操作。如果查看文档的话会发现HTMLSession上的很多请求方法都有一个额外的参数**kwargs，这个参数用来向底层的请求传递额外参数。我们先向网站发送一个请求，看看返回的网站信息。

from pprint import pprint

r = session.get('http://httpbin.org/get')

pprint(json.loads(r.html.html))

返回结果如下：

{'args': {}, 'headers': {'Accept': '*/*', 'Accept-Encoding': 'gzip, deflate', 'Connection': 'close', 'Host': 'httpbin.org', 'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_6)'

'AppleWebKit/603.3.8 (KHTML, like Gecko)'

'Version/10.1.2 Safari/603.3.8'}, 'origin': '110.18.237.233', 'url': 'http://httpbin.org/get'}

可以看到UA是requests-html自带的UA，下面换一个UA：

ua = 'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:62.0) Gecko/20100101 Firefox/62.0'r = session.get('http://httpbin.org/get', headers={'user-agent': ua})

pprint(json.loads(r.html.html))

可以看到UA确实发生了变化：

{'args': {}, 'headers': {'Accept': '*/*', 'Accept-Encoding': 'gzip, deflate', 'Connection': 'close', 'Host': 'httpbin.org', 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:62.0)'

'Gecko/20100101 Firefox/62.0'}, 'origin': '110.18.237.233', 'url': 'http://httpbin.org/get'}

当然这里仅仅是换了一个UA，如果你有需要可以在header中修改其他参数。

模拟表单登录

HTMLSession带了一整套的HTTP方法，包括get、post、delete等，对应HTTP中各个方法。比如下面我们就来模拟一下表单登录：

#表单登录r = session.post('http://httpbin.org/post', data={'username': 'yitian', 'passwd': 123456})

pprint(json.loads(r.html.html))

结果如下，可以看到forms中确实收到了提交的表单值：

{'args': {}, 'data': '', 'files': {}, 'form': {'passwd': '123456', 'username': 'yitian'}, 'headers': {'Accept': '*/*', 'Accept-Encoding': 'gzip, deflate', 'Connection': 'close', 'Content-Length': '29', 'Content-Type': 'application/x-www-form-urlencoded', 'Host': 'httpbin.org', 'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_6)'

'AppleWebKit/603.3.8 (KHTML, like Gecko)'

'Version/10.1.2 Safari/603.3.8'}, 'json': None, 'origin': '110.18.237.233', 'url': 'http://httpbin.org/post'}

如果有上传文件的需要，做法也是类似的。如果了解过requests库的同学可能对这里的做法比较熟悉，没有错，这其实就是requests的用法。requests-html通过暴露**kwargs的方法，让我们可以对请求进行定制，将额外参数直接传递给底层的requests方法。所以如果有什么疑问的话，直接去看requests文档就好了。

Sevens Chan

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
pythonrequests作者_requests库的作者又发布了一个新库requests-htmlpython爬虫 requests

昨天写了requests库好！最近requests库的作者又发布了一个新库，叫做requests-html，看名字也能猜出来，这是一个解析HTML的库，而且用起来和requests一样爽，下面就来介绍一下它。一、安装pip install requests-html二、基本使用获取网页from requests_html import HTMLSessionsession = HTMLSessio...
复制链接

扫一扫