python爬虫解决网页重定向问题

最新推荐文章于 2025-07-30 19:00:06 发布

_compiling

最新推荐文章于 2025-07-30 19:00:06 发布

阅读量3.6w

点赞数 3

CC 4.0 BY-SA版权

分类专栏： python python爬虫文章标签： url 重定向

本文链接：https://blog.csdn.net/brink_compiling/article/details/53589518

在使用Python2.7+requests进行爬虫开发时，遇到网页重定向问题，包括服务器端重定向（301、302状态码）、meta refresh重定向和JavaScript重定向。对于服务器端重定向，requests库通常能自动处理；meta refresh需要在代码中解析HTML，寻找<meta>标签以执行重定向；js重定向则需解析并执行JavaScript，较为复杂。正确处理这些重定向能确保爬虫获取到目标网页的准确内容。

笔者使用python2.7+requests编写爬虫，以下问题针对此情况讨论。

笔者编写的搜索引擎爬虫在爬取页面时遇到了网页被重定向的情况，所谓重定向(Redirect)就是通过各种方法（本文提到的为3种）将各种网络请求重新转到其它位置（URL）。每个网站主页是网站资源的入口，当重定向发生在网站主页时，如果不能正确处理就很有可能会错失这整个网站的内容。

笔者编写的爬虫在爬取网页时遇到了三种重定向的情况。

1.服务器端重定向，在服务器端完成，一般来说爬虫可以自适应，是不需要特别处理的，如响应代码301（永久重定向）、302（暂时重定向）等。具体来说，可以通过requests请求得到的response对象中的url、status_code两个属性来判断。当status_code为301、302或其他代表重定向的代码时，表示原请求被重定向；当response对象的url属性与发送请求时的链接不一致时，也说明了原请求被重定向且已经自动处理。

2.meta refresh，即网页中的<meta>标签声明了网页重定向的链接，这种重定向由浏览器完成，需要编写代码进行处理。例如，某一重定向如下面的html代码第三行中的注释所示，浏览器能够自动跳转，但爬虫只能得到跳转前的页面，不能自动跳转。

<html>
<head>
<meta http-equiv="refresh" content="0.1;url=http://www.redirectedtoxxx.com/"><!--本网页会在0.1秒内refresh为url所指的网页-->
</head>
</html>

解决办法是通过得到跳转前的页面源码，从中提取出重定向url信息（上述代码第三行中的url属性值）。一个具体的操作：①使用xpath('//meta[@http-equiv="refresh" and @content]/@content')提取出content的值 ②使用正则表达式提取出重定向的url值。

最低0.47元/天解锁文章