python爬虫实现获取下一页代码

最新推荐文章于 2022-11-24 16:04:44 发布

pyjishu

最新推荐文章于 2022-11-24 16:04:44 发布

阅读量5.1k

点赞数

文章标签： python

本文链接：https://blog.csdn.net/pyjishu/article/details/105414572

版权

本文详细介绍了Python爬虫如何实现获取下一页的功能，通过实例代码展示了自动下一页循环加载的过程，适合初学者参考学习。同时，作者作为一名Python开发工程师，分享了相关学习资源和交流平台。

摘要由CSDN通过智能技术生成

在本篇文章里小编给大家整理了关于python爬虫实现获取下一页代码内容，需要的朋友们可以参考学习下。

我们首先来看下实例代码：

from time import sleep
 
import faker
import requests
from lxml import etree
 
fake = faker.Faker()
 
base_url = "http://angelimg.spbeen.com"
 
def get_next_link(url):
  content = downloadHtml(url)
  html = etree.HTML(content)
  next_url = html.xpath("//a[@class='ch next']/@href")
  if next_url:
    return base_url + next_url[0]
  else:
    return False
 
def downloadHtml(ur):
  user_agent = fake.user_agent()
  headers = {'User-Agent': user_agent,"Referer":"http://angelimg.spbeen.com/"}
  response = requests.get(url, headers=headers)
  return response.text
 
def getImgUrl(content):
  html = etree.HTML(content)
  img_url = html.xpath('//*[@id="content"]/a/img/@src')
  title = html.xpath(".//div['@class=article']/h2/text()"