python：网络爬虫之异常捕获及标签过滤

最新推荐文章于 2023-06-29 02:51:57 发布

番茄牛腩不吃番茄

最新推荐文章于 2023-06-29 02:51:57 发布

阅读量579

点赞数

分类专栏： python网络爬虫文章标签： python python爬虫

本文链接：https://blog.csdn.net/LIFENG0402/article/details/116754853

版权

本文介绍了在网络爬虫中如何增加异常捕获以定位问题，以及解析HTML时如何过滤标签来实现数据有效展示。通过get_text()获取文本信息，使用find()和find_all()方法进行标签查找，详细解释了这些方法的参数和用法。同时强调了在使用find_all()时需要注意的limit参数。文章鼓励读者在遇到疑问时积极留言交流。

摘要由CSDN通过智能技术生成

增加异常捕获，更容易现问题的解决方向

import ssl
import urllib.request
from bs4 import BeautifulSoup
from urllib.error import HTTPError, URLError


def get_data(url):
    headers = {"user-agent":
                   "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/90.0.4430.93 Safari/537.36"
               }
    ssl._create_default_https_context = ssl._create_unverified_context

    """
    urlopen处增加两个异常捕获：
            1、如果页面出现错误或者服务器不存在时，会抛HTTP错误代码
            2、如果url写错了或者是链接打不开时，会抛URLError错误
    """
    try:
        url_obj = urllib.request.Request(url, headers=headers)
        response = urllib.request.urlopen(url_obj)
        html = response.read().decode('utf8')
    except (HTTPError, URLError)as e:
        raise e

    """
    BeautifulSoup处增加异常捕获是因为BeautifulSoup对象中有时候标签实际不存在时，会返回None值；
    因为不知道ÿ

最低0.47元/天解锁文章

番茄牛腩不吃番茄

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
3
评论
python：网络爬虫之异常捕获及标签过滤

增加异常捕获，更容易现问题的解决方向import sslimport urllib.requestfrom bs4 import BeautifulSoupfrom urllib.error import HTTPError, URLErrordef get_data(url): headers = {"user-agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleW...
复制链接

扫一扫

专栏目录