爬虫小记（一）

最新推荐文章于 2024-08-10 18:26:28 发布

KF_19924636653

最新推荐文章于 2024-08-10 18:26:28 发布

阅读量58

点赞数

分类专栏：前端 html 文章标签： less vue.js webpack

本文链接：https://blog.csdn.net/m0_54854317/article/details/123220786

版权

这篇博客介绍了Python爬虫的基础知识，重点在于如何获取网站源码。作者详细阐述了从导入相关库、编辑模拟信息到实际爬取并保存文件的步骤。

摘要由CSDN通过智能技术生成

序言

网站源码获取
- 步骤
- 代码

在掌握了python基本语法之后，便想继续学习一些python分支的一些东西练练手，便想到了python的爬虫，本文几乎只介绍了最基础的网站源码获取步骤。

网站源码获取

步骤

1.导入相关库

import requests
import re
import time
import json

2.编辑模拟信息

    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/92.0.4515.131 Safari/537.36'
    }

3.进行爬取，并写入文件

代码

import requests
import re
import time
import json
def get_one_page(url):
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/92.0.4515.131 Safari/537.36'

最低0.47元/天解锁文章

KF_19924636653

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
爬虫小记（一）

序言网站源码获取步骤代码在掌握了python基本语法之后，便想继续学习一些python分支的一些东西练练手，便想到了python的爬虫，本文几乎只介绍了最基础的网站源码获取步骤。网站源码获取步骤1.导入相关库import requestsimport reimport timeimport json2.编辑模拟信息 headers = { 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x6
复制链接

扫一扫

专栏目录