python数据爬取---爬取文本数据并进行特征提取

最新推荐文章于 2024-01-20 18:46:54 发布

anne_wang_swufe

最新推荐文章于 2024-01-20 18:46:54 发布

阅读量8.5k

点赞数 3

分类专栏： python数据爬取

本文链接：https://blog.csdn.net/weixin_42156897/article/details/94618538

版权

本文介绍了如何使用Python进行数据爬取，以‘百思不得其姐’网站的内涵段子为例，分析了目标网站结构，通过循环爬取1-10页的内容，解析页面中段子数据。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

1、寻找目标网站并分析结构

我们这次来爬‘百思不得其姐’的内涵段子。

目标网址：http://www.budejie.com/text/1

网站结构：每页默认20个段子，要翻页，第2页的网址是http://www.budejie.com/text/2，由此可以推断，该网站是在最后加上数字来区分页面，这样我们可以使用for循环来爬取所有页面的信息。我们可以把目标页面锁定在1-10页。

页面结构：单击鼠标右键选择检查，段子内容保存在一个中

2、编写爬虫进行内容爬取

#导入request库用来请求http
import requests
#导入BeautifulSoup用来对html进行解析
from bs4 import BeautifulSoup
#导入正则表达式用来匹配模式
import re
#导入时间库用来设置休眠时间，避免给服务器带来过大负担
import time


##1-爬数据
#1.1创建一个列表来存爬的数据
all_jokes=[]
#1.2 指定用户代理信息us