python数据爬取---爬取文本数据并进行特征提取

本文介绍了如何使用Python进行数据爬取,以‘百思不得其姐’网站的内涵段子为例,分析了目标网站结构,通过循环爬取1-10页的内容,解析页面中段子数据。
摘要由CSDN通过智能技术生成

 

1、寻找目标网站并分析结构

我们这次来爬‘百思不得其姐’的内涵段子。

目标网址:http://www.budejie.com/text/1

网站结构:每页默认20个段子,要翻页,第2页的网址是http://www.budejie.com/text/2,由此可以推断,该网站是在最后加上数字来区分页面,这样我们可以使用for循环来爬取所有页面的信息。我们可以把目标页面锁定在1-10页。

页面结构:单击鼠标右键选择检查,段子内容保存在一个

2、编写爬虫进行内容爬取

#导入request库用来请求http
import requests
#导入BeautifulSoup用来对html进行解析
from bs4 import BeautifulSoup
#导入正则表达式用来匹配模式
import re
#导入时间库用来设置休眠时间,避免给服务器带来过大负担
import time


##1-爬数据
#1.1创建一个列表来存爬的数据
all_jokes=[]
#1.2 指定用户代理信息us
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值