1、寻找目标网站并分析结构
我们这次来爬‘百思不得其姐’的内涵段子。
目标网址:http://www.budejie.com/text/1
网站结构:每页默认20个段子,要翻页,第2页的网址是http://www.budejie.com/text/2,由此可以推断,该网站是在最后加上数字来区分页面,这样我们可以使用for循环来爬取所有页面的信息。我们可以把目标页面锁定在1-10页。
页面结构:单击鼠标右键选择检查,段子内容保存在一个中
2、编写爬虫进行内容爬取
#导入request库用来请求http
import requests
#导入BeautifulSoup用来对html进行解析
from bs4 import BeautifulSoup
#导入正则表达式用来匹配模式
import re
#导入时间库用来设置休眠时间,避免给服务器带来过大负担
import time
##1-爬数据
#1.1创建一个列表来存爬的数据
all_jokes=[]
#1.2 指定用户代理信息us