python爬取凤凰新闻_Python爬虫实践(9)--爬取凤凰网汽车资讯

本期为python爬虫实践的第九节,传送门:

本期教程,我们练习抓取凤凰网汽车频道资讯信息,算是对之前几期教程学习的增强训练,编程这种事情,就是要多练习,多做项目,在实践中去领悟。废话不多说,我们开始本期的教程。

82ba4ca8-ba14-473c-b07a-461e948bbfef

python教程

首先我们使用谷歌浏览器打开开发者模式,按下F5刷新页面,通过network下对数据的分析,我们可知,凤凰网汽车频道的资讯内容是直接和整体网页一起加载的,被包含在class样式为infor_left的div中。

e0b22e2d7f59472cab1618c34a49ce4f

凤凰网汽车频道截图

通过上面的分析,我们编写以下代码,先将整个资讯列表信息全部抓取下来。

import requests

from bs4 import BeautifulSoup

headers = 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/73.0.3683.75 Safari/537.36'

res = requests.get('https://auto.ifeng.com/quanbu/', headers)

res.encoding = 'utf-8'

soup = BeautifulSoup(res.text, 'html.parser')

接着继续通过开发者工具观察页面源代码,可知标题被包含在class样式为imgtit的div中,文章发布的时间包含在class样式为imgt_tag的div中,文章的概述包含在class样式为imgt_con的div中。

6a2a499e3d7b45a7b31b85959f279c56

文章信息提取

import requests

from bs4 import BeautifulSoup

headers = 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/73.0.3683.75 Safari/537.36'

res = requests.get('https://auto.ifeng.com/quanbu/', headers)

res.encoding = 'utf-8'

soup = BeautifulSoup(res.text, 'html.parser')

news_list = soup.findAll('div', {'class': 'imgtit'})

for news in news_list:

soup_news = BeautifulSoup(str(news), 'html.parser')

news_link = soup_news.a['href']

news_title = soup_news.a.string

print('标题:' + news_title + ' 链接:' + news_link)

这段代码,仅仅是抓取了第一页的信息,并没有加上循环去抓取其他页面,感兴趣的朋友,可以自己补全。

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值