Python爬虫实战教程：爬取网易新闻

最新推荐文章于 2024-08-03 15:58:00 发布

2401_83974064

最新推荐文章于 2024-08-03 15:58:00 发布

阅读量484

点赞数 24

分类专栏： 2024年程序员学习文章标签： python 爬虫开发语言

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/2401_83974064/article/details/137235146

版权

2024年程序员学习专栏收录该内容

262 篇文章 2 订阅

订阅专栏

下面开始编写我们爬虫：

第一步先导入以上三个包：

import json

import requests

from bs4 import BeautifulSoup

接着我们定义一个获取指定页码内数据的方法：

def get_page(page):

url_temp = ‘http://temp.163.com/special/00804KVA/cm_guonei_0{}.js’

return_list = []

for i in range(page):

url = url_temp.format(i)

response = requests.get(url)

if response.status_code != 200:

continue

content = response.text # 获取响应正文

_content = formatContent(content) # 格式化json字符串

result = json.loads(_content)

return_list.append(result)

return return_list

这样子就得到每个页码对应的内容列表：

在这里插入图片描述

之后通过分析数据可知下图圈出来的则是需要抓取的标题、发布时间以及新闻内容页面。

在这里插入图片描述

既然现在已经获取到了内容页的url，那么接下来开始抓取新闻正文。

在抓取正文之前要先分析一下正文的html页面，找到正文、作者、来源在html文档中的位置。

我们看到文章来源在文档中的位置为：id = "ne_article_source" 的 a 标签。

作者位置为：class = "ep-editor" 的 span 标签。

正文位置为：class = "post_text" 的 div 标签。

下面试采集这三个内容的代码：

def get_content(url):

source = ‘’

author = ‘’

body = ‘’

resp = requests.get(url)

if resp.status_code == 200:

body = resp.text

bs4 = BeautifulSoup(body)

source = bs4.find(‘a’, id=‘ne_article_source’).get_text()

author = bs4.find(‘span’, class_=‘ep-editor’).get_text()

body = bs4.find(‘div’, class_=‘post_text’).get_text()

return source, author, body

到此为止我们所要抓取的所有数据都已经采集了。

自我介绍一下，小编13年上海交大毕业，曾经在小公司待过，也去过华为、OPPO等大厂，18年进入阿里一直到现在。

深知大多数Python工程师，想要提升技能，往往是自己摸索成长或者是报班学习，但对于培训机构动则几千的学费，着实压力不小。自己不成体系的自学效果低效又漫长，而且极易碰到天花板技术停滞不前！

因此收集整理了一份《2024年Python开发全套学习资料》，初衷也很简单，就是希望能够帮助到想自学提升又不知道该从何学起的朋友，同时减轻大家的负担。

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，基本涵盖了95%以上Python开发知识点，真正体系化！

由于文件比较大，这里只是将部分目录大纲截图出来，每个节点里面都包含大厂面经、学习笔记、源码讲义、实战项目、讲解视频，并且后续会持续更新

如果你觉得这些内容对你有帮助，可以添加V获取：vip1024c （备注Python）

大纲截图出来，每个节点里面都包含大厂面经、学习笔记、源码讲义、实战项目、讲解视频，并且后续会持续更新**

如果你觉得这些内容对你有帮助，可以添加V获取：vip1024c （备注Python）
[外链图片转存中…(img-qc1keDU5-1711956623844)]

关注

24
点赞
踩
14

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。