Python爬取新闻网站保存标题、内容、日期、图片等数据

本文介绍了如何使用Python爬取并解析静态网页,包括获取网页内容、提取数据、保存为PDF格式和CSV文件,同时展示了多线程处理多个详情页链接的方法。
摘要由CSDN通过智能技术生成

在这里插入图片描述

网站是静态网页,没有什么难度

在这里插入图片描述

详情页


同样是静态页面

在这里插入图片描述

在这里插入图片描述

网页源代码已经说明数据在什么地方了,利用相关的解析工具,对网页数据进行解析即可。

代码实现


  • 请求网页以及解析

def get_html(html_url):

response = requests.get(url=html_url, headers=headers)

return response

def get_pars(html_data):

selector = parsel.Selector(html_data)

return selector

  • 保存内容 PDF格式

html_str = “”"

<!doctype html>

Document

{article}

“”"

def save_article(article, title):

html_path = ‘重庆新闻\’ + title + ‘.html’

pdf_path = ‘重庆新闻pdf\’ + title + ‘.pdf’

html = html_str.format(article=article)

with open(html_path, mode=‘w’, encoding=‘utf-8’) as f:

f.write(html)

print(‘{}已下载完成’.format(title))

exe 文件存放的路径<

  • 18
    点赞
  • 21
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值