将csdn博客转换成makedown形式的文件并保存

最新推荐文章于 2024-06-18 00:46:30 发布

Rainist

最新推荐文章于 2024-06-18 00:46:30 发布

阅读量301

点赞数

文章标签： safari html 前端

本文链接：https://blog.csdn.net/Rainist/article/details/125011011

版权

#作者:Rain
import re
import parsel
import tomd
import requests
def spider_csdn(title_url):
  # 目标文章的链接
  head={"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4147.105 Safari/537.36 Edg/84.0.522.52"
  }
  html=requests.get(url=title_url,headers=head).text
  page=parsel.Selector(html)
  #创建解释器
  title=page.css(".title-article::text").get()
  res = re.compile("[^\u4e00-\u9fa5^a-z^A-Z^0-9]")
  restr = ''
  res.sub(restr, title)
  content=page.css("article").get()
  content=re.sub("<a.*?a>","",content)
  content = re.sub("<br>", "", content)
  texts=tomd.Tomd(content).markdown
  #转换为markdown 文件
  with open(title+".md",mode="w",encoding="utf-8") as f:
    f.write("#"+title)
    f.write(texts)
url=str(input("please input url:"))
spider_csdn(url)

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

Rainist

关注关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
打赏
2
评论
将csdn博客转换成makedown形式的文件并保存

#作者:Rainimport reimport parselimport tomdimport requestsdef spider_csdn(title_url): # 目标文章的链接 head={"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4147.105 Safari/537.36 Edg/84.0.522.52"
复制链接

扫一扫