实现爬取csdn个人博客并导出数据

最新推荐文章于 2024-07-25 14:50:00 发布

=-=会飞起来的哈士奇

最新推荐文章于 2024-07-25 14:50:00 发布

阅读量3.4k

点赞数 2

分类专栏：爬虫文章标签： python

本文链接：https://blog.csdn.net/weixin_42873348/article/details/108785952

版权

本文介绍使用Python的lxml和urllib.request库爬取CSDN个人博客内容的过程。在实现中，作者遇到XPath获取的URL需要进一步解析二级页面的问题，通过逐层解析解决了这个问题。文章最后对Caso_卡索博主表达了感谢。

摘要由CSDN通过智能技术生成

因为最近也在学习python，爬虫和一点pandas的内容
刚好看到一篇博客，博客地址：https://blog.csdn.net/xiaoma_2018/article/details/108231658也是实现一样的内容的，只是使用的方式被我改了一下，我也是借鉴学习大佬的方法
我所使用到的库有lxml, urllib.request

代码如下

'''
导入所需要的库
'''
import urllib.request as ur
import lxml.etree as le
import pandas as pd
from config import EachSource,OUTPUT

url = 'https://blog.csdn.net/shine_a/article/list/2'

#得到博客所有内容
def get_blog(url):
    req = ur.Request(
        url=url,
        headers={
   
            'cookie':'c_session_id%3D10_1600923150109.901257%3Bc_sid%3D40c3e11ae0d6021f6f8323db1cc321a1%3Bc_segment%3D9%3Bc_first_ref%3Dwww.google.com.hk%3Bc_first_page%3Dhttps%253A%2F%2Fwww.csdn.net%2F%3Bc_ref%3Dhttps%253A%2F%2Fblog.csdn.net%2F%3Bc_page_id%3Ddefault%3B',
            'User_Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_6) AppleWebKit/537.36 (KHTML, like Gec