2024年最全如何爬取CSDN全站综合热榜标题，顺便统计关键词词频｜爬虫案例，2024年最新附大厂真题面经

前端星级导师

于 2024-05-10 15:44:47 发布

阅读量719

点赞数 28

分类专栏：程序员文章标签： python 学习面试

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/m0_60453176/article/details/138669261

版权

程序员专栏收录该内容

204 篇文章 0 订阅

订阅专栏

文末有福利领取哦~

👉一、Python所有方向的学习路线

Python所有方向的技术点做的整理，形成各个领域的知识点汇总，它的用处就在于，你可以按照上面的知识点去找对应的学习资源，保证自己学得较为全面。

👉二、Python必备开发工具

👉三、Python视频合集

观看零基础学习视频，看视频学习是最快捷也是最有效果的方式，跟着视频中老师的思路，从基础到深入，还是很容易入门的。

👉 四、实战案例

光学理论是没用的，要学会跟着一起敲，要动手实操，才能将自己的所学运用到实际当中去，这时候可以搞点实战案例来学习。（文末领读者福利）

👉五、Python练习题

检查学习结果。

👉六、面试资料

我们学习Python必然是为了找到高薪的工作，下面这些面试题是来自阿里、腾讯、字节等一线互联网大厂最新的面试资料，并且有阿里大佬给出了权威的解答，刷完这一套面试资料相信大家都能找到满意的工作。

👉因篇幅有限，仅展示部分资料，这份完整版的Python全套学习资料已经上传

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友，可以戳这里获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

目录

关键词提取代码

主程序代码

前言

==

最近在出差，发现住的宾馆居然有小强。所以出差无聊之际，写了点爬虫的代码玩玩，问就是应景。本篇文章主要是爬取CSDN全站综合热榜的100个标题，然后分词提取关键词，统计一下词频。

我想了下，对于其他博主还是有用的，可以看看什么标题可以上热榜，就分享一下吧。顺便把我解决各类问题的方法，说一说。

环境

==

使用的IDE为：spyder（有看着界面不习惯的，忍一下，不关键）

页面爬取使用chromedriver，至于原因我后面会说。

分词器：jieba

爬取页面地址：https://blog.csdn.net/rank/list

爬虫代码

====

这里说一下为什么没有用requests直接获取页面源码，主要是因为该页面并不能直接请求出源码。而是通过页面滚动到最下方，才可以显示出全部的100个排名的文章。

所以我的思路是，使用chromedriver，然后执行js实现滚动页面到最下方。

这里需要说明一下chromedriver的下载，需要根据你google浏览器的版本来。我的笔记本事mac，可以点击左上角的Chrome，再点击关于Google Chrome看看自己的浏览器版本。

分享一下chromedriver的下载地址：google chrome driver下载地址

简单说明一下driver的原理，就是模拟浏览器打开url的操作，就像我们手点一样，具体原理改天可以再聊聊。

不废话了，上爬虫工具代码

#!/usr/bin/env python3

-- coding: utf-8 --

“”"

Created on Thu Nov 4 17:15:06 2021

@author: huyi

“”"

from selenium import webdriver

import time

=============================================================================

爬取动态下滑加载网页

=============================================================================

def pa(url):

driver = webdriver.Chrome(‘/usr/local/bin/chromedriver’)

driver.get(url)

js = ‘’’

let height = 0

let interval = setInterval(() => {

window.scrollTo({

top: height,

behavior: “smooth”

});

height += 500

}, 500);

setTimeout(() => {

clearInterval(interval)

}, 20000);

‘’’

driver.execute_script(js)

time.sleep(20)

source = driver.page_source

driver.close()

return source

代码说明

1、代码主要是一个工具方法，使用diver打开浏览器。然后通过js代码，模拟向下滚动的操作。

2、根据你的网络条件，里面的超时时间你可以调整。避免还没有滚动到最下面就结束了，因为我宾馆的网比较卡，所以设置的比较大。

3、返回页面源码，为了后面的xpath解析。

验证一下

OK,已经拿到了页面源码了。

关键词提取代码

=======

我们把关键词提取的方法也准备一下。不废话，上代码。

#!/usr/bin/env python3

-- coding: utf-8 --

“”"

Created on Thu Nov 4 21:53:22 2021

@author: huyi

“”"

import jieba.analyse

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友，可以戳这里获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

前端星级导师

关注

28
点赞
踩
12

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

普通网友 CSDN认证博客专家 CSDN认证企业博客

码龄3年

625: 原创

-: 周排名

-: 总排名

41万+: 访问

: 等级

1万+: 积分

6080: 粉丝

8538: 获赞

10: 评论

8690: 收藏

私信

关注

热门文章

分类专栏

最新评论

安信可LoRa Ra-08模组二次开发，思维导图+源代码+笔记+项目
m0_73458827: 怎么举报啊？写的什么玩意儿？
使用Python开发桌面应用程序(1)
qpeat: 亲，链接404了
2024年Python最新Python爬虫开源项目代码分享，100个，2024年最新阿里常见面试题
wu_pengcheng: 楼主，你给的文件链接里面都是空的啊，学习资料还可以分享吗？
2024年最全用 Python 分析了 20 万场吃鸡数据_celery_battle(1)，快手nlp面试题
北风之神c: 总结的很全面，写得赞，博主用心了。 celery对目录层级文件名称格式要求太高，只适合规划新的项目，对不规则文件夹套用难度高。所以新手使用celery很仔细的建立文件夹名字、文件夹层级、python文件名字。所以网上的celery博客教程虽然很多，但是并不能学会使用，因为要运行起来需要以下6个方面都掌握好，博客文字很难表达清楚或者没有写全面以下6个方面。 celery消费任务不执行或者报错NotRegistered，与很多方面有关系，如果要别人排错，至少要发以下6方面的截图，因为与一下6点关系很大。 1)整个项目目录结构, 2）@task入参 ,3）celery的配置，4）celery的配置 include ,5）cmd命令行启动参数 --queues= 的值,6）用户在启动cmd命令行时候，用户所在的文件夹。在不规范的文件夹路径下，使用celery难度很高，一般教程都没教。 [项目文件夹目录格式不规范下的celery使用演示](https://github.com/ydf0509/celery_demo) 。此国产分布式函数调度框架 funboost python万能通用函数加速器 https://funboost.readthedocs.io/ ，从用法调用难度，用户所需代码量，超高并发性能，qps控频精确程度，支持的中间件类型，任务控制方式，稳定程度等19个方面全方位超过celery。发布性能提高1000%，消费性能提高2000%。 python万能分布式函数调度框架funboost支持python所有类型的并发模式和一切知名消息队列中间件，python函数加速器，框架包罗万象,万能编程功能宝典，一统编程思维，与业务不绑定，适用范围广。 funboot能支持celery作为中间件，用户可以使用funboost的极简api来使用celery核心调度，不用手动复杂的配置操作celery funboost 自动化操作celery https://github.com/ydf0509/funboost_support_celery_demo pip install funboost

最新文章

2024

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。