使用selenium爬取腾讯热点新闻

最新推荐文章于 2022-04-14 21:43:00 发布

yq313210

最新推荐文章于 2022-04-14 21:43:00 发布

阅读量747

点赞数 1

文章标签： selenium python chrome

本文链接：https://blog.csdn.net/yq313210/article/details/105783756

版权

本文介绍了如何使用Python的Selenium库模拟页面滚动，动态加载并抓取腾讯热点新闻。通过随机设置滚动距离和时间，模拟人工操作，最终将数据保存为CSV文件。

摘要由CSDN通过智能技术生成

     在爬取之前我一直都陷入了一个误区,我认为只用selenium就可以实现这个工作，事实上它确实是可以，只不过selenium是自动化测试工具,可以驱动浏览器(有界面,无界面)来执行特定的操作,可以模仿人的点击下拉等各种基本操作,对于js加密的信息的抓取非常有效。它更适用于动态和交互。所以在提取信息得时候结合bs4或者xpath更方便一点。经过大佬指点，这里强推xpath.
     ![在这里插入图片描述](https://img-blog.csdnimg.cn/20200427094746986.png)

打开网址会发现页面默认加载10条信息，随着页面向下滚动，页面是自动加载的。
这里借用某大佬的思想：

调用 window.srollBy’执行页面滚动。
利用random对单次滚动距离、滚动时间进行选取，模拟人工操作。

import random
for i in range(20):
    pixel = random.randint(800,1000)
    driver.execute_script(f'window.scrollBy(0,{pixel})')
    time.sleep(random.random

最低0.47元/天解锁文章

yq313210

关注

1
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
使用selenium爬取腾讯热点新闻

在爬取之前我一直都陷入了一个误区,我认为只用selenium就可以实现这个工作，事实上它确实是可以，只不过selenium是自动化测试工具,可以驱动浏览器(有界面,无界面)来执行特定的操作,可以模仿人的点击下拉等各种基本操作,对于js加密的信息的抓取非常有效。它更适用于动态和交互。所以在提取信息得时候结合bs4或者xpath更方便一点。经过大佬指点，这里强推xpath. ![在...
复制链接

扫一扫