Task04 selenium实战之爬取腾讯新闻热点精选

话不多说,切入正题。

基于对https://news.qq.com/ 热点精选的分析,获取热点精选的文本和url信息还是比较简单的,selenium模拟浏览器,ajax加载,利用bs4进行页面解析便可实现,代码如下:

import time
import csv
from  selenium import webdriver
driver=webdriver.Chrome(executable_path="../chrome/chromedriver.exe")
driver.get("https://news.qq.com")
#了解ajax加载
for i in range(1,50):
    time.sleep(1)
    driver.execute_script("window.scrollTo(window.scrollX, %d);"%(i*200))

from bs4 import BeautifulSoup
html=driver.page_source
bsObj=BeautifulSoup(html,"lxml")

jxtits=bsObj.find_all("div",{"class":"jx-tit"})[0].find_next_sibling().find_all("li")

#print("index",",","title",",","url")

f = open('information.csv','w',encoding='GB2312',newline='')   #创建文件对
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值