python3调用Chrome进行简单文本爬虫

python3解释器外,还需安装谷歌浏览器,下载编译selenium模块,下载chromedriver.exe至python目录中的Scripts文件夹中

import re		#python自带模块
from selenium import webdriver		#selenium模块需自行安装
driver=webdriver.Chrome()		#调用谷歌浏览器驱动
url=“https://www.juzimi.com/writer/%E4%B9%94%E5%B8%83%E6%96%AF”
driver,get(url)
pagesource=driver.page_source	#获取url数据
#定义正则表达式提取可用文本
restr1="class=\"xlistju\">[^\x00-\xff]{8,}"
regex1=re.compile(restr1,re.IGNORECASE)
mylist1=regex1.findall(pahesource)
mystr1="\n".join(mylist1)#列表转化为字符串
restr2="[^\x00-\xff0-9]+"#正则表达式第二次筛选
regex2=re.compile(restr2,re.IGNORECASE)
mylist2=regex2.findall(mystr1)
mystr2="\n".join(mylist2)
#将提取出来的信息写入文件
inFile=open("G:/notepad.txt","w+",encoding="utf-8"
inFile.write(mystr2)
inFile.close()
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值