[爬虫案例]实现多页批量文件爬取问询函信息

起风了xxx

已于 2022-10-12 14:37:09 修改

阅读量461

点赞数 1

文章标签：爬虫 python

于 2022-10-12 14:24:59 首次发布

本文链接：https://blog.csdn.net/m0_73598509/article/details/127281279

版权

本文介绍了如何使用Python爬虫进行多页PDF文件的批量下载，包括单个页面和多个页面的下载策略。在爬取过程中，文章详细讨论了遇到的三个主要问题：1) WebDriver对象找不到find_element_by_xpath属性，解决方案是导入By模块并使用新的语法；2) 页面元素加载延迟导致的NoSuchElementException，通过设置等待时间解决；3) 文件命名时避免非法字符，使用正则表达式清理或替换title中的特殊字符。最后，文章提到了将汇总的问询函信息导出到Excel表格的方法。

摘要由CSDN通过智能技术生成

引入必要库：

from selenium import webdriver
import requests
import re
import time
import pandas as pd

1.批量下载单个页面上的PDF文件

#获得源代码
CHROME_DRIVER = 'C:\Program Files\Google\Chrome\Application//chromedriver' #chromedriver的目录
chrome_options = webdriver.ChromeOptions()
#chrome_options.add_argument('--headless')#不显示浏览器窗口
driver = webdriver.Chrome(executable_path=CHROME_DRIVER,options = chrome_options)
url = "http://www.sse.com.cn/disclosure/credibility/supervision/inquiries/"
driver.get(url)
time.sleep(3)
data = driver.page_source
print(data)


#源代码进行解析获取内容
p_title = '<tr><td class="codeNameWidth"><span>.*?</span></td><td class="codeNameWidth"><span>.*?</span></td><td class="text-nowrap">.*?</td><td><span class="table_typewrap">.*?</span></td><td><a class="table_titlewrap" href=".*?" target="_blank">(.*?)</a></td></tr>'
p_href = '<tr><td class="codeNameWidth"><span>.*?</span></td><td class="codeNameWidth"><span>.*?</span></td><td class="text-nowrap">.*?</td><td><span class="table_typewrap">.*?</span></td><td><a class="table_titlewrap" href="(.*?)

最低0.47元/天解锁文章

起风了xxx

关注

1
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
[爬虫案例]实现多页批量文件爬取问询函信息

定位网页上某个按钮时，总是报错元素定位不到，具体如下：NoSuchElementException: Message: no such element: Unable to locate element。3.在写入文件时，一定要注意文件名不能有非法字符，不然会报错。在进行替换时，要注意有一些符号本身在正则表达式里就有特殊含义，比如*，这些特殊符号在使用re.sub()进行替换时，注意转义。需要额外导入一个包，其实不是 xpath 的问题，是因为脚本执行到这一行代码时，对应页面上的元素还没加载完成，
复制链接

扫一扫