爬虫练习（二）爬取知网上文章的摘要

xinbingo

于 2021-11-24 00:18:17 发布

阅读量1.1k

点赞数

分类专栏： Pythong-爬虫文章标签： python selenium 定位爬虫

本文链接：https://blog.csdn.net/xinbingo/article/details/121506105

版权

本文介绍了一种使用Python结合Selenium库来爬取知网上文章摘要的方法。由于某些特定需求，作者分享了爬虫实现的改进过程，旨在促进技术交流。

摘要由CSDN通过智能技术生成

因为一些特殊的需要，需要爬取一些数据，对之前的进行了更改。供大家交流。

from selenium import webdriver
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.common.by import By
from selenium.webdriver.common.keys import Keys
import xlrd
from urllib.parse import urljoin
import time
import random
import json
import csv
import os
import pandas as pd
from itertools import zip_longest
# 设置谷歌驱动器的环境
options = webdriver.ChromeOptions()
# 设置chrome不加载图片，提高速度
options.add_experimental_option("prefs", {"profile.managed_default_content_settings.images": 2})
# 创建一个谷歌驱动器
browser = webdriver.Chrome()
# tbser=webdriver.Chrome()

def start_spider(aurname):  #爬取知网信息
    # 请求url
    url = 'https://kns.cnki.net/kns/brief/result.aspx?dbprefix=SCDB'
    browser.get(url)
    # 显示等待输入框是否加载完成
    WebDriverWait(browser, 1000).until(
        EC.presence_of_all_elements_located(