python微信爬取教程_python爬虫_微信公众号推送信息爬取的实例

最新推荐文章于 2024-06-25 21:28:44 发布

张三的忧伤

最新推荐文章于 2024-06-25 21:28:44 发布

阅读量772

点赞数

文章标签： python微信爬取教程

本文链接：https://blog.csdn.net/weixin_29940495/article/details/113981305

版权

问题描述

利用搜狗的微信搜索抓取指定公众号的最新一条推送，并保存相应的网页至本地。

注意点

搜狗微信获取的地址为临时链接，具有时效性。

公众号为动态网页(JavaScript渲染)，使用requests.get()获取的内容是不含推送消息的，这里使用selenium+PhantomJS处理

代码

#! /usr/bin/env python3

from selenium import webdriver

from datetime import datetime

import bs4, requests

import os, time, sys

# 获取公众号链接

def getAccountURL(searchURL):

res = requests.get(searchURL)

res.raise_for_status()

soup = bs4.BeautifulSoup(res.text, "lxml")

# 选择第一个链接

account = soup.select('a[uigs="account_name_0"]')

return account[0]['href']

# 获取首篇文章的链接，如果有验证码返回None

def getArticleURL(accountURL):

browser = webdriver.PhantomJS("/Users/chasechoi/Downloads/phantomjs-2.1.1-macosx/bin/phantomjs")

# 进入公众号

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

关注关注