python discuz_Python爬虫自动下载Discuz论坛附件。

最新推荐文章于 2021-01-31 15:01:46 发布

weixin_39940714

最新推荐文章于 2021-01-31 15:01:46 发布

阅读量1.5k

点赞数

文章标签： python discuz

本文介绍了一个使用Python编写的爬虫，用于自动登录Discuz论坛并下载附件。爬虫通过登录、伪造cookie保持session以及解析网页下载样本三个步骤实现。代码示例中展示了如何处理登录过程，获取附件链接并下载。

摘要由CSDN通过智能技术生成

121,278

因工作需要，要定期收集卡饭论坛的病毒样本板块的病毒样本，所以就考虑用 Python做个爬虫，然后自动下载附件。

核心功能有3个：

1· 登录

2· 伪造cookie保持session

3. 下载样本

首先，登录就是先抓取登录页面，找到登录表单会post的数据，当然你也可以用firefox的httpfox插件。

需要注意的是，discuz的登录表单里有个hashform字段，是会随时间变的，所以要登录，必须分两个步骤：

1· 先抓取登录页面，找到hashform值

2· 生成post数据，然后登录登录成功后，服务器端会返回给我们两个cookie字段，我本来是想先解析这些cookie，然后再生成自己的cookie，作为每次post的数据之一。后来发现cookielib可以安装opener，所以你只要用urllib2.urlopen(req)来取代urllib.urlopen(uri)，返回的cookie每次就会被保存，并且自动包在每次发送的请求里。

接下来就是解析网页，获得附件的下载地址了。解析网页无非就是正则。没有什么新的技术含量，就不多说了。

下面上代码，给需要类似功能的朋友做参考。代码写的乱，就不要见怪了。帖子列表，我是从板块的RSS中获得的。

import urllib,urllib2,cookielib,re,datetime

def getPageHtml(uri):

req = urllib2.Request(uri)

return urllib2.urlopen(req).read()

#return urlli

最低0.47元/天解锁文章

weixin_39940714

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。