python 贴吧小爬虫案例

最新推荐文章于 2023-06-25 09:53:03 发布

LSYSYT01

最新推荐文章于 2023-06-25 09:53:03 发布

阅读量331

点赞数 1

分类专栏： python 文章标签： python

本文链接：https://blog.csdn.net/LXFLSY/article/details/87978812

版权

python 专栏收录该内容

4 篇文章 0 订阅

订阅专栏

python 贴吧小爬虫案例

#!/usr/bin/env python
#coding:utf-8

import urllib
import urllib2

def loadPage(url,filename):
“”"
作用：根据url发送请求，获取服务器响应文件
url: 需要爬取的url地址
filename:处理的文件名
“”"
print "正在下载 " + filename
headers = {“User-Agent”: “Mozilla/5.0 (Macintosh; Intel Mac OS X 10_7_0) AppleWebKit/535.11 (KHTML, like Gecko) Chrome/17.0.963.56 Safari/535.11”}
request = urllib2.Request(url, headers=headers)
return urllib2.urlopen(request).read()

def writePage(html,filename):
“”"
作用: 将html内容写入到本地
html: 服务器相应文件内容
“”"
print "正在保存 " + filename
# 文件写入
with open(filename, “w”) as f:
f.write(html)
print “_” * 30

def tiebaSpider(url, beginPage, endPage):
“”"
作用：贴吧爬虫调度器，负责组合处理每个页面的url
url: 贴吧url的前部分
beginPage: 起始页
endPage: 结束页
“”"
for page in range(beginPage, endPage + 1):
pn = (page - 1) * 50
filename = “第” + str(page) + “页.html”
fullurl = url + “&pn=” + str(pn)
#print fullurl
html = loadPage(fullurl,filename)
#print html
writePage(html,filename)
print “谢谢使用”

if name == “main”:
kw = raw_input(“请输入需要爬取的贴吧名：”)
beginPage = int(raw_input(“请输入起始页:”))
endPage = int(raw_input(“请输入结束页:”))
url = "http://tieba.baidu.com/f?"
key = urllib.urlencode({“kw”: kw})
fullurl = url + key
tiebaSpider(fullurl, beginPage, endPage)

#python tieba.py
请输入需要爬取的贴吧名：python
请输入起始页:1
请输入结束页:4
正在下载第1页.html
正在保存第1页.html

谢谢使用
正在下载第2页.html
正在保存第2页.html

谢谢使用
正在下载第3页.html
正在保存第3页.html

LSYSYT01

关注

1
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
python 贴吧小爬虫案例

python 贴吧小爬虫案例#!/usr/bin/env python#coding:utf-8import urllibimport urllib2def loadPage(url,filename):“”&amp;amp;quot;作用：根据url发送请求，获取服务器响应文件url: 需要爬取的url地址filename:处理的文件名“”&amp;amp;quot;print &amp;amp;quot;正在下载 &amp;am
复制链接

扫一扫

专栏目录