网页资源下载器

最新推荐文章于 2024-04-22 09:42:53 发布

One2zeror

最新推荐文章于 2024-04-22 09:42:53 发布

阅读量1.1k

点赞数 1

分类专栏： Python 文章标签：网页资源下载器 python

本文链接：https://blog.csdn.net/kzq_qmi/article/details/47105761

版权

Python 专栏收录该内容

3 篇文章 0 订阅

订阅专栏

一个简单的python程序，用于下载pdf/txt/ppt等网页资源下载。

import urllib 
import urllib2 
import re 
import socket

#######################You may change here###############
baseurl = '##########'  #请自行添加下载网页地址
format = '(pdf|txt|cc|ppt|pptx)' #下载格式，可自行添加
#########################################################

def downfunc(blocknum, blocksize, totalsize):
    '''回调函数
    @blocknum:  已经下载的数据块
    @blocksize: 数据块的大小
    @totalsize: 下载文件的大小
    '''
    percent = 100.0 * blocknum * blocksize / totalsize
    if percent > 100:
        percent = 100
        print "下载完成^^~"
    else:
        print "已下载%.2f%%......"% percent

def download(downurl, localFileName=None):
    #m = re.search('(\w+.pdf)',downurl)
    m = re.search('(\w+.%s)' % format,downurl)  
    if localFileName == None:
        localFileName = m.group(0)

    print ("正在下载" + localFileName)

    try:
        urllib.urlretrieve(downurl, localFileName,downfunc)  
    except socket.timeout:
        print "下载超时"

socket.setdefaulttimeout(30)

#打开页面
page = urllib2.urlopen(baseurl) 

# 读取包含HTML源码内容的页面信息 
page_inform = page.read() 

# 获取资源列表
#list_of_res = re.findall(r'href=.*"(.*\.pdf)', page_inform)
list_of_res = re.findall(r'href=.*"(.*\.%s)' % format, page_inform)

# 去除重复的资源
list_of_res = list(set(list_of_res)) 

# 根据资源列表逐个下载
for res in list_of_res:
    downurl = res[0]
    if downurl[0:4] != 'http':
        downurl = baseurl+downurl
    download(downurl)

程序下载：
网页资源下载器

One2zeror

关注

1
点赞
踩
2

收藏

觉得还不错? 一键收藏
打赏
0
评论
网页资源下载器

一个简单的python程序，用于下载pdf/txt/ppt等网页资源下载。import urllib import urllib2 import re import socket#######################You may change here###############baseurl = '##########' #请自行添加下载网页地址format = '(pdf
复制链接

扫一扫