文件存储
媒体文件存储
只存储资源链接和下载文件
只存储资源链接优点:不需要下载文件,速度更快,节约存储空间,节约目标主机的服务器的负载; 只存储资源链接缺点:存在“盗链风险”。 下载文件的优点:下载后的文件不受原目标服务器变动的影响; 下载文件的缺点:可能从原网页下载到未知的恶意文件。 若目标文件要多次使用,则下载文件,否则人只存储资源链接。
import os
from urllib.request import urlretrieve
from urllib.request import urlopen
from bs4 import BeautifulSoup
downloadDirectory = "downloaded"
baseUrl = "http://pythonscraping.com"
def getAbsoluteURL(baseUrl, source):
if source.startswith("http://www."):
url = "http://"+source[11:]
elif source.startswith("http://"):
url = source
elif source.startswith("www."):
url = source[4:]
url = "http://" + source
else:
url = baseUrl + "/" + source
if baseUrl not in url:
return None
return url
def getDownloadPath(baseUrl, absoluteUrl, downloadDirectory):
path = absoluteUrl.replace("www.", "")
path = path.replace(baseUrl,