爬出某电影网站上电影下载地址的简单爬虫程序

# -*- coding: utf-8 -*-
"""
Created on Mon Jan 29 10:19:26 2018

@author: dell
"""

#导入模块
import requests#网络请求模块
import re#提取数据
#import time#time.sleep


for n in range(1,10):
    #网址
    a_url = 'http://www.dytt8.net/html/gndy/dyzz/list_23_'+str(n)+'.html'
    #print(a_url)
    html_1=requests.get(a_url)
    html_1.encoding = 'gb2312'
    #print(html_1.status_code)#200
    #print(html_1.text)#查看网页源代码
    #re.findall 列表
    detil_list = re.findall('<a href="(.*?)" class="ulink',html_1.text)
    #print(detil_list)
    for m in detil_list:
        b_url = 'http://www.dytt8.net'+m
        #print(b_url)
        #time.sleep(2)#暂停两秒
        html_2=requests.get(b_url)
        #指定网页编码格式
        html_2.encoding = 'gb2312'
        #print(html_2.text)
        #re.findall 返回列表
        ftp = re.findall('<a href="(.*?)">.*?</a></td>',html_2.text)
        #print(ftp)
        
        with open('C:\\Users\\dell\\Desktop\\dytt.txt','a',encoding='utf-8') as ff:
            #写入本地
           ff.write(ftp[0]+'\n')

  • 0
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值