python多线程与global变量



今天早上起来写爬虫,基本框架已经搭好,添加多线程爬取功能时,发现出错:


比如在下载文件的url列表中加入200个url,开启50个线程。我的爬虫…竟然将50个url爬取并全部命名为0.html,也就是说,最后的下载结果,是有1个0.html(重复的覆盖了),还有1-150。下面是我的代码:


x = str(theguardian_globle.g)
    #x为给下载的文件命的名
    filePath = "E://wgetWeiBao//"+x+".html"
    try:
        wget.download(url,filePath)
        theguardian_globle.g+=1
        print x+" is downloading..."

    except:
        print "error!"

#这个是全局变量g的定义
global g

g = 0


后来终于发现问题:多线程+全局变量是个危险的组合,因为程序有多个线程在同时执行,多个线程同时操作全局变量,会引起混乱。在多线程中操作全局变量,应当给该操作加锁。


以下为修改后的代码:


函数:

def downLoad(url,num):
    x = str(num)
    filePath = "E://wgetWeiBao//"+x+".html"
    try:
        wget.download(url,filePath)
        print x+" is downloading..."

    except:
        print "error!"

多线程消费者_给操作全局变量的语句加锁
class Cosumer(threading.Thread):
    def run(self):
        print('%s:started' % threading.current_thread())

        while True:
            global gCondition
            gCondition.acquire()
            while q.empty()==True:
                gCondition.wait()
            url = q.get()
            num = theguardian_globle.g
            theguardian_globle.g+=1
            gCondition.release()
            downLoad(url,num)


大功告成!


评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值