今天早上起来写爬虫,基本框架已经搭好,添加多线程爬取功能时,发现出错:
比如在下载文件的url列表中加入200个url,开启50个线程。我的爬虫…竟然将50个url爬取并全部命名为0.html,也就是说,最后的下载结果,是有1个0.html(重复的覆盖了),还有1-150。下面是我的代码:
1
2
3
4
5
6
7
8
9
10
|
x = str (theguardian_globle.g) #x为给下载的文件命的名 filePath = "E://wgetWeiBao//" + x + ".html" try : wget.download(url,filePath) theguardian_globle.g + = 1 print x + " is downloading..." except : print "error!" |
1
2
3
4
|
后来终于发现问题:多线程+全局变量是个危险的组合,因为程序有多个线程在同时执行,多个线程同时操作全局变量,会引起混乱。在多线程中操作全局变量,应当给该操作加锁。
以下为修改后的代码:
1
2
3
4
5
6
7
8
9
10
11
|
函数: def downLoad(url,num): x = str (num) filePath = "E://wgetWeiBao//" + x + ".html" try : wget.download(url,filePath) print x + " is downloading..." except : print "error!" |
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
|
多线程消费者_给操作全局变量的语句加锁 class Cosumer(threading.Thread): def run( self ): print ( '%s:started' % threading.current_thread()) while True : global gCondition gCondition.acquire() while q.empty() = = True : gCondition.wait() url = q.get() num = theguardian_globle.g theguardian_globle.g + = 1 gCondition.release() downLoad(url,num) |
大功告成!
以上这篇对python多线程与global变量详解就是小编分享给大家的全部内容了,希望能给大家一个参考,也希望大家多多支持服务器之家。
原文链接:https://blog.csdn.net/hsj_csdn/article/details/55505475