Python3.4实现从HTTP代理网站批量获取代理并筛选的方法示例

更新时间：2017年09月26日 08:58:38 作者：multiangle

这篇文章主要介绍了Python3.4实现从HTTP代理网站批量获取代理并筛选的方法,涉及Python网络连接、读取、判断等相关操作技巧,需要的朋友可以参考下

本文实例讲述了Python3.4实现从HTTP代理网站批量获取代理并筛选的方法。分享给大家供大家参考，具体如下：

最近在写爬虫，苦于不采用代理的情况下，默认的IP不出几分钟就被封了，故而只能寻找代理。原以为找到HTTP代理就万事大吉了，没想到从那个网站获取的代理大部分都是不能用的，只有少部分能用。。。故而无奈之下，只能从那些代理网站大量获取代理IP，然后再拿过来进行进一步的筛选，将有效的代理IP提取出来，留待进一步使用。

筛选的主要原理是，通过main函数提取到未经筛选的代理rawProxyList，然后通过这些代理尝试连接目标网站（此文中是连接手机新浪网）。如果在规定时间内连接成功，则认定为有效代理，放到checkedProxyList之中。

__author__ = 'multiangle'
__edition__='python3.4'
import threading
import urllib.request as request
import time
rawProxyList=[]
checkedProxyList=[]
class proxycheck(threading.Thread):
 def __init__(self,proxy_list):
  threading.Thread.__init__(self)
  self.proxy_list=proxy_list
  self.timeout=3
  self.testurl='http://www.sina.cn/'
  self.testStr='手机新浪网'
 def checkproxy(self):
  cookies=request.HTTPCookieProcessor()
  for proxy in self.proxy_list:
   handler=request.ProxyHandler({'http':'http://%s'%(proxy)})
   opener=request.build_opener(cookies,handler)
   t1=time.time()
   try:
    req=opener.open(self.testurl,timeout=self.timeout)
    res=req.read()
    res=str(res,encoding='utf8')
    usetime=time.time()-t1
    if self.testStr in res:
     checkedProxyList.append((proxy,usetime))
   except Exception as e :
    print(e)
 def run(self):
  self.checkproxy()
if __name__=='__main__':
 num=20
 thread_num=10
 checkThrends=[]
 url='YOUR PROXY URL' #提取代理的网站。
 req=request.urlopen(url).read()
 req=str(req,encoding='utf-8')
 list=req.split('\r\n') #网站返回的是字符串格式，用'\r\n'进行分割
 rawProxyList=list
 print('get raw proxy')
 for i in rawProxyList:
  print(i)
 # s=proxycheck_test(rawProxyList)
 batch_size=int((len(rawProxyList)+thread_num-1)/thread_num)
 print(batch_size)
 for i in range(thread_num):
  t=proxycheck(rawProxyList[batch_size*i:batch_size*(i+1)])
  checkThrends.append(t)
 for i in range(checkThrends.__len__()):
  checkThrends[i].start()
 for i in range(checkThrends.__len__()):
  checkThrends[i].join()
 print(checkedProxyList.__len__(),' useful proxy is find')
 for i in checkedProxyList:
  print(i)

更多关于Python相关内容可查看本站专题：《Python Socket编程技巧总结》、《Python数据结构与算法教程》、《Python函数使用技巧总结》、《Python字符串操作技巧汇总》、《Python入门与进阶经典教程》及《Python文件与目录操作技巧汇总》

希望本文所述对大家Python程序设计有所帮助。

您可能感兴趣的文章:

Python实现EXCEL表格的排序功能示例
这篇文章主要介绍了Python实现EXCEL表格的排序功能示例，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2019-06-06
Python中使用logging和traceback模块记录日志和跟踪异常
今天小编就为大家分享一篇关于Python中使用logging和traceback模块记录日志和跟踪异常，小编觉得内容挺不错的，现在分享给大家，具有很好的参考价值，需要的朋友一起跟随小编来看看吧
2019-04-04
Python 监测文件是否更新的方法
今天小编就为大家分享一篇Python 监测文件是否更新的方法，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2019-06-06
用Python实现筛选文件脚本的方法
今天小编就为大家分享一篇用Python实现筛选文件脚本的方法，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2018-10-10
PyTorch搭建一维线性回归模型（二）
这篇文章主要为大家详细介绍了PyTorch搭建一维线性回归模型，文中示例代码介绍的非常详细，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2019-05-05
TensorFLow 数学运算的示例代码
这篇文章主要介绍了TensorFLow 数学运算的示例代码,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2020-04-04
python爬虫之异常捕获及标签过滤详解
今天带大家了解python异常捕获及标签过滤,文中有非常详细的代码示例,对正在学习python爬虫的小伙伴们很有帮助,需要的朋友可以参考下
2021-05-05
安装pyinstaller遇到的各种问题(小结)
这篇文章主要介绍了安装pyinstaller遇到的各种问题(小结)，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2020-11-11
python使用 HTMLTestRunner.py生成测试报告
这篇文章主要介绍了python使用 HTMLTestRunner.py生成测试报告，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2017-10-10
Python数据类型最全知识总结
学习一门语言,往往都是从Hello World开始. 但是笔者认为,在一个黑框框中输出一个“你好，世界”并没有什么了不起,要看透事物的本质,熟悉一门语言,就要了解其底层,就是我们常常说的基础,本篇从python中的数据类型开始,需要的朋友可以参考下
2021-05-05