python爬虫控制aiohttp并发数量方式

 更新时间:2024年06月27日 10:48:16   作者:NULL_1969  
这篇文章主要介绍了python爬虫控制aiohttp并发数量方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教

前言

在使用aiohttp并发访问多个页面时效率,明显比串行requests快很多,

但是也存在一个问题,就是网站检测到短时间内请求的数量过多会导致页面请求不成成功,

页面返回429 (too many requests)。

解决上述问题

目前想到两个方法

1、控制请求的时间,用sleep延时,来消耗每一次访问的时间,减少单位时间内的访问量,这样肯定是可以,但效率太低

2、控制并发数量,控制并发数量,普遍推荐用信号量来控制使用方法也比较简单如下:

from asyncio import tasks
from aiohttp.client import ClientSession
from lxml import etree
from time import sleep
import time
import asyncio
import aiohttp

async def read_page_list(page_num,sem):
    params = {
        'page':page_num,
    }
    #通过连接池控制并发数量 limit 默认为100  0 为无限制
    async with sem:
        try:
            async with aiohttp.ClientSession() as session:
                async with session.get(url=url,params=params,headers=headers) as response:
                    text = await response.text()
        except Exception as e:
            print('exception:',e)
        
        tree = etree.HTML(text)
        page_list = tree.xpath('//*[@id="thumbs"]/section[1]/ul/li')
        # break
        for li in page_list:
            pic_small_url = li.xpath('.//img/@data-src')[0]
            # print(pic_small_url,type(pic_small_url))
            # pic_small_url = str(pic_small_url)
            if 'small' in pic_small_url:
                temp_url = pic_small_url.replace('small','full')
                a = temp_url.rfind('/')
                temp_url1= temp_url[:a]
                pic_full_url = temp_url1+'/wallhaven-'+temp_url.split('/')[-1]
                pic_full_url = pic_full_url.replace('th','w')
                # print(page_num,pic_full_url)
                pic_list.append(pic_full_url)
            else:
                print(page_num,'find small error',pic_small_url)
            
        print(page_num,len(page_list),response.status)
        # await asyncio.sleep(1)
        #这里可以用硬延时来控制程序的访问速度,进而控制单位时间内并发的数量
        # sleep(0.5)

#定义信号量
sem = asyncio.Semaphore(2)

start = time.time()
#建立任务列表
tasks = [loop.create_task(read_page_list(i,sem)) for i in range(1,20)]
loop.run_until_complete(asyncio.wait(tasks))
print('get page list use time:',time.time()-start)


实验结果

如下:

  • 经试验只有当请求页面20个 sem=1时才不会出现服务器返回429.
  • 当把请求页面数量改为10 sem=5是就不会出现服务返回429的情况

总结

以上为个人经验,希望能给大家一个参考,也希望大家多多支持脚本之家。

相关文章

  • Python 3.14 新特性实战之模式匹配与性能优化

    Python 3.14 新特性实战之模式匹配与性能优化

    这篇文章给大家介绍了Python 3.14 新特性实战之模式匹配与性能优化,本文结合实例代码给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友参考下吧
    2026-05-05
  • Python异步爬取知乎热榜实例分享

    Python异步爬取知乎热榜实例分享

    这篇文章主要介绍了Python异步爬取知乎热榜实例分享,文章围绕Python异步爬取是我相关资料展开对知乎热榜爬取的相关内容,需要的小伙伴卡哇伊参考一下
    2022-04-04
  • Python最长回文子串问题

    Python最长回文子串问题

    这篇文章主要介绍了Python最长回文子串问题,具有很好的参考价值,希望对大家有所帮助。如有错误或未考虑完全的地方,望不吝赐教
    2022-11-11
  • Python 键盘事件详解

    Python 键盘事件详解

    这篇文章主要为大家详细介绍了Python的 键盘事件,文中示例代码介绍的非常详细,具有一定的参考价值,感兴趣的小伙伴们可以参考一下
    2021-11-11
  • Python使用pymysql小技巧

    Python使用pymysql小技巧

    pymsql是Python中操作MySQL的模块,其使用方法和MySQLdb几乎相同。但目前pymysql支持python3.x而后者不支持3.x版本。
    2017-06-06
  • Python爬虫爬取疫情数据并可视化展示

    Python爬虫爬取疫情数据并可视化展示

    这篇文章主要介绍了Python利用爬虫爬取疫情数据并进行可视化的展示,文中的示例代码讲解清晰,对工作或学习有一定的价值,需要的朋友可以参考一下
    2021-12-12
  • Python functools冻结参数小技巧实现代码简洁优化

    Python functools冻结参数小技巧实现代码简洁优化

    这篇文章主要为大家介绍了Python functools冻结参数小技巧实现代码简洁优化示例详解,有需要的朋友可以借鉴参考下,希望能够有所帮助,祝大家多多进步,早日升职加薪
    2023-12-12
  • tkinter如何实现打开文件对话框并获取文件绝对路径

    tkinter如何实现打开文件对话框并获取文件绝对路径

    这篇文章主要介绍了tkinter实现打开文件对话框并获取文件绝对路径问题,具有很好的参考价值,希望对大家有所帮助。如有错误或未考虑完全的地方,望不吝赐教
    2023-01-01
  • Pycharm虚拟环境创建并使用命令行指定库的版本进行安装

    Pycharm虚拟环境创建并使用命令行指定库的版本进行安装

    Pycharm创建的项目,使用了虚拟环境,对库的版本进行管理,有些项目的对第三方库的版本要求不同,可使用虚拟环境进行管理,直接想通过pip命令安装可以参考下本文的操作步骤
    2022-07-07
  • Python实现matplotlib显示中文的方法详解

    Python实现matplotlib显示中文的方法详解

    这篇文章主要介绍了Python实现matplotlib显示中文的方法,结合实例形式详细总结分析了Python使用matplotlib库绘图时显示中文的相关操作技巧与注意事项,需要的朋友可以参考下
    2018-02-02

最新评论