Scrapy实现模拟登录的示例代码

更新时间：2021年02月21日 08:59:47 作者：pengjunlee

这篇文章主要介绍了Scrapy实现模拟登录的示例代码，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧

为什么要模拟登录

有些网站是需要登录之后才能访问的，即便是同一个网站，在用户登录前后页面所展示的内容也可能会大不相同，例如，未登录时访问Github首页将会是以下的注册页面：

然而，登录后访问Github首页将包含如下页面内容：

如果我们要爬取的是一些需要登录之后才能访问的页面数据就需要模拟登录了。通常我们都是利用的 Cookies 来实现模拟登录，在Scrapy中，模拟登陆网站一般有如下两种实现方式：

(1) 请求时携带Cookies

(2) 发送Post请求获取Cookies

请求时携带Cookies

对于一些Cookies过期时间很长的不规范网站，如果我们能够在Cookies过期之前爬取到所有我们想要的数据，可以考虑在请求时直接将Cookies信息带上来模拟用户登录。

以下是模拟登录Github的示例代码：

# -*- coding: utf-8 -*-
import scrapy
import re
 
class TmallLoginSpider(scrapy.Spider):
  name = 'github_login3'
  allowed_domains = ['github.com']
  start_urls = ['https://github.com/']
 
  def start_requests(self): # 请求时携带Cookies
    cookies = '_ga=GA1.2.363045452.1554860671; tz=Asia%2FShanghai; _octo=GH1.1.1405577398.1554860677; _device_id=ee3ff12512668a1f9dc6fb33e388ea20; ignored_unsupported_browser_notice=false; has_recent_activity=1; user_session=5oxrsfsZCor1iJFCgRXXyeAXd8hcmzEUGh70-xHWLjQkT62Q; __Host-user_session_same_site=5oxrsfsZCor1iJFCgRXXyeAXd8hcmzEUGh70-xHWLjQkT62Q; logged_in=yes; dotcom_user=pengjunlee; _gat=1'
    cookies = {i.split('=')[0]: i.split('=')[1] for i in cookies.split('; ')}
    yield scrapy.Request(self.start_urls[0], cookies=cookies)
    
  def parse(self, response): # 验证是否请求成功
    print(re.findall('Learn Git and GitHub without any code!',response.body.decode()))

执行爬虫后，后台部分日志截图如下：

发送Post请求模拟登录

Scrapy还提供了两种通过发送Post请求来获取Cookies的方法。

scrapy.FormRequest()

使用scrapy.FormRequest()发送Post请求实现模拟登陆，需要人为找出登录请求的地址以及构造出登录时所需的请求数据。

使用scrapy.FormRequest()模拟登录Github的示例代码：

# -*- coding: utf-8 -*-
import scrapy
import re
 
class GithubLoginSpider(scrapy.Spider):
  name = 'github_login'
  allowed_domains = ['github.com']
  start_urls = ['https://github.com/login']
 
  def parse(self, response): # 发送Post请求获取Cookies
    authenticity_token = response.xpath('//input[@name="authenticity_token"]/@value').extract_first()
    utf8 = response.xpath('//input[@name="utf8"]/@value').extract_first()
    commit = response.xpath('//input[@name="commit"]/@value').extract_first()
    form_data = {
      'login': 'pengjunlee@163.com',
      'password': '123456',
      'webauthn-support': 'supported',
      'authenticity_token': authenticity_token,
      'utf8': utf8,
      'commit': commit}
    yield scrapy.FormRequest("https://github.com/session", formdata=form_data, callback=self.after_login)
 
  def after_login(self, response): # 验证是否请求成功
    print(re.findall('Learn Git and GitHub without any code!', response.body.decode()))

从后台日志不难看出，Scrapy 在请求完 https://github.com/session 后,自动帮我们重定向到了Github首页。

scrapy.FormRequest.from_response()

scrapy.FormRequest.from_response()使用起来比 scrapy.FormRequest()更加简单方便，我们通常只需要提供用户相关信息（账户和密码）即可，scrapy.FormRequest.from_response()将通过模拟点击为我们填充好其他的表单字段并提交表单。

使用scrapy.FormRequest.from_response()模拟登录Github的示例代码：

# -*- coding: utf-8 -*-
import scrapy
import re
 
class GithubLogin2Spider(scrapy.Spider):
  name = 'github_login2'
  allowed_domains = ['github.com']
  start_urls = ['https://github.com/login']
 
  def parse(self, response): # 发送Post请求获取Cookies
    form_data = {
      'login': 'pengjunlee@163.com',
      'password': '123456'
    }
    yield scrapy.FormRequest.from_response(response,formdata=form_data,callback=self.after_login)
 
  def after_login(self,response): # 验证是否请求成功
    print(re.findall('Learn Git and GitHub without any code!',response.body.decode()))

scrapy.FormRequest.from_response()方法还可以传入其他参数来帮我们更加精确的指定表单元素：

'''
response (Response object) – 包含表单HTML的响应，将用来对表单的字段进行预填充
formname (string) – 如果设置了该值，name 等于该值的表单将被使用
formid (string) – 如果设置了该值，id 等于该值的表单将被使用
formxpath (string) – 如果设置了该值，匹配该 xpath 的第一个表单将被使用
formcss (string) – 如果设置了该值，匹配该 css选择器的第一个表单将被使用
formnumber (integer) – 索引值等于该值的表单将被使用，默认第一个（索引值为 0 ）
formdata (dict) – 传入的表单数据，将覆盖form 元素中已经存在的值
clickdata (dict) – 用于查找可点击控件的属性值
dont_click (boolean) – 如果设置为 True，将不点击任何元素，直接提交表单数据
'''

参考文章

https://doc.scrapy.org/en/latest/topics/request-response.html

到此这篇关于Scrapy实现模拟登录的示例代码的文章就介绍到这了,更多相关Scrapy 模拟登录内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

Python实现火柴人的设计与实现
火柴人（Stick Figure）是一种极简风格的图形,通常由简单的线段和圆圈组成,却能生动地表达人物的姿态和动作,本文旨在介绍如何使用Python实现火柴人的设计与绘制,通过编程的方式,让读者了解火柴人背后的基本原理和实现方法,需要的朋友可以参考下
2024-10-10
Python统计分析模块statistics用法示例
这篇文章主要介绍了Python统计分析模块statistics用法,结合实例形式分析了Python统计分析模块statistics计算平均数、中位数、出现次数、标准差等相关操作技巧,需要的朋友可以参考下
2019-09-09
Python 实现过滤掉列表中唯一值
这篇文章主要介绍了Python 实现过滤掉列表中唯一值，文章内容主要利用Python代码实现过滤掉列表中的唯一值的功能,需要的朋友可以参考一下
2021-11-11
python 中 .py文件转 .pyd文件的操作
这篇文章主要介绍了python 中 .py文件转 .pyd文件的操作，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2021-03-03
Python使用scrapy采集数据过程中放回下载过大页面的方法
这篇文章主要介绍了Python使用scrapy采集数据过程中放回下载过大页面的方法,可实现限制下载过大页面的功能,非常具有实用价值,需要的朋友可以参考下
2015-04-04
python根据出生年份简单计算生肖的方法
这篇文章主要介绍了python根据出生年份简单计算生肖的方法,通过一个非常简单的自定义函数实现输入年份得到生肖的功能,非常实用,需要的朋友可以参考下
2015-03-03
降低python版本的操作方法
在本篇内容里小编给大家整理的是一篇关于降低python版本的操作方法，需要的朋友们可以学习参考下。
2020-09-09
Django 实现购物车功能的示例代码
这篇文章主要介绍了Django 实现购物车功能的示例代码，实现了删除产品和显示购物车的一系列购物车的实现，小编觉得挺不错的，现在分享给大家，也给大家做个参考。一起跟随小编过来看看吧
2018-10-10
python+playwright微软自动化工具的使用
这篇文章主要介绍了python+playwright微软自动化工具的使用，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2021-02-02
python类的方法属性与方法属性的动态绑定代码详解
这篇文章主要介绍了python类的方法属性与方法属性的动态绑定代码详解，具有一定借鉴价值,需要的朋友可以参考下
2017-12-12