Python：Scrapy框架中Item Pipeline组件使用详解

更新时间：2017年12月27日 09:26:47 作者：曾是土木人

这篇文章主要介绍了Python：Scrapy框架中Item Pipeline组件使用详解，具有一定借鉴价值,需要的朋友可以参考下

Item Pipeline简介

Item管道的主要责任是负责处理有蜘蛛从网页中抽取的Item，他的主要任务是清晰、验证和存储数据。
当页面被蜘蛛解析后，将被发送到Item管道，并经过几个特定的次序处理数据。
每个Item管道的组件都是有一个简单的方法组成的Python类。
他们获取了Item并执行他们的方法，同时他们还需要确定的是是否需要在Item管道中继续执行下一步或是直接丢弃掉不处理。

Item管道通常执行的过程有

清理HTML数据
验证解析到的数据（检查Item是否包含必要的字段）
检查是否是重复数据（如果重复就删除）
将解析到的数据存储到数据库中

编写自己的Item Pipeline

编写item管道其实是很容易的。
每个Item管道的组件都是由一个简单的方法组成的Python类：

process_item(item, spider)

每一个item管道组件都会调用该方法，并且必须返回一个item对象实例或raise DropItem异常。
被丢掉的item将不会在管道组件进行执行
此外，我们也可以在类中实现以下方法

open_spider(spider)

当spider执行的时候将调用该方法

close_spider(spider)

当spider关闭的时候将调用该方法
Item Pipeline例子

代码如下：

from scrapy.exceptions import DropItem 
 
class PricePipeline(object): 
 
  vat_factor = 1.15 
 
  def process_item(self, item, spider): 
    if item['price']: 
      if item['price_excludes_vat']: 
        item['price'] = item['price'] * self.vat_factor 
      return item 
    else: 
      raise DropItem("Missing price in %s" % item)

注：VAT:ValueAddedTax(增值税)

以上代码可以过滤那些没有价格的产品，并且对那些不包括增值税产品的价格进行调整

将抓取的items以json格式保存到文件中

从spider抓取到的items将被序列化为json格式，并且以每行一个item的形式被写入到items.jl文件中

代码：

import json 
 
class JsonWriterPipeline(object): 
 
  def __init__(self): 
    self.file = open('items.jl', 'wb') 
 
  def process_item(self, item, spider): 
    line = json.dumps(dict(item)) + "\n" 
    self.file.write(line) 
    return item

注：JsonWriterPipeline的目的是介绍如何编写项目管道。如果想要保存抓取的items到json文件中，推荐使用Feedexports

删除重复项

假设在spider中提取到的item有重复的id，那么我们就可以在process_item函数中进行过滤

如：

from scrapy.exceptions import DropItem 
 
class DuplicatesPipeline(object): 
 
  def __init__(self): 
    self.ids_seen = set() 
 
  def process_item(self, item, spider): 
    if item['id'] in self.ids_seen: 
      raise DropItem("Duplicate item found: %s" % item) 
    else: 
      self.ids_seen.add(item['id']) 
      return item

激活ItemPipeline组件

在settings.py文件中，往ITEM_PIPELINES中添加项目管道的类名，就可以激活项目管道组件

如：

ITEM_PIPELINES = { 
  'myproject.pipeline.PricePipeline': 300, 
  'myproject.pipeline.JsonWriterPipeline': 800, 
}

The integer values you assign to classes in this setting determine the order they run in- items go through pipelines from order number low to high

整数值通常设置在0-1000之间

总结

以上就是本文关于Python：Scrapy框架中Item Pipeline组件使用详解的全部内容，希望对大家有所帮助。感兴趣的朋友可以继续参阅本站：

Python使用Scrapy保存控制台信息到文本解析

Python爬虫实例爬取网站搞笑段子

Python爬虫获取整个站点中的所有外部链接代码示例

如有不足之处，欢迎留言指出。感谢朋友们对本站的支持！

您可能感兴趣的文章:

pip安装指定版本的tensorflow的实现
本文介绍了如何使用pip安装指定版本的TensorFlow,包括CPU版本和GPU版本的安装方法,同时,文中也提到了使用阿里国内镜像源加速下载的方法,以及在安装GPU版本时需要检查CUDA和cuDNN的兼容性的注意事项,感兴趣的可以了解一下
2024-10-10
Pytorch搭建YoloV5目标检测平台实现过程
这篇文章主要为大家介绍了Pytorch搭建YoloV5目标检测平台实现过程，有需要的朋友可以借鉴参考下，希望能够有所帮助，祝大家多多进步，早日升职加薪
2022-04-04
Python类的动态修改的实例方法
这篇文章主要介绍了Python类的动态修改的实例方法的相关资料,需要的朋友可以参考下
2017-03-03
Python count()函数实例详解
count() 是Python的内置函数，可以「统计」字符串里指定「字符」或指定字符串出现的「次数」，这篇文章主要介绍了Python count()函数详解,需要的朋友可以参考下
2023-07-07
Python算法输出1-9数组形成的结果为100的所有运算式
这篇文章主要介绍了Python算法输出1-9数组形成的结果为100的所有运算式，然后介绍了另外一个相关实例，具体内容请参阅正文，需要的朋友可以参考下。
2017-11-11
Python中and和or如何使用
在本篇文章里小编给各位分享的是一篇关于Python中and、or用法实例文章，有兴趣的朋友们可以参考学习下。
2020-05-05
Flask之请求钩子的实现
这篇文章主要介绍了Flask之请求钩子的实现，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2018-12-12
Python 变量类型及命名规则介绍
Python编程中，变量是用于存放值或对像的容器。而变量的名称可以自定义，基本的命名规则如下
2013-06-06
解决Pycharm 运行后没有输出的问题
这篇文章主要介绍了解决Pycharm 运行后没有输出的问题，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2021-02-02
Python绘制3D曲面图的示例代码
Python提供了多种库和工具,使得创建和定制3D曲面图变得简单,本文将介绍如何使用Matplotlib和mpl_toolkits.mplot3d库绘制3D曲面图,感兴趣的可以了解下
2024-04-04

Python：Scrapy框架中Item Pipeline组件使用详解

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具