IT数码 购物 网址 头条 软件 日历 阅读 图书馆
TxT小说阅读器
↓语音阅读,小说下载,古典文学↓
图片批量下载器
↓批量下载图片,美女图库↓
图片自动播放器
↓图片自动播放器↓
一键清除垃圾
↓轻轻一点,清除系统垃圾↓
开发: C++知识库 Java知识库 JavaScript Python PHP知识库 人工智能 区块链 大数据 移动开发 嵌入式 开发工具 数据结构与算法 开发测试 游戏开发 网络协议 系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程
数码: 电脑 笔记本 显卡 显示器 固态硬盘 硬盘 耳机 手机 iphone vivo oppo 小米 华为 单反 装机 图拉丁
 
   -> Python知识库 -> Scrapy 规则化爬虫(1)——CrawlSpider及link_extractor -> 正文阅读

[Python知识库]Scrapy 规则化爬虫(1)——CrawlSpider及link_extractor

Scrapy 规则化爬虫(1)——CrawlSpider及link_extractor



前言

如果我们使用仅使用Spider,那么整个过程都是代码实现,如生成request,寻找下一页等,这样的话就和普通的爬虫没什么区别。爬取不同站点就要就要分别创建一个Spider,其实这里面代码思路差不多,可能有很多重复代码,这个时候,我们可以将公共部分抽离出来,有利于我们的维护,这就是规则化爬虫。


一、CrawlSpider

  • CrawlSpider是spider的一个子类
  • 我们可以根据规则Rule来进行解析爬取
  • 除了spider的属性,还提供了特有的属性

选择CrwalSpider模板创建spider

scrapy genspider -t crawl name url

二、rules

这是一个(或多个)Rule对象的列表。每个都Rule 定义了爬取网站的特定行为。
参数:

link_extractor:LinkExtracter的对象。从响应中提取需要继续爬取的链接,并将链接生成Request。

callback:和Request中的callback一样,接收响应被调用。注意不能使用parse(),因为CrawlSpider使用怕是parse()进行解析,我们不能进行重写。

cb_kwargs:dict类型,定义传递给回调函数的参数

follow:bool类型,指定是否将此规则中提取到的链接进一步生成Request,如果callback是 None, follow默认为True,否则默认为False。

process_links:对link_extractor提取到的链接进一步处理,例如修改,过滤。

process_request:对提取并生成的Request进一步处理,必须返回Request或者None

errback:Request发生异常时调用

三、link_extractor

上文中提到link_extractor是Rule的重要属性,下面了解它的用法
导入:

from scrapy.linkextractors import LinkExtractor

参数:

allow:正则表达式或正则列表。定义提取连接的规则,符合条件的进行爬取

deny:与allow相反,定义规则的链接不允许爬取,优先于allow

allow_domains: 定义符合规则的域名,域名符合进行提取

deny_domains:不进行提取的域名

deny_extensions:定义带有该类扩展名的不被爬取,默认scrapy.linkextractors.IGNORED_EXTENSIONS.

restrict_xpaths:从定义Xpath匹配的区域进行提取

restrict_css:从定义CSS匹配的区域进行提取

tags:指定从哪类标签内提取链接,默认为('a', 'area')

attrs:指定从什么属性提取链接,默认为('href')

canonicalize :bool类型,规范化每个提取的 url。默认为False

unique:bool类型,是否对连接进行去重,默认True

process_value:一个方法,用于将提取内容转换为最终链接。例如href中不是纯链接时可以使用进行处理

strip:bool类型,去空格处理。默认True

总结

提示:这里对文章进行总结:

例如:以上就是今天要讲的内容,本文仅仅简单介绍了pandas的使用,而pandas提供了大量能使我们快速便捷地处理数据的函数和方法。

  Python知识库 最新文章
Python中String模块
【Python】 14-CVS文件操作
python的panda库读写文件
使用Nordic的nrf52840实现蓝牙DFU过程
【Python学习记录】numpy数组用法整理
Python学习笔记
python字符串和列表
python如何从txt文件中解析出有效的数据
Python编程从入门到实践自学/3.1-3.2
python变量
上一篇文章      下一篇文章      查看所有文章
加:2022-04-14 23:50:39  更:2022-04-14 23:51:09 
 
开发: C++知识库 Java知识库 JavaScript Python PHP知识库 人工智能 区块链 大数据 移动开发 嵌入式 开发工具 数据结构与算法 开发测试 游戏开发 网络协议 系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程
数码: 电脑 笔记本 显卡 显示器 固态硬盘 硬盘 耳机 手机 iphone vivo oppo 小米 华为 单反 装机 图拉丁

360图书馆 购物 三丰科技 阅读网 日历 万年历 2024年11日历 -2024/11/15 17:18:44-

图片自动播放器
↓图片自动播放器↓
TxT小说阅读器
↓语音阅读,小说下载,古典文学↓
一键清除垃圾
↓轻轻一点,清除系统垃圾↓
图片批量下载器
↓批量下载图片,美女图库↓
  网站联系: qq:121756557 email:121756557@qq.com  IT数码