chevron_left

Scrapy 爬虫开发教程

免费
第 1 回

教程文档

Scrapy 爬虫开发教程 - 安装 Scrapy

2023年11月23日
Scrapy 爬虫开发教程

安装 Scrapy

安装

pip install scrapy  # 安装scrapy爬虫框架

会安装大量依赖包,其中包含

  • pyOpenSSL: 用于支持 SSL 的包
  • cryptography:用于加密
  • CFFI: 用于调用 C 的接口库
  • zepto.interface: 为缺少接口而提供扩展的库
  • lxml: 处理 XML、HTML 文档的库
  • cssselect: 用于处理 CSS 选择器的包
  • Twisted: 提供基于事件驱动的网络引擎包

创建 Scrapy 项目

scrapy startproject ClwySpider
  • scrapy.cfg:项目总配置文件,通常无需修改
  • ClwySpider:项目的 Python 模块,程序从此导入 Python 代码
  • ClwySpider/items.py:用于定义项目用到的 Item 类。
  • ClwySpider/pipelines.py:管道文件,负责处理爬取到的信息
  • ClwySpider/settings.p...

课程介绍

Scrapy 是适用于 Python 的一个快速、高层次的屏幕抓取和 web 抓取框架,用于抓取 web 站点并从页面中提取结构化的数据。Scrapy 用途广泛,可以用于数据挖掘、监测和自动化测试。

Scrapy 吸引人的地方在于它是一个框架,任何人都可以根据需求方便的修改。它也提供了多种类型爬虫的基类,如 BaseSpider、sitemap 爬虫等,最新版本又提供了 web2.0 爬虫的支持。

Scrapy 是一个适用爬取网站数据、提取结构性数据的应用程序框架,它可以应用在广泛领域:Scrapy 常应用在包括数据挖掘,信息处理或存储历史数据等一系列的程序中。通常我们可以很简单的通过 Scrapy 框架实现一个爬虫,抓取指定网站的内容或图片。

尽管 Scrapy 原本是设计用来屏幕抓取(更精确的说,是网络抓取),但它也可以用来访问 API 来提取数据。