chevron_left

Scrapy 爬虫开发教程

免费
第 9 回

教程文档

Scrapy 爬虫开发教程 - 使用 Selenium 模拟浏览器

2023年11月13日
Scrapy 爬虫开发教程

使用 Selenium 模拟浏览器

一些数据,必须登录后才能爬取,解决方案有两种:

  • 直接用爬虫程序向登录站点提交用户名、密码、验证码等参数,登录成功后记录 Cookie
  • 使用真正的浏览器来模拟登录,然后记录登录后的 Cookie

第一种方法,编程起来比较麻烦,第二种方法比较简单。在使用 Scrapy 开发爬虫程序时,经常会整合 Selenium 来启动浏览器登录

安装 Selenium

pip install selenium  # 安装模拟器

下载浏览器驱动

下载地址:https://selenium-python.readthedocs.io/installation.html#drivers

例如我这里会下载 chrome 的驱动,chromedriver

简单测试

新建一个文件夹 selenium,将刚下载的 chromedriver 驱动放进去。新建一个 selenium_test.py 文件,

from selenium import webdrive...

课程介绍

Scrapy 是适用于 Python 的一个快速、高层次的屏幕抓取和 web 抓取框架,用于抓取 web 站点并从页面中提取结构化的数据。Scrapy 用途广泛,可以用于数据挖掘、监测和自动化测试。

Scrapy 吸引人的地方在于它是一个框架,任何人都可以根据需求方便的修改。它也提供了多种类型爬虫的基类,如 BaseSpider、sitemap 爬虫等,最新版本又提供了 web2.0 爬虫的支持。

Scrapy 是一个适用爬取网站数据、提取结构性数据的应用程序框架,它可以应用在广泛领域:Scrapy 常应用在包括数据挖掘,信息处理或存储历史数据等一系列的程序中。通常我们可以很简单的通过 Scrapy 框架实现一个爬虫,抓取指定网站的内容或图片。

尽管 Scrapy 原本是设计用来屏幕抓取(更精确的说,是网络抓取),但它也可以用来访问 API 来提取数据。