《精通Scrapy网络爬虫》书评-杂志之家

内容简介

本书深入系统地介绍了Python流行框架Scrapy的相关技术及使用技巧。全书共14章，从逻辑上可分为基础篇和高级篇两部分，基础篇重点介绍Scrapy的核心元素，如spider、selector、item、link等；高级篇讲解爬虫的高级话题，如登录认证、文件下载、执行JavaScript、动态网页爬取、使用HTTP、分布式爬虫的编写等，并配合项目案例讲解，包括供练习使用的网站，以及、知乎、豆瓣、360爬虫案例等。本书案例丰富，注重实践，代码注释详尽，适合有一定Python语言基础，想学习编写复杂网络爬虫的读者使用。

编辑推荐

本书以应用为出发点，详细深入地介绍了Python流行框架Scrapy的核心技术及网络爬虫的开发技巧。本书分为基础篇和高级篇两部分，基础篇重点介绍Scrapy的核心元素，如spider、selector、item、link等；高级篇讲解如登录认证、文件下载、执行JavaScript、动态网页爬取、使用HTTP、分布式爬虫的编写等内容。为方便读者快速上手，本书还设计了大量项目案列，包括供练习用的网站的爬取以及如、知乎、豆瓣、360等网站的爬取。本书很适合有一定Python语言基础，想学习编写复杂网络爬虫的读者使用。此外，书中涉及的关联知识很丰富，可以帮助读者拓展知识面，掌握更多实用技能。

作者简介

刘硕：硕士，曾就职于知名外企，从事一线开发工作10年，目前主要从事Python开发与教学工作，在慕课网开设有多门Python课程，深受学员欢迎。

在线预览

第1章初识Scrapy本章首先介绍爬虫的基本概念、工作流程，然后介绍Scrapy的安装和网络爬虫项目的实现流程，使读者对网络爬虫有一个大致的了解，并且建立起网络爬虫的编写思路。本章重点讲解以下内容：? 网络爬虫及爬虫的工作流程。? Scrapy的介绍与安装。? 网络爬虫编写步骤。1.1 网络爬虫是什么网络爬虫是指在互联网上自动爬取网站内容信息的程序，也被称作网络蜘蛛或网络机器人。大型的爬虫程序被广泛应用于搜索引擎、数据挖掘等领域，个人用户或企业也可以利用爬虫收集对自身有价值的数据。举一个简单的例子，假设你在本地新开了一家以外卖生意为主的餐馆，现在要给菜品定价，此时便可以开发一个爬虫程序，在美团、饿了么、百度外卖这些外卖网站爬取大量其他餐馆的菜品价格作为参考，以指导定价。一个网络爬虫程序的基本执行流程可以总结为以下循环： 1.下载页面一个网页的内容本质上就是一个HTML文本，爬取一个网页内容之前，首先要根据网页的URL下载网页。2.提取页面中的数据当一个网页(HTML)下载完成后，对页面中的内容进行分析，并提取出我们感兴趣的数据，提取到的数据可以以多种形式保存起来，比如将数据以某种格式(CSV、JSON)写入文件中，或存储到数据库(MySQL、MongoDB)中。3.提取页面中的链接通常，我们想要获取的数据并不只在一个页面中，而是分布在多个页面中，这些页面彼此联系，一个页面中可能包含一个或多个到其他页面的链接，提取完当前页面中的数据后，还要把页面中的某些链接也提取出来，然后对链接页面进行爬取(循环1-3步骤)。设计爬虫程序时，还要考虑防止重复爬取相同页面(URL去重)、网页搜索策略(深度优先或广度优先等)、爬虫访问边界限定等一系列问题。从头开发一个爬虫程序是一项烦琐的工作，为了避免因制造轮子而消耗大量时间，在实际应用中我们可以选择使用一些的爬虫框架，使用框架可以降低开发成本，提高程序质量，让我们能够专注于业务逻辑(爬取有价值的数据)。接下来，本书就带你学习目前非常流行的开源爬虫框架 Scrapy。1.2 Scrapy简介及安装Scrapy是一个使用Python语言(基于Twisted框架)编写的开源网络爬虫框架，目前由Scrapinghub Ltd维护。Scrapy简单易用、灵活易拓展、开发社区活跃，并且是跨平台的。在Linux、 MaxOS以及Windows平台都可以使用。Scrapy应用程序也使用Python进行开发，目前可以支持Python 2.7以及Python 3.4 版本。在任意操作系统下，可以使用pip安装Scrapy，例如：$ pip install scrapy为确认Scrapy已安装成功，首先在Python中测试能否导入Scrapy模块：>>> import scrapy>>> scrapy.version_info(1, 3, 3)然后，在shell中测试能否执行Scrapy这条命令：$ scrapyScrapy 1.3.3 - no active project

Usage: scrapy [options] [args]

Available commands: bench Run quick benchmark test commands fetch Fetch a URL using the Scrapy downloader genspider Generate new spider using pre-defined templates runspider Run a self-contained spider (without creating a project) settings Get settings values shell Interactive scraping console startproject Create new project version Print Scrapy version view Open URL in browser, as seen by Scrapy

[ more ] More commands available when run from project directory

Use "scrapy -h" to see more info about a command通过了以上两项检测，说明Scrapy安装成功了。如上所示，我们安装的是当前近期版本1.3.3。