最火爆的python爬虫scrapy框架项目实战,带你走进scrapy爬虫世界
ccwgpt 2024-09-27 07:29 103 浏览 0 评论
说在前面:
我们前面学习的基础爬虫的功能也是非常强大的,几乎可以处理所有想要收集的数据,那我们为什么还要学习现在最火爆的爬虫scrapy框架呢?因为基础爬虫有一点不好的地方,就是基础重复的代码量太多了,这样就显得过于繁杂了,而scrapy把一些不是很关键的部分代码封装成了框架,这样我们就不用写那些次要的代码了,只着重我们要处理数据的那一部分重点代码就可以实现功能了。
课题:爬取韦玮老师的文章标题、链接和作者名
爬虫scrapy框架一个简单例子实现的全过程主要有4个方面:
创建爬虫项目——设置items.py文件——创建爬虫文件——启动运行爬虫
下面进行最火爆爬虫scrapy框架实例的讲解:
(为了让读者更好的理解知识,小编采用了截图每一步的操作步骤来方便读者学习和掌握)
1.创建爬虫项目文件夹
两种方式:
第一种:没有安装了pycharm软件的朋友,可以按【win】+R 键进入window运行终端有页面,具体命令操作也与第二种一样,这里不详讲了,用这种方法的朋友请看第二种方法的具体操作。
第二种:安装了pycharm软件的朋友,可以直接进入终端Terminal的命令下,比如笔者的终端如下图所示,并且我在D:\1.PCshizhan的目录下,也就是说,我创建的爬虫项目文件夹就在D:\1.PCshizhan的目录下。
(1)创建爬虫项目的命令是:scrapy startproject 自定义项目的名称,比如笔者创建的项目名为myxml。
(2)如上图出现的字样,代表创建项目myxml成功,其项目目录情况如下图所示:
2.设置items.py文件
items文件有什么用处呢?items主要用于设置要提取的内容结构,例如我们要提取【标题】+【链接】+【作者】这三个信息,可以对items文件进行修改,如下图:
(1)还没修改前默认的代码情况:
(2)进行修改后的代码:(在pass的位置按照别人的提示进行自定义修改)
3.创建爬虫文件(作用相当于c语言中的main函数的作用)
注意:在这一步要先进入到刚刚创建的项目文件夹目录下,才可以创建爬虫文件
(1)先查看有什么类型的爬虫文件:输入命令:scrapy genspider -l(L小写),如下图,类型有:basic、crawl、csvfeed、xmlfeed四种类型。
(2)我们选择xmlfeed类型来创建爬虫文件,名称自定义为myxmlspider,创建爬虫文件的格式:scrapy genspider -t 类型 爬虫文件名 域名(域名可以为百度或者其他都行),如下图所示:
如图所示已创建成功,其所在位置如下图所示:可以在spiders目录下找到爬虫文件myxmlspider
(3)创建爬虫文件成功之后,就要进行代码编写或者说修改了:
还没有修改前的爬虫文件myxmlspider代码如下:
进行修改之后,实现我们要爬取的数据信息如下:
到这里,所有的代码都修改好了,下面要启动爬虫了。
4.启动运行爬虫得出结果:
格式:scrapy crawl 爬虫文件名 --nolog
如下图所示,运行结果已经打印出来了:(部分结果截图)
今天的内容到此就结束了,学会了这一篇scrapy实例、熟记和理解我所说的几个scrapy项目的思路,基本上可以解决一般的框架爬虫的问题了,喜欢的朋友可以关注一下、也可以转发给需要学习scrapy的朋友学习,希望今晚的内容能对读者有所受益。
相关推荐
- 十分钟让你学会LNMP架构负载均衡(impala负载均衡)
-
业务架构、应用架构、数据架构和技术架构一、几个基本概念1、pv值pv值(pageviews):页面的浏览量概念:一个网站的所有页面,在一天内,被浏览的总次数。(大型网站通常是上千万的级别)2、u...
- AGV仓储机器人调度系统架构(agv物流机器人)
-
系统架构层次划分采用分层模块化设计,分为以下五层:1.1用户接口层功能:提供人机交互界面(Web/桌面端),支持任务下发、实时监控、数据可视化和报警管理。模块:任务管理面板:接收订单(如拣货、...
- 远程热部署在美团的落地实践(远程热点是什么意思)
-
Sonic是美团内部研发设计的一款用于热部署的IDEA插件,本文其实现原理及落地的一些技术细节。在阅读本文之前,建议大家先熟悉一下Spring源码、SpringMVC源码、SpringBoot...
- springboot搭建xxl-job(分布式任务调度系统)
-
一、部署xxl-job服务端下载xxl-job源码:https://gitee.com/xuxueli0323/xxl-job二、导入项目、创建xxl_job数据库、修改配置文件为自己的数据库三、启动...
- 大模型:使用vLLM和Ray分布式部署推理应用
-
一、vLLM:面向大模型的高效推理框架1.核心特点专为推理优化:专注于大模型(如GPT-3、LLaMA)的高吞吐量、低延迟推理。关键技术:PagedAttention:类似操作系统内存分页管理,将K...
- 国产开源之光【分布式工作流调度系统】:DolphinScheduler
-
DolphinScheduler是一个开源的分布式工作流调度系统,旨在帮助用户以可靠、高效和可扩展的方式管理和调度大规模的数据处理工作流。它支持以图形化方式定义和管理工作流,提供了丰富的调度功能和监控...
- 简单可靠高效的分布式任务队列系统
-
#记录我的2024#大家好,又见面了,我是GitHub精选君!背景介绍在系统访问量逐渐增大,高并发、分布式系统成为了企业技术架构升级的必由之路。在这样的背景下,异步任务队列扮演着至关重要的角色,...
- 虚拟服务器之间如何分布式运行?(虚拟服务器部署)
-
在云计算和虚拟化技术快速发展的今天,传统“单机单任务”的服务器架构早已难以满足现代业务对高并发、高可用、弹性伸缩和容错容灾的严苛要求。分布式系统应运而生,并成为支撑各类互联网平台、企业信息系统和A...
- 一文掌握 XXL-Job 的 6 大核心组件
-
XXL-Job是一个分布式任务调度平台,其核心组件主要包括以下部分,各组件相互协作实现高效的任务调度与管理:1.调度注册中心(RegistryCenter)作用:负责管理调度器(Schedule...
- 京东大佬问我,SpringBoot中如何做延迟队列?单机与分布式如何做?
-
京东大佬问我,SpringBoot中如何做延迟队列?单机如何做?分布式如何做呢?并给出案例与代码分析。嗯,用户问的是在SpringBoot中如何实现延迟队列,单机和分布式环境下分别怎么做。这个问题其实...
- 企业级项目组件选型(一)分布式任务调度平台
-
官网地址:https://www.xuxueli.com/xxl-job/能力介绍架构图安全性为提升系统安全性,调度中心和执行器进行安全性校验,双方AccessToken匹配才允许通讯;调度中心和执...
- python多进程的分布式任务调度应用场景及示例
-
多进程的分布式任务调度可以应用于以下场景:分布式爬虫:importmultiprocessingimportrequestsdefcrawl(url):response=re...
- SpringBoot整合ElasticJob实现分布式任务调度
-
介绍ElasticJob是面向互联网生态和海量任务的分布式调度解决方案,由两个相互独立的子项目ElasticJob-Lite和ElasticJob-Cloud组成。它通过弹性调度、资源管控、...
- 分布式可视化 DAG 任务调度系统 Taier 的整体流程分析
-
Taier作为袋鼠云的开源项目之一,是一个分布式可视化的DAG任务调度系统。旨在降低ETL开发成本,提高大数据平台稳定性,让大数据开发人员可以在Taier直接进行业务逻辑的开发,而不用关...
- SpringBoot任务调度:@Scheduled与TaskExecutor全面解析
-
一、任务调度基础概念1.1什么是任务调度任务调度是指按照预定的时间计划或特定条件自动执行任务的过程。在现代应用开发中,任务调度扮演着至关重要的角色,它使得开发者能够自动化处理周期性任务、定时任务和异...
你 发表评论:
欢迎- 一周热门
- 最近发表
- 标签列表
-
- MVC框架 (46)
- spring框架 (46)
- 框架图 (58)
- flask框架 (53)
- quartz框架 (51)
- abp框架 (47)
- jpa框架 (47)
- laravel框架 (46)
- springmvc框架 (49)
- 分布式事务框架 (65)
- scrapy框架 (56)
- shiro框架 (61)
- 定时任务框架 (56)
- java日志框架 (61)
- JAVA集合框架 (47)
- grpc框架 (55)
- ppt框架 (48)
- 内联框架 (52)
- winform框架 (46)
- gui框架 (44)
- cad怎么画框架 (58)
- ps怎么画框架 (47)
- ssm框架实现登录注册 (49)
- oracle字符串长度 (48)
- oracle提交事务 (47)