百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

Scrapy框架 -- 深度爬取并持久化保存图片

ccwgpt 2024-09-27 07:29 133 浏览 0 评论

一、新建一个Scrapy项目daimg

scrapy startproject daimg

二、进入该项目并创建爬虫文件daimgpc

cd daimg
scrapy genspider daimgpc www.xxx.com

三、修改配置文件settings.py

ROBOTSTXT_OBEY = False 
LOG_LEVEL = 'ERROR'
USER_AGENT = "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/111.0.0.0 Safari/537.36"

四、进入爬虫文件,编写代码

1、指定要爬取的网站

start_urls = ["http://www.XXXXX.com/photo/world/"]

2、解析该页面获取,获取详情页网址和图片名称

列表= response.xpath('/html/body/div[5]/ul/li')
       for i in 列表:
           标题=i.xpath('./a/@title').extract_first()+'.jpg'
           详情页=i.xpath('./a/@href').extract_first()

3、爬取多页图片标题及详情页

    start_urls = ["http://www.XXXX.com/photo/world/"]
    多页url模板='http://www.XXXXX.com/photo/world/list_69_%d.html'
    
         if self.页码<4:
            新url=format(self.多页url模板%self.页码)
            self.页码+=1
            yield scrapy.Request(url=新url,callback=self.parse)

4、解析详情页,获取图片链接

    yield scrapy.Request(url=详情页,callback=self.详情页解析)
    
    def 详情页解析(self,response):
        图片地址=response.xpath('/html/body/div[4]/div[1]/ul[2]/img/@src').extract_first()
        print(图片地址)

5、将图片地址和图片名称声明到items

    图片名称 = scrapy.Field()
    图片地址 = scrapy.Field()

6、将DaimgTiem函数导入爬虫文件

from ..items import DaimgItem

7、将图片地址和图片名字保存到itme对象,并提交给管道处理

itme对象=DaimgItem()
           itme对象['图片名称']=标题
           yield scrapy.Request(url=详情页,callback=self.详情页解析,meta={'item':itme对象})




meta=response.meta
item=meta['item']
item['图片地址']=图片地址
yield item

8、管道文件编写

from scrapy.pipelines.images import ImagesPipeline
class DaimgPipeline(ImagesPipeline):
    def get_media_requests(self, item, info):
        请求地址=item['图片地址']
       yield scrapy.Request(url=请求地址,meta={'名称':item['图片名称']})
    def file_path(self, request, response=None, info=None, *, item=None):
        保存名称=request.meta['名称']
        return 保存名称
    def item_completed(self, results, item, info):
        return item

9、配置文件填写保存的文件夹

IMAGES_STORE='aiyou'

10、开启管道

ITEM_PIPELINES = {
   "daimg.pipelines.DaimgPipeline": 300,
}

五、运行爬虫文件

 scrapy crawl daimgpc

六、运行结果

七、提高效率设置

1、线程数量,默认16

CONCURRENT_REQUESTS = 32

2、禁止cookies

COOKIES_ENABLED = False

3、禁止重试

RETRY_ENABLED = False

4、设置超时时间

DOWNLOAD_TIMEOUT = 10



相关推荐

VUE3前端开发入门系列教程二:使用iView框架辅助开发

1、安装iView新框架,支持VUE3npminstallview-ui-plus2、编辑src/main.js,添加以下内容,导入js和css到项目importViewUIPlusfrom...

万能前端框架uni app初探03:底部导航开发

前言本节我们使用uniapp的底部导航功能,点击不同tab会显示不同页面,这个功能在实际项目开发中几乎是必备的。一、基础知识1.tabBar如果应用是一个多tab应用,可以通过tabBar配...

Rust Web 开发框架,前端你可以选择哪个?

Rust构建一切。在如今流行的语言中,Rust可谓是将构建和高效作为自己优美的身姿在大众视野中脱颖而出。它是一门赋予每个人构建可靠且高效软件能力的语言。它有什么特性呢?高性能。Rust速度惊人且内...

连载:前端开发中纠结的Javascript框架(上)

如今,前端开发有着许许多多的框架和库。其中一些好用,一些却不尽人意。通常我们会习惯性运用某一概念,模块或句法。事实上,并没有什么万能工具。这篇文章是关于未来框架的发展趋势——那就是没有框架!我从以下几...

前端开发框架的演进架构:提升用户体验和开发效率

前端开发框架是现代Web应用开发的重要工具,它不仅可以帮助开发者构建复杂的用户界面,还能够提升用户体验和开发效率。随着Web技术的不断发展,前端开发框架也在不断演进,为开发者提供了更丰富、更高效的工具...

Google应用Mesh-TensorFlow框架,让CNN也能处理超高分辨率图像

为了要处理超高分辨率医疗图像数据,Google开发了一种空间数据分区(SpatialPartition)技术,在不牺牲图像分辨率的条件下,分析超高分辨率图像。Google使用Mesh-TensorF...

大模型安全挑战加剧:框架层漏洞成新靶心

近日,360数字安全集团发布了一份关于大模型安全漏洞的报告,揭示了当前大模型及围绕其构建的框架和应用中存在的严重安全问题。报告显示,360近期研究发现了近40个大模型相关的安全漏洞,其中既包括二进制内...

Keras 3.0正式发布:可用于TensorFlow、JAX和PyTorch

机器之心报道编辑:陈萍经过5个月的更新迭代,Keras3.0终于来了。「大新闻:我们刚刚发布了Keras3.0版本!」Keras之父FrancoisChollet在X上激动的...

TensorFlow和Keras入门必读教程(tensorflow与keras版本对应)

导读:本文对TensorFlow的框架和基本示例进行简要介绍。作者:本杰明·普朗什(BenjaminPlanche)艾略特·安德烈斯(EliotAndres)来源:华章科技01TensorFlo...

谷歌官方回应“TensorFlow遭弃”:还在投资开发,将与JAX并肩作战

鱼羊发自凹非寺量子位|公众号QbitAI终于,谷歌出面回应“TensorFlow遭弃”传闻:我们将继续致力于将TensorFlow打造为一流机器学习平台,与JAX并肩推动机器学习研究。这段时...

2025 年的PHP :现代 Web 开发的强大引擎

程序员还在吐槽PHP过时?2025年的PHP8.4直接封神了。看看最近更新的属性钩子、强类型系统,加上Laravel这些框架,老语言早就脱胎换骨。十年前说PHP弱类型容易崩代码的,现在脸疼不?联合类...

前端内卷终结者?htmx如何让开发者告别200行JS只做一个按钮

当你用React写一个点赞按钮需要引入3个状态管理库、编写80行JSX和120行钩子函数时,htmx只需要一行HTML:<buttonhx-post="/like"hx-sw...

NativePHP桌面版V1.0正式发布(元气桌面电脑版下载)

导读:各位小伙伴,使用PHP构建桌面级系统的利器,NativePHP来了。概述NativePHP是一个用于使用PHP构建桌面应用的框架。它允许PHP开发人员使用熟悉的工具和技术创建跨平台的原生应用...

PHP Laravel框架底层机制(php基本框架)

当然可以,Laravel是最受欢迎的PHP框架之一,以优雅的语法和丰富的生态而闻名。尽管开发体验非常“高端”,它的底层其实是由一系列结构清晰、职责分明的组件构成的。下面我从整体架构、核心流程、...

PHP框架之Laravel框架教程:2. 控制器、路由、视图简单介绍

2.控制器、路由、视图简单介绍我们先建立控制器,目录是:app/Http/Controllers,新建控制器Ding.php,代码如下:Ding.php:<?phpnamespaceA...

取消回复欢迎 发表评论: