百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

python爬虫神器--Scrapy(python爬虫详细教程)

ccwgpt 2025-05-07 23:34 26 浏览 0 评论

什么是爬虫,爬虫能用来做什么?文章中给你答案。*_*

今天我们就开发一个简单的项目,来爬取一下itcast.cn中c/c++ 教师的职位以及名称等信息。网站链接:
http://www.itcast.cn/channel/teacher.shtml#ac

本教程将指导您完成以下任务:

  1. pycharm以及scrapy的安装
  2. scrapy的架构流程讲解
  3. 创建一个新的scrapy项目
  4. 编写蜘蛛以爬网站点并提取导出数据

一、pycharm以及scrapy的安装

pycharm是Python的解释器,为什么不用Python自带的ipython而用pycharm的IDE呢,是因为pycharm是可视化的IDE,窗口交互习惯比较好,并且有大量的方便功能。

安装的时候没有什么特殊的,下一步就好。

scrapy的安装比较方便:如图一所示:在pycharm中FIle->settings->Project+项目名称->选择“+”->输入Scrapy->左下角的install package。等待一会就会自动安装并显示安装成功(如果有安装失败的,可以私信我解决)。

二、Scrapy架构流程讲解。

如图二所示:

1、首先Spiders(爬虫)将需要发送请求的url(requests)经ScrapyEngine(引擎)交给Scheduler(调度器),这个是需要我们手动敲代码必要部分。

2、Scheduler(排序,入队)处理后,经ScrapyEngine,DownloaderMiddlewares(可选,主要有User_Agent, Proxy代理)交给Downloader。

3、Downloader向互联网发送请求,并接收下载响应(response)。将响应(response)经ScrapyEngine,SpiderMiddlewares(可选)交给Spiders。

4、Spiders处理response,提取数据并将数据经ScrapyEngine交给ItemPipeline保存(可以是本地,可以是数据库)。提取url重新经ScrapyEngine交给Scheduler进行下一个循环。直到无Url请求程序停止结束。

5、DownloaderMiddlewares(下载中间件)以及SpiderMiddlewares(爬虫中间件)不是必要的可以省略(如果你要爬取的网页有反爬虫机制,则需要用到)。

三、创建一个新的scrapy项目

创建scrapy项目的时候用cmd环境,命令行方式创建,scrapy会自动给我增加一些文件和选项。省去爬虫开发者大量的时间。

然后我们打开工程可以看一下,scrapy会自动生成这个几个文件:

spiders目录:我们的爬虫文件的所在目录也是我们要开发爬虫的文件位置;

items.py:要爬取的数据字段

middlewares.py:中间件(下载中间件和爬虫中间件)都在这个位置

piplines.py:管道文件存放我们筛选过的数据

settings.py:scrapy的配置文件,所有的设置都可以写在配置文件中

接下来就是创建我们的爬虫文件了 有两种方法:

a.用scrapy命令行:scrapy genspider myspider -t "itcast.cn"

解释一下 genspider 是生成爬虫

myspider 是我们的爬虫名字,后续启动爬虫也是需要这个名字

itcast.cn 是我们本次爬虫要爬取的网站域名

b.在pycharm中的spiders目录下新建一个文件也可以。

我们一般用第一种,因为scrapy可以帮我们写部分代码。*_*

到此为止我们的爬虫项目就建立完毕。接下来就是利用scrapy框架写代码获取数据。

四、编写蜘蛛以爬网站点并提取数据

1.items.py

再此处我们写上自己要回去的网站的一些内容。会映射到相应的变量上。

class ScrapytestItem(scrapy.Item):

# define the fields for your item here like:

name = scrapy.Field()

title = scrapy.Field()

info = scrapy.Field()

2.写我们的爬虫文件

import scrapy

from ScrapyTest.items import ScrapytestItem

class MyspiderSpider(scrapy.Spider):

name = 'myspider' # 爬虫名

allowed_domains = ['www.itcast.cn'] # 要爬取网站的域名,不在此域内的网站不爬取。

# 要爬取的网站

start_urls = ['http://www.itcast.cn/channel/teacher.shtml#ac']

# 下载器返回的网页请求连接

def parse(self, response):

# //div[@class='li_txt']/p xpath方法获取相应的字段

print("*" * 100)

items_xpath_list = response.xpath("//div[@class='li_txt']")

# print(items_xpath_list)

# 存放教师信息列表

items = []

for item_xpath in items_xpath_list:

# 创建一个item 并赋值会返回pipelines中

item = ScrapytestItem()

name = item_xpath.xpath("./h3/text()").extract()

title = item_xpath.xpath("./h4/text()").extract()

info = item_xpath.xpath("./p/text()").extract()

item['name'] = name

item['title'] = title

item['info'] = info

#items.append(item)

yield item

return item

3.pipelines.py

import json

class ScrapytestPipeline(object):

def __init__(self):

self.f = open("myspider.json","w") #创建一个json文件对象

def process_item(self, item, spider):

content = json.dumps(dict(item),ensure_ascii = False) + ",\n"

self.f.write(content) # 爬取到的item信息写入文件

return item

def close_spider(self, spider):

self.f.close()

4.settings.py

ROBOTSTXT_OBEY = False # 修改ROBOTSTXT_OBEY

# 打开我们的管道文件(默认是注释状态)

ITEM_PIPELINES = {

'ScrapyTest.pipelines.ScrapytestPipeline': 300,

}

五、运行程序获取相应结果

运行程序有两种方法,

a.用scrapy命令

scrapy crawl myspider (注意这里的myspider 是通过genspider创建出来的那个名称)

b.用pycharm

新建文件start.py引入scrapy命令行模块

from scrapy import cmdline

cmdline.execute("scrapy crawl myspider".split())

启动start.py 就启动了scrapy项目

这个简单的项目到此,位置了。麻雀虽小,五脏俱全。赶紧上手试一下吧。

如果有问题可以私信我,项目源码:

链接:
https://pan.baidu.com/s/1_VGsxHr2t2tgSfkqkrAEOA

提取码:hmvq

相关推荐

2025南通中考作文解读之四:结构框架

文题《继续走,迈向远方》结构框架:清晰叙事,层层递进示例结构:1.开头(点题):用环境描写或比喻引出“走”与“远方”,如“人生如一条长路,每一次驻足后,都需要继续走,才能看见更美的风景”。2.中间...

高中数学的知识框架(高中数学知识框架图第三章)

高中数学的知识框架可以划分为多个核心板块,每个板块包含具体的知识点与内容,以下为详细的知识框架结构:基础知识1.集合与逻辑用语:涵盖集合的概念、表示方式、性质、运算,以及命题、四种命题关系、充分条件...

决定人生的六大框架(决定人生的要素)

45岁的自己混到今天,其实是失败的,要是早点意识到影响人生的六大框架,也不至于今天的模样啊!排第一的是环境,不是有句话叫人是环境的产物,身边的环境包括身边的人和事,这些都会对一个人产生深远的影响。其次...

2023年想考过一级造价师土建计量,看这30个知识点(三)

第二章工程构造考点一:工业建筑分类[考频分析]★★★1.按厂房层数分:(1)单层厂房;(2)多层厂房;(3)混合层数厂房。2.按工业建筑用途分:(1)生产厂房;(2)生产辅助厂房;(3)动力用厂房;(...

一级建造师习题集-建筑工程实务(第一章-第二节-2)

建筑工程管理与实务题库(章节练习)第一章建筑工程技术第二节结构设计与构造二、结构设计1.常见建筑结构体系中,适用建筑高度最小的是()。A.框架结构体系B.剪力墙结构体系C.框架-剪力墙结构体系D...

冷眼读书丨多塔斜拉桥,这么美又这么牛

”重大交通基础设施的建设是国民经济和社会发展的先导,是交通运输行业新技术集中应用与创新的综合体现。多塔斜拉桥因跨越能力强、地形适应性强、造型优美等特点,备受桥梁设计者的青睐,在未来跨越海峡工程中将得...

2021一级造价师土建计量知识点:民用建筑分类

2021造价考试备考开始了,学霸君为大家整理了一级造价师备考所用的知识点,希望对大家的备考道路上有所帮助。  民用建筑分类  一、按层数和高度分  1.住宅建筑按层数分类:1~3层为低层住宅,4~6层...

6个建筑结构常见类型,你都知道吗?

建筑结构是建筑物中支承荷载(作用)起骨架作用的体系。结构是由构件组成的。构件有拉(压)杆、梁、板、柱、拱、壳、薄膜、索、基础等。常见的建筑结构类型有6种:砖混结构、砖木结构、框架结构、钢筋混凝土结构、...

框架结构设计经验总结(框架结构设计应注意哪些问题)

1.结构设计说明主要是设计依据,抗震等级,人防等级,地基情况及承载力,防潮抗渗做法,活荷载值,材料等级,施工中的注意事项,选用详图,通用详图或节点,以及在施工图中未画出而通过说明来表达的信息。2.各...

浅谈混凝土框架结构设计(混凝土框架结构设计主要内容)

浅谈混凝土框架结构设计 摘要:结构设计是个系统的全面的工作,需要扎实的理论知识功底,灵活创新的思维和严肃认真负责的工作态度。钢筋混凝土框架结构虽然相对简单,但设计中仍有很多需要注意的问题。本文针...

2022一级建造师《建筑实务》1A412020 结构设计 精细考点整理

历年真题分布统计1A412021常用建筑结构体系和应用一、混合结构体系【2012-3】指楼盖和屋盖采用钢筋混凝土或钢木结构,而墙和柱采用砌体结构建造的房屋,大多用在住宅、办公楼、教学楼建筑中。优点:...

破土动工!这个故宫“分院”科技含量有点儿高

故宫“分院”设计图。受访者供图近日,位于北京海淀区西北旺镇的故宫北院区项目已开始破土动工,该项目也被称作故宫“分院”,筹备近十年之久。据悉,故宫本院每年展览文物的数量不到1万件,但是“分院”建成后,预...

装配式结构体系介绍(上)(装配式结构如何设计)

PC构件深化、构件之间连接节点做法等与相应装配式结构体系密切相关。本节列举目前常见的几种装配式结构体系:装配整体式混凝土剪力墙结构体系、装配整体式混凝土框架结构体系、装配整体式混凝土空腔结构体系(S...

这些不是双向抗侧结构体系(这些不是双向抗侧结构体系的特点)

双向抗侧土木吧规范对双向抗恻力结构有何规定?为何不应采用单向有墙的结构?双向抗侧土木吧1.规范对双向抗侧力结构体系的要求抗侧力体系是指抵抗水平地震作用及风荷载的结构体系。对于结构体系的布置,规范针对...

2022一级建造师《建筑实务》1A412020 结构设计 精细化考点整理

1A412021常用建筑结构体系和应用一、混合结构体系【2012-3】指楼盖和屋盖采用钢筋混凝土或钢木结构,而墙和柱采用砌体结构建造的房屋,大多用在住宅、办公楼、教学楼建筑中。优点:抗压强度高,造价...

取消回复欢迎 发表评论: