百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

Python爬虫利器Pyppeteer框架简介

ccwgpt 2024-10-04 13:58 25 浏览 0 评论

Selenium作为一款知名的WEB自动化测试框架,因其支持绝大多数主流的浏览器,而且提供了丰富的API接口,能方便的通过程序控制来对WEB应用进行各项功能测试。当然很多时候他也作为爬虫工具来从网络上获取相关数据。但是selenium也有其一定缺点,被人吐槽比较多的就是其配置要求比较严格而且经常要更新内核驱动,但是最令人头疼的那就是作为单纯爬虫来说太"重"了,各类驱动、接口都加载上导致其运行速度较慢。

今天给大家推荐一款更为轻量化的自动化框架——Pyppeteer。它其实是Puppeteer的Python实现,它通过DevTools协议来控制Chromium浏览器来实现对页面逻辑的自动化控制,从而可以获取页面内的数据。

结合Puppeteer官网给的介绍简单地来说它相当于是帮你在后台打开了一个浏览器,打开你所需要访问的网页,你可以通过它提供的各种浏览器控制接口来控制它的行为,当然你也可以通过其提供的接口来获取它页面中的内容。另外要说明的是这个“在后台”的浏览器通常成为headless模式,你也可以通过启动参数配置来让它展示在前台来,这样可以在调试阶段实时看到一步步的你程序代码的执行情况。

安装Pyppeteer

pip install pyppeteer

Pyppeteer库可以直接用pip命令进行安装,这个是很方便的。但是前文提到过Pyppeteer其实是需要控制Chromium浏览器来实现自动化功能的,所以在安装好Pyppeteer库之后还需要我们安装Chromium浏览器,安装过程也是比较简单,只需要在控制台执行“pyppeteer-install”即可。对比Selenium来说还是方便了不少,起码不用再去关心driver啥的了。另外需要说明的是,Chromium浏览器其实也可以不需要手动去安装,第一次运行Pyppeteer程序时,如果检测到没有安装浏览器的话它会自动去下载的。

测试

官方给的测试代码如下,我稍许加了点注释:

import asyncio
from pyppeteer import launch


async def main():
    browser = await launch()    #打开浏览器
    page = await browser.newPage()  #打开一个新的页面
    await page.goto('https://www.baidu.com')    #打开一个网页地址
    await page.screenshot({'path': 'example.png'})  #将页面截图
    await browser.close()   #关闭浏览器

asyncio.get_event_loop().run_until_complete(main())

是不是很简洁明了,和我们手动操作浏览器打开网页的操作逻辑很一致,所以这也是其魅力之一。

需要重点说明下的是Pyppeteer使用了asyncio库,顾名思义它是支持异步IO的,可以方便地应对高并发等场景需求,做爬虫的小伙伴是不是又眼前一亮了。同时也需要说明的是Pyppeteer库对Python版本要求是3.6+,所以小伙伴们使用前一定要注意下自己的Python版本。

Github项目主页:https://github.com/pyppeteer/pyppeteer

Pip项目主页:https://pypi.org/project/pyppeteer/

后续我会针对pyppeteer库的相关特性和用法进行介绍,感兴趣的小伙伴请关注我!

相关推荐

火电厂智能管控新基建:全场景人员定位系统架构解析

在能源生产领域,火电厂以庞大的厂区规模、复杂的作业环境和密集的人机交互著称。从高温高压的锅炉房到精密复杂的电气设备间,从露天煤场到灰渣处理区,传统管理模式下的人员定位盲区,正成为制约安全生产与高效运营...

安全仪表系统(SIS)全生命周期管理:从设计到运维的深度解析

以下是一篇关于安全仪表系统(SIS)的技术解析与实践方法,涵盖系统架构、设计标准、实施流程及行业应用。安全仪表系统(SIS)是工业过程安全的最后一道防线,通过独立于基础控制系统的硬件和逻辑,在工艺失控...

数字化转型架构下的数据安全治理方案

这份PPT文件内容围绕数字化转型架构下的数据安全治理方案展开,主要探讨了数据质量治理、安全治理、全生命周期治理以及治理考核等方面的内容。更多参考及文档获取详见公众号:优享智库数据治理概述定义与目标:数...

安全完整性等级(SIL)分析报告编制与认证实践方法

以下是一篇关于安全完整性等级(SIL)分析报告的文章,涵盖SIL定级方法、验证流程、计算模型及工程实践。安全完整性等级(SIL)是量化安全仪表系统(SIS)性能的核心指标,由IEC61508/615...

项目管理体系框架(项目的管理体系)

Pokemon go下载教程 口袋妖怪Go下载解锁方法

#p#安卓下载#e#Pokemongo怎么下载?口袋妖怪go下载教程讲解。虽然锁区了但是大家还是有办法的,首先是口袋妖怪Go下载问题,很多口袋妖怪go的安卓玩家不知道怎么下载游戏,小编给大家详细解答...

抛弃Windows吧!谷歌推免费Chrome系统,一个U盘就搞定

在目前的个人电脑上,最主流的系统当然是Windows,不过除了Windows之外,我们也可以选择购买苹果的电脑,使用苹果的MacOS系统。不过除了苹果和微软的系统之外,实际上谷歌也有自己用于个人电脑...

谷歌误发ARM版Chrome安装包,致英特尔 /AMD用户无法安装

IT之家3月26日消息,科技媒体WindowsLatest昨日(3月25日)发布博文,报道称由于谷歌误发适用于ARM架构的安装包,导致用户从谷歌官网下载的ChromeSetu...

【Google Gemini极简教程】使用Flask和Gemini API构建一个AI BaaS

BaaS(BackendasaService,后端即服务)BaaS是一种云服务模型,它为开发者提供了一种便捷的方式来构建和管理应用程序的后端服务。BaaS提供了一系列的后端功能,如数据库管理...

第一资讯Windows 10 Mobile已成功安装谷歌Play Store

虽然微软并未正式推出WP可安装APK的功能,但近期有不少玩机爱好者已经在Windows10Mobile平台上用上了Android应用,而且随后还在需要谷歌服务框架(GoogleServices)...

宝可梦TCG Pocket谷歌账号登录,给你提供指南

《宝可梦TCGPocket》作为一款备受欢迎的卡牌对战游戏,为了给玩家提供更加便捷和安全的登录方式,支持使用谷歌账号进行登录。通过谷歌账号登录,您不仅可以快速进入游戏,还能享受账号数据同步、跨设备游...

秒变万能家庭服务器!斐讯N1 armbian安装指南

一直以来,我都想配置一台小型服务器放在家里玩一玩,但是x86架构的主机体积大功耗高,价格也不低。而树莓派的话,价格便宜一点,性能对于轻度使用也基本够用。可是树莓派仍然要两三百块钱,感觉还是有点贵。于是...

如何自己开发一个Google浏览器插件?

相信很多人都好奇,谷歌浏览器那么多的插件是如何开发的,我们如何开发一个自定义的Google浏览器插件,下面我们就来详细的给出一个开发Google浏览器插件的流程。准备环境首先需要有一个文本编辑器工具如...

我的世界手机版谷歌商店安装教程(我的世界谷歌下载)

在我的世界手机版升级到0.11.0版本后,很多玩家发现正式版需要有谷歌商店的验证也就是必须安装Googleplay才能玩。这次搞趣网小编就为大家带来我的世界手机版谷歌商店安装教程。有些手机自带Goo...

部落冲突安卓版谷歌怎么绑定 有无root都可以

部落冲突安卓版谷歌怎么绑定?下面小编为大家带来部落冲突安卓版谷歌绑定攻略详解,希望这篇攻略详解能够对大家有所帮助。首先准备这些东西(必须在网上自己下载,不要相信google应用)还需要下载"谷歌服务框...

取消回复欢迎 发表评论: