Twitter 大数据实时计算的经验分享
ccwgpt 2024-10-26 08:43 47 浏览 0 评论
生活中,有很多事务需要实时分析处理:展示实时的趋势;基于某个名人明星发布的 Tweet 话题的公开会话讨论;实时为用户推荐最新资讯;用户的实时搜索……以上都是 Twitter 实时服务涵盖的实时场景。对于 Twitter 而言,实时性就是其产品的基石。
Twitter 每天要接收和处理用户发送的数十亿条推文。实时分析这些推文是一个巨大的挑战。为了保证每条推文处理的实时性和高效性,Twitter 在分布式流计算系统 Storm 的基础之上,投入了大量的人力,设计和开发了一套全新的实时计算系统——Heron。
Heron 是为大规模环境量身打造的下一代开源流媒体引擎。Heron 现在已经是 Apache 的孵化项目,它的 Contributor 除了来自 Twitter 外还有来自微软、Google、斯坦福等多个组织机构。Heron 在大规模上提供无与伦比的性能,并已成功满足各种流处理 Application 的价格 / 性能目标。
从 Twitter 实时计算框架的演进可以看出:提高计算的时效性,更快的从数据中挖掘出信息和知识就意味着能够获取更大的价值。最近,越来越多的企业对于实时数据技术架构感兴趣,从批处理向流计算机构的转型,是企业关于如何使用数据的一次技术革命。
但是,实时数据技术栈(包括流计算引擎、数据存储引擎、编程语言和工具)的最前沿现状又是什么呢?在这其中,又有哪些技术挑战?以及这些前沿技术怎么影响流计算的架构和应用呢?
不妨来 QCon 大会上海站的会前两天深度培训,和前 Twitter message group 的技术负责人一起深入讨论下实时数据技术栈的那些事儿。
大数据实时计算
现在越来越多的应用场景对数据处理有了高时效性的要求。如何能够更快的采集数据,实时的处理数据是当前各个新经济所面临的一个挑战。
为了满足以上需求,QCon 大会上海站开设了——《大数据实时计算》深度培训课程,邀请了在实时处理方面拥有丰富经验的两位讲师——郭斯杰、翟佳,于 10 月 16 日和大家一起分享 Twitter 、Yahoo 等大数据实时计算的实践经验。
首先,来认识下《大数据实时计算》的两位分享讲师:
郭斯杰,之前就职于 Twitter,任职 Staff Software Engineer,是 Twitter message group 的技术负责人。同时也是 Apache BookKeeper 的 PMC Chair, Apache DistributedLog 的 Co-Creator。加入 Twitter 之前,就职于 Yahoo。
翟佳,毕业于中科院计算所,目前就职于一家下一代实时处理初创公司 Streamlio,是 streamlio 的核心创始成员之一。在此之前任职于 EMC,是北京 EMC 实时处理平台的技术负责人。主要从事实时计算和分布式存储系统的相关开发,此外也在开源项目 Apache BookKeeper, Distributedlog,DC/OS 等项目中持续贡献代码。
两位讲师分享的大纲如下:
流计算的简介以及一些典型应用
流计算架构是什么
不同类型的流计算架构及其优缺点
流计算技术栈中的 messaging,compute 和 storage 三个层面
Messaging: Apache Pulsar 的特性和使用场景
Computing:Heron。详细讨论流计算引擎 Heron,以及它在现代实时数据技术栈里的使用场景
Storage:详细讨论为实时数据存储设计的 Apache BookKeeper/DistributedLog
使用 Apache Pulsar, BookKeeper/DistributedLog 和 Heron 来搭建实时数据技术栈时获得的经验教训
如何参与培训?
深度培训在 QCon 大会前 2 天,10 月 15 日 -16 日在上海宝华万豪酒店举办,培训包括 10 小时的授课和 2 个小时的提问交流,沉浸式学习热门技术,除了《大数据实时计算》内容,还有《机器学习实践》的技术分享。
添加小助手微信,咨询更多课程内容。
学习席位有限,点击 「阅读原文」即可进入大会官网,了解更多信息,点击官网“立即报名”按钮即可获取学习席位。
相关推荐
- 十分钟让你学会LNMP架构负载均衡(impala负载均衡)
-
业务架构、应用架构、数据架构和技术架构一、几个基本概念1、pv值pv值(pageviews):页面的浏览量概念:一个网站的所有页面,在一天内,被浏览的总次数。(大型网站通常是上千万的级别)2、u...
- AGV仓储机器人调度系统架构(agv物流机器人)
-
系统架构层次划分采用分层模块化设计,分为以下五层:1.1用户接口层功能:提供人机交互界面(Web/桌面端),支持任务下发、实时监控、数据可视化和报警管理。模块:任务管理面板:接收订单(如拣货、...
- 远程热部署在美团的落地实践(远程热点是什么意思)
-
Sonic是美团内部研发设计的一款用于热部署的IDEA插件,本文其实现原理及落地的一些技术细节。在阅读本文之前,建议大家先熟悉一下Spring源码、SpringMVC源码、SpringBoot...
- springboot搭建xxl-job(分布式任务调度系统)
-
一、部署xxl-job服务端下载xxl-job源码:https://gitee.com/xuxueli0323/xxl-job二、导入项目、创建xxl_job数据库、修改配置文件为自己的数据库三、启动...
- 大模型:使用vLLM和Ray分布式部署推理应用
-
一、vLLM:面向大模型的高效推理框架1.核心特点专为推理优化:专注于大模型(如GPT-3、LLaMA)的高吞吐量、低延迟推理。关键技术:PagedAttention:类似操作系统内存分页管理,将K...
- 国产开源之光【分布式工作流调度系统】:DolphinScheduler
-
DolphinScheduler是一个开源的分布式工作流调度系统,旨在帮助用户以可靠、高效和可扩展的方式管理和调度大规模的数据处理工作流。它支持以图形化方式定义和管理工作流,提供了丰富的调度功能和监控...
- 简单可靠高效的分布式任务队列系统
-
#记录我的2024#大家好,又见面了,我是GitHub精选君!背景介绍在系统访问量逐渐增大,高并发、分布式系统成为了企业技术架构升级的必由之路。在这样的背景下,异步任务队列扮演着至关重要的角色,...
- 虚拟服务器之间如何分布式运行?(虚拟服务器部署)
-
在云计算和虚拟化技术快速发展的今天,传统“单机单任务”的服务器架构早已难以满足现代业务对高并发、高可用、弹性伸缩和容错容灾的严苛要求。分布式系统应运而生,并成为支撑各类互联网平台、企业信息系统和A...
- 一文掌握 XXL-Job 的 6 大核心组件
-
XXL-Job是一个分布式任务调度平台,其核心组件主要包括以下部分,各组件相互协作实现高效的任务调度与管理:1.调度注册中心(RegistryCenter)作用:负责管理调度器(Schedule...
- 京东大佬问我,SpringBoot中如何做延迟队列?单机与分布式如何做?
-
京东大佬问我,SpringBoot中如何做延迟队列?单机如何做?分布式如何做呢?并给出案例与代码分析。嗯,用户问的是在SpringBoot中如何实现延迟队列,单机和分布式环境下分别怎么做。这个问题其实...
- 企业级项目组件选型(一)分布式任务调度平台
-
官网地址:https://www.xuxueli.com/xxl-job/能力介绍架构图安全性为提升系统安全性,调度中心和执行器进行安全性校验,双方AccessToken匹配才允许通讯;调度中心和执...
- python多进程的分布式任务调度应用场景及示例
-
多进程的分布式任务调度可以应用于以下场景:分布式爬虫:importmultiprocessingimportrequestsdefcrawl(url):response=re...
- SpringBoot整合ElasticJob实现分布式任务调度
-
介绍ElasticJob是面向互联网生态和海量任务的分布式调度解决方案,由两个相互独立的子项目ElasticJob-Lite和ElasticJob-Cloud组成。它通过弹性调度、资源管控、...
- 分布式可视化 DAG 任务调度系统 Taier 的整体流程分析
-
Taier作为袋鼠云的开源项目之一,是一个分布式可视化的DAG任务调度系统。旨在降低ETL开发成本,提高大数据平台稳定性,让大数据开发人员可以在Taier直接进行业务逻辑的开发,而不用关...
- SpringBoot任务调度:@Scheduled与TaskExecutor全面解析
-
一、任务调度基础概念1.1什么是任务调度任务调度是指按照预定的时间计划或特定条件自动执行任务的过程。在现代应用开发中,任务调度扮演着至关重要的角色,它使得开发者能够自动化处理周期性任务、定时任务和异...
你 发表评论:
欢迎- 一周热门
- 最近发表
- 标签列表
-
- MVC框架 (46)
- spring框架 (46)
- 框架图 (58)
- flask框架 (53)
- quartz框架 (51)
- abp框架 (47)
- jpa框架 (47)
- laravel框架 (46)
- springmvc框架 (49)
- 分布式事务框架 (65)
- scrapy框架 (56)
- shiro框架 (61)
- 定时任务框架 (56)
- java日志框架 (61)
- JAVA集合框架 (47)
- grpc框架 (55)
- ppt框架 (48)
- 内联框架 (52)
- winform框架 (46)
- gui框架 (44)
- cad怎么画框架 (58)
- ps怎么画框架 (47)
- ssm框架实现登录注册 (49)
- oracle字符串长度 (48)
- oracle提交事务 (47)