百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

ETL数据库迁移工具Kettle的安装配置详解

ccwgpt 2024-12-17 13:00 280 浏览 0 评论

介绍:

?Kettle简介:Kettle 是 PDI 以前的名称,PDI 的全称是Pentaho Data Integeration,Kettle 本意是水壶的意思,表达了数据流的含义。Kettle是一款国外开源的ETL工具,纯java编写,可以在Window、Linux、Unix上运行,绿色无需安装,数据抽取高效稳定。Kettle这个ETL工具集,它允许你管理来自不同数据库的数据,通过提供一个图形化的用户环境来描述你想做什么,而不是你想怎么做。Kettle中有两种脚本文件,transformation和job,transformation完成针对数据的基础转换,job则完成整个工作流的控制。作为Pentaho的一个重要组成部分,现在在国内项目应用上逐渐增多。

?ETL(Extract-Transform-Load的缩写),即数据抽取、转换、装载的过程。对于企业或行业应用来说,我们经常会遇到各种数据的处理,转换,迁移,所以了解并掌握一种etl工具的使用,必不可少,这里我介绍一个我在工作中使用了很久的ETL工具Kettle,本着好东西不独享的想法,跟大家分享碰撞交流一下!在使用中我感觉这个工具真的很强大,支持图形化的GUI设计界面,然后可以以工作流的形式流转,在做一些简单或复杂的数据抽取、质量检测、数据清洗、数据转换、数据过滤等方面有着比较稳定的表现,其中最主要的我们通过熟练的应用它,减少了非常多的工作量,提高了我们的工作效率。

特点

免费开源

???基于java的免费开源的软件,对商业用户也没有限制。

易配置

???可以在Window、Linux、Unix上运行,绿色无需安装,数据抽取高效稳定。

不同数据库

???ETL工具集,它允许你管理来自不同数据库的数据。

两种脚本文件

???transformationjobtransformation完成针对数据的基础转换,job则完成整个工作流的控制。

图形界面设计

???通过图形界面设计实现做什么业务,无需写代码去实现。

定时功能

???在Job下的start模块,有一个定时功能,可以每日,每周等方式进行定时。

在这里插入图片描述

环境

?Windows 10

?Java 8 (运行Kettle 7.0 以上版本需要Java8及以上)

?Kettle 7.1

?mysql-connector-java-8.0.21(连接Mysql驱动包,根据数据库版本下载)

一键安装,急速使用

?第一步. 下载程序包并解压

????从官方网站下载spoon压缩包。

?第二步. 一键启动

????在windows下,解压后,双击spoon.bat文件运行。

?开始使用

????开始可视化数据操作吧。

1.下载Kettle程序包并解压

??Kettle 7.1版本下载地址:https://udomain.dl.sourceforge.net/project/pentaho/Data%20Integration/7.1/pdi-ce-7.1.0.0-12.zip

??Kettle各个版本下载地址:https://sourceforge.net/projects/pentaho/files/

注意:

??下载时进入相应版本后,选择client-tools,选择pdi-ce开头的程序包下载。

在这里插入图片描述


在这里插入图片描述

2.下载连接驱动包:

?Java 连接 MySQL 需要驱动包,MySQL驱动包官网下载地址:
https://dev.mysql.com/downloads/connector/j/

在这里插入图片描述

在这里插入图片描述

3.解压Java连接Mysql 8.0驱动包

??解压后取出mysql-connector-java.jar包(这里驱动包有版本号)。放到kettle的lib目录下面。

在这里插入图片描述


在这里插入图片描述

4.运行spoon.bat,打开spoon图形工具

在这里插入图片描述

在这里插入图片描述


在这里插入图片描述


注意:


?红圈处没有connect按钮,原因为资源库配置文件乱码造成。

解决方法: 打开系统盘用户目录下的repositories.xml配置文件,将乱码内容删除,并删除.spoonrc文件,再重启kettle。

在这里插入图片描述

5.创建或连接资源库

???选择创建数据库资源库

在这里插入图片描述


在这里插入图片描述


在这里插入图片描述


???输入资源库名称(自定义) 点击Database Connection创建数据库连接。


在这里插入图片描述


???选择Create New Connection。


在这里插入图片描述

6.创建数据库连接

?输入连接名称、选择类型(根据自身所需选择,这里连接的是mysql数据库,如连接其他数据库,需将数据库驱动放在kettle根目录中的lib下面,然后启动数据库重启kettle) 确认输入无误后点击测试,测试是否连接成功,失败多为lib下找不到数据库驱动

在这里插入图片描述


在这里插入图片描述


在这里插入图片描述


在这里插入图片描述

?在这里选择刚才我们创建的数据库名称。

在这里插入图片描述


?创建成功,选择Connect Now连接到数据库。


在这里插入图片描述


?登陆时,默认是admin用户,密码也是admin,启动后可以修改用户密码或添加其他用户。


在这里插入图片描述

7.登录数据库查看Kettle自动创建的表结构

[root@localhost ~]# docker exec -it mysql /bin/bash

root@2a12523bd803:/# mysql -uroot -p123qqq...A
mysql: [Warning] Using a password on the command line interface can be insecure.
Welcome to the MySQL monitor.  Commands end with ; or \g.
Your MySQL connection id is 13
Server version: 8.0.21 MySQL Community Server - GPL

Copyright (c) 2000, 2020, Oracle and/or its affiliates. All rights reserved.

Oracle is a registered trademark of Oracle Corporation and/or its
affiliates. Other names may be trademarks of their respective
owners.

Type 'help;' or '\h' for help. Type '\c' to clear the current input statement.

mysql> show databases;
+--------------------+
| Database           |
+--------------------+
| information_schema |
| mysql              |
| performance_schema |
| sys                |
| test               |
+--------------------+

mysql> use test;

mysql> show tables;
+--------------------------+
| Tables_in_test           |
+--------------------------+
| R_CLUSTER                |
| R_CLUSTER_SLAVE          |
| R_CONDITION              |
| R_DATABASE               |
| R_DATABASE_ATTRIBUTE     |
| R_DATABASE_CONTYPE       |
| R_DATABASE_TYPE          |
| R_DEPENDENCY             |
| R_DIRECTORY              |
| R_ELEMENT                |
| R_ELEMENT_ATTRIBUTE      |
| R_ELEMENT_TYPE           |
| R_JOB                    |
| R_JOBENTRY               |
| R_JOBENTRY_ATTRIBUTE     |
| R_JOBENTRY_COPY          |
| R_JOBENTRY_DATABASE      |
| R_JOBENTRY_TYPE          |
| R_JOB_ATTRIBUTE          |
| R_JOB_HOP                |
| R_JOB_LOCK               |
| R_JOB_NOTE               |
| R_LOG                    |
| R_LOGLEVEL               |
| R_NAMESPACE              |
| R_NOTE                   |
| R_PARTITION              |
| R_PARTITION_SCHEMA       |
| R_REPOSITORY_LOG         |
| R_SLAVE                  |
| R_STEP                   |
| R_STEP_ATTRIBUTE         |
| R_STEP_DATABASE          |
| R_STEP_TYPE              |
| R_TRANSFORMATION         |
| R_TRANS_ATTRIBUTE        |
| R_TRANS_CLUSTER          |
| R_TRANS_HOP              |
| R_TRANS_LOCK             |
| R_TRANS_NOTE             |
| R_TRANS_PARTITION_SCHEMA |
| R_TRANS_SLAVE            |
| R_TRANS_STEP_CONDITION   |
| R_USER                   |
| R_VALUE                  |
| R_VERSION                |
| mysqltest                |
+--------------------------+

mysql> select * from R_USER;
+---------+-------+-----------------------------------+---------------+-------------------------+---------+
| ID_USER | LOGIN | PASSWORD                          | NAME          | DESCRIPTION             | ENABLED |
+---------+-------+-----------------------------------+---------------+-------------------------+---------+
|       1 | admin | 2be98afc86aa79ce71da9fa6d4 | Administrator | User manager            |       1 |
|       2 | guest | 2be98afc86aace77cb97bcce | Guest account | Read-only guest account |       1 |
+---------+-------+-----------------------------------+---------------+-------------------------+---------+

8.添加新用户

?点击工具 --> 资源库 --> 探索资源选择【安全】--> 添加用户 -->填写账号密码保存即可。

如果你觉得这篇文章还不错,就请动动你的发财手为本文点赞-评论-转发吧,因为这将是我持续输出更多优质文章的最强动力,谢谢!

相关推荐

十分钟让你学会LNMP架构负载均衡(impala负载均衡)

业务架构、应用架构、数据架构和技术架构一、几个基本概念1、pv值pv值(pageviews):页面的浏览量概念:一个网站的所有页面,在一天内,被浏览的总次数。(大型网站通常是上千万的级别)2、u...

AGV仓储机器人调度系统架构(agv物流机器人)

系统架构层次划分采用分层模块化设计,分为以下五层:1.1用户接口层功能:提供人机交互界面(Web/桌面端),支持任务下发、实时监控、数据可视化和报警管理。模块:任务管理面板:接收订单(如拣货、...

远程热部署在美团的落地实践(远程热点是什么意思)

Sonic是美团内部研发设计的一款用于热部署的IDEA插件,本文其实现原理及落地的一些技术细节。在阅读本文之前,建议大家先熟悉一下Spring源码、SpringMVC源码、SpringBoot...

springboot搭建xxl-job(分布式任务调度系统)

一、部署xxl-job服务端下载xxl-job源码:https://gitee.com/xuxueli0323/xxl-job二、导入项目、创建xxl_job数据库、修改配置文件为自己的数据库三、启动...

大模型:使用vLLM和Ray分布式部署推理应用

一、vLLM:面向大模型的高效推理框架1.核心特点专为推理优化:专注于大模型(如GPT-3、LLaMA)的高吞吐量、低延迟推理。关键技术:PagedAttention:类似操作系统内存分页管理,将K...

国产开源之光【分布式工作流调度系统】:DolphinScheduler

DolphinScheduler是一个开源的分布式工作流调度系统,旨在帮助用户以可靠、高效和可扩展的方式管理和调度大规模的数据处理工作流。它支持以图形化方式定义和管理工作流,提供了丰富的调度功能和监控...

简单可靠高效的分布式任务队列系统

#记录我的2024#大家好,又见面了,我是GitHub精选君!背景介绍在系统访问量逐渐增大,高并发、分布式系统成为了企业技术架构升级的必由之路。在这样的背景下,异步任务队列扮演着至关重要的角色,...

虚拟服务器之间如何分布式运行?(虚拟服务器部署)

  在云计算和虚拟化技术快速发展的今天,传统“单机单任务”的服务器架构早已难以满足现代业务对高并发、高可用、弹性伸缩和容错容灾的严苛要求。分布式系统应运而生,并成为支撑各类互联网平台、企业信息系统和A...

一文掌握 XXL-Job 的 6 大核心组件

XXL-Job是一个分布式任务调度平台,其核心组件主要包括以下部分,各组件相互协作实现高效的任务调度与管理:1.调度注册中心(RegistryCenter)作用:负责管理调度器(Schedule...

京东大佬问我,SpringBoot中如何做延迟队列?单机与分布式如何做?

京东大佬问我,SpringBoot中如何做延迟队列?单机如何做?分布式如何做呢?并给出案例与代码分析。嗯,用户问的是在SpringBoot中如何实现延迟队列,单机和分布式环境下分别怎么做。这个问题其实...

企业级项目组件选型(一)分布式任务调度平台

官网地址:https://www.xuxueli.com/xxl-job/能力介绍架构图安全性为提升系统安全性,调度中心和执行器进行安全性校验,双方AccessToken匹配才允许通讯;调度中心和执...

python多进程的分布式任务调度应用场景及示例

多进程的分布式任务调度可以应用于以下场景:分布式爬虫:importmultiprocessingimportrequestsdefcrawl(url):response=re...

SpringBoot整合ElasticJob实现分布式任务调度

介绍ElasticJob是面向互联网生态和海量任务的分布式调度解决方案,由两个相互独立的子项目ElasticJob-Lite和ElasticJob-Cloud组成。它通过弹性调度、资源管控、...

分布式可视化 DAG 任务调度系统 Taier 的整体流程分析

Taier作为袋鼠云的开源项目之一,是一个分布式可视化的DAG任务调度系统。旨在降低ETL开发成本,提高大数据平台稳定性,让大数据开发人员可以在Taier直接进行业务逻辑的开发,而不用关...

SpringBoot任务调度:@Scheduled与TaskExecutor全面解析

一、任务调度基础概念1.1什么是任务调度任务调度是指按照预定的时间计划或特定条件自动执行任务的过程。在现代应用开发中,任务调度扮演着至关重要的角色,它使得开发者能够自动化处理周期性任务、定时任务和异...

取消回复欢迎 发表评论: