Skip to content
Tse的笔记
Go back

大数据系统复习三

Edit page

Hadoop

第七章

MapReduce模型介绍

JobTracker

第八章

HDFS HA

HDFSHA

ResourceManager

第九章

数据湖的概念、全量数据、数据湖的本质、两类数据处理工具的作用

数据湖

随着企业持续发展,企业数据也在不断积累。虽然价值较高的数据通常存放在数据库和数据仓库中,用于支撑企业日常运转,但企业往往还希望完整保存生产经营过程中产生的所有相关数据,包括:

保存这些数据的目的是方便企业日后进行分析和挖掘,从海量数据中发现潜在价值。

传统数据库和数据仓库难以完整承担这一任务,因此出现了数据湖(Data Lake)

数据湖的概念

数据湖是一种以数据的自然格式或原始格式保存数据的系统或存储架构,底层通常采用对象存储或文件存储。

数据湖通常作为企业全量数据的统一存储位置。

全量数据

数据湖中的全量数据包括:

这些数据可以用于:

按照数据类型划分,数据湖中可以包含:

数据湖既可以构建在企业本地数据中心,也可以构建在云平台上。

数据湖的本质

数据湖的本质是由以下两部分组成的解决方案:

数据存储架构 + 数据处理工具

因此,数据湖不是某个单一、独立的产品。

数据存储架构

数据湖的存储架构需要具备足够的:

它需要保证企业能够将所有原始数据长期保存下来,即做到:

云厂商通常使用对象存储作为数据湖的存储底座。例如,Amazon Web Services 使用 Amazon S3 作为数据湖的底层对象存储。

数据处理工具

数据湖中的数据处理工具主要分为两类。

第一类:数据移动与管理工具

第一类工具负责将数据“搬到”数据湖中,主要功能包括:

如果缺少数据管理和治理工具,数据湖中的元数据和数据质量就无法得到保障。各种未经整理的数据不断进入数据湖,可能使数据湖逐渐变成难以使用的“数据沼泽”。

因此,数据移动和数据管理工具是数据湖方案中的重要组成部分。

例如,Amazon Web Services 提供:

第二类:数据分析与计算工具

第二类工具负责从数据湖中的海量数据中发现和提取价值,也就是从数据中“淘金”。

数据存入数据湖后,还需要进行进一步的:

数据湖可以通过不同的计算引擎支持多种数据分析场景,包括:

两类工具的作用总结

工具类型主要作用
数据移动与管理工具将数据导入数据湖,并完成数据源管理、访问控制、安全管理、ETL、元数据管理和数据目录建设,避免数据湖变成“数据沼泽”
数据分析与计算工具对数据湖中的数据进行查询、分析、挖掘和机器学习,从海量数据中提取业务价值

Edit page
Share this post:

Previous Post
大数据系统复习四(完结)
Next Post
大数据系统复习二