大数据云服务决策指南
了解大数据服务
在数字化转型浪潮中,数据已成为企业核心资产。大数据技术作为挖掘数据价值的关键手段,正在从传统的集中式批处理向实时流处理、交互式分析、智能化决策等多元化方向演进。
华为云大数据服务旨在为企业提供一站式的数据处理、分析与治理能力,帮助用户从海量数据中快速获取洞察,实现数据驱动的业务创新。
华为云大数据云服务主要包括云原生数据湖MRS、数据仓库服务DWS、数据治理中心DataArts Studio、云搜索服务CSS、湖仓构建LakeFormation、智能数据湖 AI DataLake等核心服务。这些云服务相互协同,共同构建了华为云完整的大数据技术栈,涵盖数据采集、存储、处理、分析、搜索全链路能力。
服务层次说明:
- DataArts Studio数据治理中心作为大数据领域的统一开发治理平台,提供数据集成、数据开发、数据质量、数据资产等全链路数据治理能力,是大数据服务的统一入口和协调中枢。
- MRS(数据湖)、DWS(数据仓库)、CSS(搜索服务)、AI DataLake(智能数据湖)等云服务,提供不同场景的数据处理能力。
- LakeFormation(湖仓构建)提供引擎元数据、权限与事务统一管理能力,保障湖内数据和模型自由流转,实现湖、仓、智融合统一。
核心服务的简要概览和定位
数据治理与开发平台DataArts Studio
华为云DataArts Studio是针对企业数字化运营诉求提供的具有数据全生命周期管理和智能数据管理能力的一站式治理运营平台。提供数据集成、数据开发、数据架构、数据质量、数据地图、数据服务、数据安全等全链路数据治理能力,帮助企业快速构建从数据接入到数据分析的端到端智能数据系统,消除数据孤岛、统一数据标准、加快数据变现、实现数字化转型。
DataArts Studio的核心能力包括:
- 数据集成:提供20+简单易用的迁移能力和多种数据源到数据湖的集成能力,全向导式配置和管理,支持单表、整库、增量、周期性数据集成。
- 数据开发:大数据开发环境,降低用户使用大数据的门槛,帮助用户快速构建大数据处理中心。支持数据建模、数据集成、脚本开发、工作流编排等操作,轻松完成整个数据的处理分析流程。
- 数据架构:作为数据治理的一个核心模块,承担数据治理过程中的数据加工并业务化的功能,提供智能数据规划、自定义主题数据模型、统一数据标准、可视化数据建模、标注数据标签等功能,有利于改善数据质量,有效支撑经营决策。
- 数据质量:数据全生命周期管控,数据处理全流程质量监控,异常事件实时通知。
- 数据地图:提供企业级的元数据管理,厘清信息资产。实现数据血缘和数据全景可视,提供数据智能搜索和运营监控。
- 数据服务:提供一站式数据服务开发、测试部署能力,实现数据服务敏捷响应,降低数据获取难度,提升数据消费体验和效率,最终实现数据资产的变现。
- 数据安全:提供数据生命周期内统一的数据使用保护能力。通过访问权限管理、敏感数据识别、隐私保护管理等措施,帮助用户建立安全预警机制,增强整体安全防护能力,让数据可用不可得和安全合规。
云原生数据湖MRS
华为云 MRS(MapReduce Service)是基于开源 Hadoop、Spark生态构建的托管式大数据集群服务,提供海量数据的存储、计算与分析能力。MRS兼容开源大数据组件接口,支持集群一键部署、弹性伸缩、自动备份、监控告警等运维能力,大幅降低 Hadoop/Spark集群的部署与运维复杂度。
MRS适用于离线数仓、实时分析、湖仓一体、日志分析、数据挖掘等大数据场景。
MRS的核心特点包括:
- 一键部署:分钟级创建集群,支持Hadoop、Spark、HBase、Kafka、Flink等多种组件组合与规格配置。
- 高性能分析:自研Superior调度器,支持大集群,实现PB级数据秒级响应。
- 湖仓一体:支持批流融合、存算分离,统一资源调度,数据不出湖即可完成多维分析。
- 安全可靠:支持Kerberos认证、RBAC权限控制、表/列级加密,保障业务稳定运行。
云数据仓库DWS
数据仓库服务 DWS是一种基于华为云基础架构和平台的在线数据分析处理数据库,提供即开即用、可扩展且完全托管的分析型数据库服务,兼容ANSI/ISO标准的SQL92、SQL99和SQL 2003语法,同时兼容PostgreSQL/Oracle/Teradata/MySQL等数据库生态,为各行业PB级海量大数据分析提供有竞争力的解决方案。
DWS提供存算一体、存算分离多种产品形态,围绕企业级内核、实时分析、协同计算、融合分析、云原生五大方向构筑业界领先数据仓库。
- 存算一体:面向数据分析场景,为用户提供高性能、高扩展、高可靠、高安全、易运维的企业级数仓服务,支持PB级超大规模数据分析能力,适用于“库、仓、市、湖”一体化的融合分析业务。
- 存算分离:采用存算分离云原生架构,计算、存储分层弹性伸缩,极致性价比,采用虚拟仓库共享存储技术,实现不同负载的计算隔离和并发扩展。
DWS可广泛应用于金融、车联网、政企、电商、能源、电信等多个领域,已连续两年入选Gartner发布的数据管理解决方案魔力象限,相比传统数据仓库,性价比提升数倍,具备大规模扩展能力和企业级可靠性。
DWS的核心特点包括:
- 易使用:一站式可视化便捷管理,与大数据其他服务无缝集成,支持异构数据库迁移。
- 高性能:DWS通过算子并行执行、向量化执行引擎实现高性能查询,万亿数据秒级响应。
- 易扩展:支持在线扩容、升级,支持计算节点弹性伸缩。
- 高可靠:分布式事务支持ACID特性,数据强一致性,集群的协调节点(CN)、数据节点(DN)等逻辑组件全方位HA设计,支持集群级/细粒度级备份恢复,支持跨Region容灾等。
- 低成本:按需付费,门槛低,即开即用。
云搜索服务CSS
华为云CSS(Cloud Search Service)是基于开源Elasticsearch、OpenSearch和Logstash构建的托管搜索服务,提供全文检索、日志分析、安全审计等能力。CSS兼容Elasticsearch API和OpenSearch API,支持集群一键部署、自动备份、监控告警等运维能力,大幅降低Elasticsearch/OpenSearch集群的运维复杂度。CSS适用于全文搜索、日志分析、安全审计、向量检索、语义检索等场景。
CSS的核心特点包括:
- 生态兼容:兼容原生Elasticsearch/OpenSearch语法,无需更改既有开发习惯。支持Python、Java、Go等主流语言SDK,并能与Kibana、Dashboards、Logstash等组件对接。
- 一键部署:分钟级创建集群,支持多种规格配置。
- 高性能检索:支持倒排索引和分词搜索,提供毫秒级响应。
- 内核增强:在开源内核基础上,集成了存算分离、大查询隔离及导入性能增强等一系列增强特性,提升集群的性能和稳定性、降低成本。
- 日志分析:支持ELK日志分析架构,提供日志采集、存储、检索、可视化一站式能力。
- 向量数据库:基于自主研发的向量搜索引擎,面向图像、视频、语料等非结构化数据的特征向量检索场景,提供高性能、高精度的最近邻或近似近邻检索服务。
- 安全合规:提供用户认证、访问控制、审计日志等安全能力。
智能数据湖 AI DataLake
智能数据湖(AI DataLake)是华为云构建的企业级多模态智能数据分析与管理平台,为您提供构建AI时代数据基础设施的完整能力。提供多模数据引擎Aura、AI计算引擎Ray、批处理引擎Spark和流处理引擎Flink四大核心计算引擎,聚焦多模数据处理、异构算力混合调度,开放湖仓处理,构建新一代多模湖仓架构,促进Data+AI协同创新。
AI DataLake以工作空间为载体,采用数据、资源、引擎三层解耦架构实现灵活高效的企业级数据管理:
- 数据与引擎解耦:所有引擎共享同一份数据,通过多模数据管理平台统一治理数据资产,避免数据孤岛和数据冗余,确保数据一致性。
- 资源与引擎解耦:支持多引擎共用资源池,细粒度管理通算、智算资源,通过资源的灵活配置和调度,提升资源利用率。
- 资源与数据解耦:数据跨智算与通算资源流通,灵活支撑交互式分析、多模分析、批处理、实时计算、AI计算等多样化数据业务场景。
湖仓构建 LakeFormation
华为云 LakeFormation是基于存算分离架构构建的企业级一站式数据湖构建与运营服务,提供数据湖元数据统一管理的可视化界面与 API。
LakeFormation兼容Hive元数据模型与Ranger权限模型,可无缝对接MRS、DWS、AI DataLake等华为云大数据服务,助力用户高效构建数据湖、释放数据价值,大幅降低数据湖建设与运营的复杂度。
LakeFormation适用于数据湖建设、湖仓一体分析、跨服务数据共享、元数据统一管理等场景。
LakeFormation 的核心特点包括:
- 统一元数据管理:支持Catalog、数据库、表、函数等元数据对象集中管理,实现跨引擎元数据互通。
- 细粒度权限管控:兼容Ranger权限模型,支持库、表、列级权限控制,一次授权跨服务生效,保障数据安全共享。
- Serverless高可靠:通过底层资源实现跨AZ部署及高可靠、弹性伸缩、元数据统一管理、元数据与文件目录联动授权、对接多计算引擎等功能。
- 开放生态融合:无缝对接MRS、DWS等服务,支持存量元数据平滑迁移,加速湖仓一体与数智融合落地。
明确关键决策维度
在选择大数据领域云服务时,需要根据业务场景、技术架构、成本规划、安全合规等多个维度进行综合考量。
以下是选择大数据服务时建议考虑的核心决策维度:
- 业务场景维度
- 数据处理模式:提前梳理业务核心数据处理诉求,区分批处理、流处理、交互式分析、检索搜索、多模数据处理等场景。批处理通常面向周期性离线计算,典型场景为日报、月度经营报表生成;流处理面向低延迟实时计算,典型场景包含实时指标监控、个性化实时推荐;交互式分析面向即时自助查询,多用于多维BI看板、业务自助探查;检索搜索面向海量数据快速全文/多条件检索,覆盖运维日志检索、商品模糊检索、用户行为检索等场景;多模数据处理面向异构混合数据统一治理与计算,可支撑结构化表、文本、图片、音频、视频、时序物联网数据融合分析。
- 数据规模:评估数据量级和增长预期。
- 时效性要求:明确数据处理的时效要求。例如实时处理可考虑选择MRS Flink流计算或DWS实时数仓;离线批处理(小时/天级)可考虑选择MRS批处理作业。
- 技术架构维度
- 存算分离 vs 存算一体:存算分离架构支持独立扩展存储和计算资源,资源利用率更高,适合弹性业务;存算一体架构性能更高,适合对延迟敏感的场景。
- 开源兼容 vs 闭源优化:开源兼容方案(如MRS)便于迁移和定制业务应用;闭源优化方案能提供更好的性能和稳定性。
- 半托管服务 vs 全托管服务:半托管支持自主管控集群底层能力,满足定制化场景;全托管免去集群运维负担,成本更低,适合快速落地业务。
- 成本规划维度
- 计费模式:根据业务负载特征选择包年包月或按需计费。稳定负载建议包年包月,波动负载建议按需或Serverless模式。
- 资源利用率:评估资源使用率,选择能够充分利用资源的方案。存算分离、Serverless等模式可以显著提升资源利用率。
- 数据传输成本:考虑数据流入流出、云间数据传输的成本,选择数据就近部署方案。
- 安全合规维度
- 数据安全:评估数据敏感程度,选择满足安全要求的方案。关注数据加密、访问控制、审计日志等安全能力。
- 合规要求:根据行业合规要求选择服务。
- 数据驻留:根据数据驻留要求选择合适的区域和部署方式。
选择适合您的服务
华为云大数据领域提供了完整的产品矩阵,覆盖数据存储、数据处理、数据分析、数据治理、数据搜索等全链路能力。
在选择具体服务时,建议您:
- 明确业务场景:首先明确核心业务需求是数据治理、实时分析、大数据处理还是搜索场景。
- 评估数据规模:根据数据量级选择合适的服务组合。
- 考虑成本因素:评估业务负载特征,选择包年包月、按需或Serverless等合适的计费模式。
- 关注安全合规:根据数据安全要求和行业合规要求选择满足要求的服务配置。
通过合理选择和组合华为云大数据服务,您可以快速构建满足业务需求的大数据平台,释放数据价值,驱动业务创新。
根据上述决策维度,以下是各核心服务的详细对比:
| 评估维度 | MRS | DWS | DataArts Studio | CSS | AI DataLake |
|---|---|---|---|---|---|
| 核心定位 | 大数据处理平台 | OLAP高性能数据仓库 | 数据治理开发平台 | 在线分布式搜索服务 | 智能数据湖 |
| 主要数据处理场景 | 批处理、流处理 | 实时BI、分析查询 | 数据集成、开发与治理 | 交互式分析、全文搜索、日志分析 | 数据挖掘、数据分析 |
| 数据规模 | TB-PB级(存算一体模式) | TB-PB级(存算一体模式) | 不直接存储业务数据 | GB-PB级(存算一体模式) | 不直接存储业务数据 |
| 业务数据存储模式 |
|
| 不直接存储业务数据,通过对接存储、数据库、大数据服务,进行数据集成、开发与治理。 | 本地存储+对象存储OBS | 不直接存储业务数据。 |
| 计费模式 | 包年包月/按需 | 包年包月/按需 | 包年包月 | 包年包月/按需 | 按需 |
| 典型场景 | 数据湖、机器学习、实时分析 | BI报表、实时分析、实时写入 | 数据集成、数据中台、数据治理 | 全文搜索、日志分析、知识库问答、个性化推荐、向量检索、语义检索 | 多模数据处理、互联网应用音频数据加工 |
| 典型场景 | 推荐服务组合 | 说明 |
|---|---|---|
| 大数据平台上云 | MRS + DataArts Studio | 快速将自建大数据平台平滑搬迁上云或将其他大数据云服务平台平滑迁移至MRS,并基于云上环境快速构建云下系统,满足客户未来业务快速增长需求。 |
| 全栈数仓平台上云 | DWS + DataArts Studio | 整合数据资源,构建大数据平台,发现数据价值,成为企业经营的新趋势和迫切诉求。DWS Express可直接对存储在对象存储OBS上的大数据平台中集成和处理后的数据进行分析。 |
| 数据中台建设 | MRS + DWS + DataArts Studio | 企业积累的海量数据及各种数据资产,体量庞大,需高性能大数据平台支撑进行全量数据分析和挖掘。覆盖数据采集、存储、处理、分析、搜索全链路。 |
| 日志分析与运维监控 | CSS + 分布式消息服务 | 用于全场景日志分析,包括ELB日志、服务器日志、容器和应用日志,分布式消息服务提供数据接入。 |
| 多模态数据处理 | AI DataLake + LakeFormation + DataArts Studio | 高效处理海量多模数据、最大化异构算力使用率、降低中间数据存储成本,AI DataLake使用Aura多模数据处理引擎提供一站式多模态数据分析的解决方案,实现降本增效。 |
快速入门与实践
您可以通过以下指引快速上手实操华为云大数据服务。
- DataArts Studio快速入门:基于DLI的电商BI报表数据开发流程
通过此教程,您将学习到数据开发模块脚本编辑、作业编辑、作业调度等功能。
- DataArts Studio快速入门:基于DWS的电影评分数据集成与开发流程
通过此教程,您将学习到数据集成模块的数据迁移和数据开发模块的脚本开发、作业开发、作业调度等功能。
- DataArts Studio快速入门:基于MRS Hive的出租车出行的数据治理流程
通过此教程,您将学习到如何在DataArts Studio平台完成端到端的全流程数据运营。
- DataArts Studio最佳实践:通过数据质量对比数据迁移前后结果
以DWS数据迁移到MRS Hive分区表为例,介绍如何通过DataArts Studio中的数据质量模块实现数据迁移前后的一致性校验。
- DataArts Studio最佳实践:数据开发作业告警实践
通过配置作业节点失败重试及失败告警,尽量减少在集群压力峰值时的作业无法正常运行的情况,即使发生失败也可以及时通知到运维管理人员解决,减少故障升级情况。
- MRS快速入门:快速创建和使用Hadoop离线数据分析集群
通过此教程,您将学会如何创建Hadoop离线数据分析集群并通过集群客户端提交一个wordcount作业,实现经典的大数据WordCount统计。
- MRS快速入门:快速创建和使用Kafka流式数据处理集群
通过此教程,您将学会如何创建Kafka流式分析集群并在Kafka主题中产生和消费消息的操作指导。
- MRS快速入门:快速创建和使用ClickHouse列式数据库集群
通过此教程,您将学会如何创建ClickHouse集群并通过集群客户端进行ClickHouse表的创建与查询操作指导。
- MRS最佳实践:集群选型建议
当您创建MRS集群时,面对多种配置选项难以选择,此文档从业务场景、规模、性能、成本等维度给出选型建议。
- MRS最佳实践:数据迁移
使用CDM服务迁移Hadoop数据至MRS集群,CDM围绕大数据迁移上云和智能数据湖解决方案,提供了简单易用的迁移能力和多种数据源到数据湖的集成能力,降低了客户数据源迁移和集成的复杂性,有效地提高您数据迁移和集成的效率。
- MRS最佳实践:集群存算分离配置
MRS支持用户将业务数据存储在OBS文件系统中,MRS集群仅用于数据计算处理的存算分离模式,从而实现按需灵活扩展资源、提供低成本的海量数据分析方案。
- DWS快速入门:创建数据仓库集群
通过此教程,您将学会如何创建DWS集群、连接数据库、创建表并执行查询。
- DWS快速入门:数据开发SQL入门
通过此教程,您将学会基本的SQL语法。
- DWS最佳实践:表类型选择
在业务开发前选择合适的表类型以提高开发效率和查询性能。
- DWS最佳实践:性能优化
介绍SQL优化、存储优化、并发优化等性能调优方法。
- DWS最佳实践:数据迁移指南
介绍从Oracle、MySQL、ADB等数据库迁移到DWS的最佳实践。
- CSS快速入门:使用Elasticsearch搜索数据
通过此教程,您将学会如何创建CSS集群、创建索引、导入数据和执行搜索查询。
- CSS快速入门:使用Elasticsearch实现向量检索
通过此教程,您将学会如何创建向量数据库、存储数据和向量检索。
- CSS最佳实践:Elasticsearch数据迁移
介绍不同来源的Elasticsearch迁移到CSS服务的方案。
- CSS最佳实践:使用Logstash将Kafka数据接入Elasticsearch
介绍通过Logstash实现将Kafka数据高效接入Elasticsearch的方法。
- AI DataLake快速入门:基于用户自定义镜像的多模数据处理
通过此教程,您将学会从零开始创建AI DataLake计算资源池、配置Aura类型的端点、通过DataArts Studio提交作业分析数据。
- AI DataLake快速入门:基于Aura DataFrame的多模数据处理
通过此教程,您将学会在AI DataLake使用多模数据引擎Aura和DataArts Notebook交互式地完成数据的处理与分析的操作。
- AI DataLake快速入门:基于Ray Data的数据处理
通过创建计算资源池、配置Ray类型的端点、连接数据、使用API提交作业为例,演示通过AI DataLake分析数据的操作指导。
- AI DataLake快速入门:基于PySpark的数据处理
通过创建AI DataLake Spark引擎端点并使用API提交作业为例,演示通过AI DataLake分析数据的操作指导。
- LakeFormation快速入门:创建LakeFormation实例并规划元数据
通过此教程,您将学会从零开始创建LakeFormation实例,并为实例创建Catalog及内部的数据库、表等元数据的操作指导。
- LakeFormation快速入门:为LakeFormation角色授予操作Catalog的权限
通过此教程,您将学会创建LakeFormation角色,对角色授予修改Catalog、创建数据库的权限。
- LakeFormation最佳实践:配置LakeFormation对接开源Spark
介绍LakeFormation直接对接社区版Spark组件的方案。
- LakeFormation最佳实践:配置LakeFormation对接开源Hive组件
介绍LakeFormation直接对接社区版Hive组件的方案。
- LakeFormation最佳实践:配置LakeFormation对接MRS集群
介绍LakeFormation实例与MRS集群对接,实现统一的数据湖元数据及权限管理。