跳到主要内容

概览

HiDataPlus (HDP)

HiDataPlus 是一个由国内熟悉开源大数据软件的团队构建的免费 Hadoop 集成发行版。由于 Cloudera 与 Hortonworks 合并后,原 HDP 版本不再免费更新,HiDataPlus 应运而生,持续跟进社区新版组件,完全免费使用

安装包下载

下面是通过网盘分享的 HiDataPlus 安装包(主要用于部署 HDP 3.3.2 版本):

链接: https://pan.baidu.com/s/1_Hnd5n6WdTwiLeo1U51jUg 提取码: vkfb

——来自百度网盘超级会员 v8 的分享

官方介绍文档

  • 官网快速开始 / 组件介绍 / 安装与运维文档入口:http://www.hdp.link/docs/intro
    • 该文档主要内容:对 HiDataPlus HDP 发行版中可通过 Ambari 勾选安装的所有组件分别做「用途介绍 + 安装配置 + 使用指南 + 参数说明」。比如 HDFS/YARN/Hive/HBase/Spark/Atlas/Kafka/Ranger/ZooKeeper/Grafana/Infra Solr/Oozie/Zeppelin 等每个组件在官网 intro 里都有对应章节。
    • 如果本分类的部署文档有遗漏的组件细节(例如具体调优参数、Kerberos 配置、Ranger 策略细节),建议到官网 intro 做交叉对照。

核心特性

  • 基于开源社区的免费集成版本:所有组件均基于 Apache 开源版集成,免费使用,持续与社区最新版本保持同步。
  • 使用 Apache Ambari 管理大数据组件:沿用 Ambari 作为集群管理 UI,自主集成了 Ambari Stack,保留原有使用习惯,老用户零学习成本。
  • 广泛覆盖操作系统与 CPU 架构
    • 操作系统:Redhat、CentOS、银河麒麟、欧拉(openEuler)、龙蜥(Anolis)、Ubuntu
    • CPU 架构:x86_64、c86(海光 / 兆芯)、aarch64(ARM64 / 鲲鹏 / 飞腾)

本文档针对版本

本分类下的部署文档主要基于 HiDataPlus HDP 3.3.2 版本编写。

HDP 3.3.2 可安装组件速览(与官网 intro 对齐)

下面是 HiDataPlus HDP 3.3.2 发行版中通过 Ambari 可一键勾选的常用组件,以及它们的主要作用、和你这 4 台集群(master1/master2/node1/node2)对应适合的部署位置。你在 Ambari 向导「Stack & Services」勾选组件时,可以按需参考下面勾选。

大类组件名(Ambari 显示名)中文别名主要作用你当前 4 台集群建议部署
分布式存储HDFSHadoop 分布式文件系统存所有离线/实时数据,按块冗余 3 副本存到多台 DataNode,支持 PB 级NameNode:master1+master2(HA)
DataNode:node1/node2(master 也可兼任)
资源调度YARN (MapReduce2、Tez)资源管理/作业调度给 Spark/Flink/Hive/MapReduce 作业分配 CPU + 内存容器,统一调度集群资源ResourceManager:master1+master2(HA)
NodeManager:所有 DataNode 节点
数据仓库 SQLHive(Hive Metastore、HiveServer2)数仓 SQL 引擎把结构化数据映射成「表」,用 HQL(类 SQL)做离线 ETL/报表分析;Metastore 存元数据(表结构/分区/路径)Metastore + HS2:master1
WebHCat:master1 或不装
分布式 NoSQLHBase + Phoenix海量 KV / 宽表数据库支持亿级行、百万级并发的随机读写(不像 HDFS 只能顺序读写),适合订单、画像标签、监控明细HMaster:master1/master2
RegionServer:node1/node2
Phoenix:Client 全勾
实时计算Spark2 / Spark Thrift ServerSpark 批/流计算 + JDBCSpark SQL 替代 Hive 做离线加速(快 5~10 倍);Spark Streaming 做准实时;Thrift Server 让 BI 工具直连 SparkSpark History:master1
Thrift Server:master1 或 master2
Client:全勾
分布式协调ZooKeeper(ZK)分布式锁/注册中心所有依赖 HA、选主、分布式锁的组件都靠它(HDFS HA、YARN HA、HBase、Kafka、Hive、Solr)至少 3 台奇数节点:master1/master2/node1
消息队列Kafka高吞吐发布订阅消息队列解耦生产者/消费者、做 CDC 数据同步、行为日志上报、实时数仓 ODS 层缓冲Broker:node1/node2(或者 3 台都上)
数据同步工具SqoopRDBMS ↔ HDFS/Hive 批量导入导出把 Oracle/MySQL 整表抽到 Hive,或把 Hive 结果回写关系库Client:master1
Flume日志采集/汇聚采集服务器/应用日志、按规则写入 HDFS/HBase/KafkaAgent 放在需要采集日志的机器
元数据管理Atlas(强依赖 HBase + Solr + ZK)数据治理/元数据/血缘自动采集 Hive/Spark/HBase 的表、字段、分类标签、字段级血缘(A 表 → B 表跑了哪些 SQL),做数据资产盘点和合规审计Atlas Server:master1
依赖:需要前面勾了 HBase + Infra Solr + ZooKeeper
权限管控Ranger + Ranger KMS(可选)细粒度权限 + 密钥管理给 HDFS/Hive/HBase/Kafka/Solr 做 行/列/标签级权限(比如只让财务组看金额列);KMS 做 HDFS 透明加密Admin:master1
User Sync:master1
统一认证Kerberos(可选,Ambari 单独启用)身份认证所有组件走 Kerberos Ticket 登录,避免「Hive 只要知道用户名就能写全库」的安全漏洞KDC:master1 或独立服务器
调度系统Oozie定时工作流调度编排 Shell/Hive/Spark/Sqoop 任务,按 DAG 依赖 + 时间触发(功能老但稳,推荐 DolphinScheduler 替换)Oozie Server:master1
DB:MySQL 的 oozie 库
SQL 笔记本Zeppelin交互 SQL/Scala Notebook浏览器里写一段 HQL / Scala Spark / Markdown,直接跑结果,适合探索性分析Server:master1
数据可视化 BIAmbari 自带 Grafana(依赖 AMS)大盘/仪表盘由 Ambari Metrics 提供数据的预置大盘:主机 CPU/内存、HDFS/YARN/HBase 指标等;跟 AMS 强绑定Grafana:master1
配套:Ambari Metrics Collector
全文索引服务Infra SolrAmbari 自带的 SolrCloudAtlas 做全文搜索、Ranger 审计日志、Log Search 日志检索,底层都走它3 台节点随 ZK 同机部署:master1/master2/node1
Ambari 自带监控Ambari Metrics(AMS,3 个角色)Ambari 原生监控体系Metrics Collector(接收指标)+ Embedded HBase(存时序)+ Metrics Monitor(每台采集主机/进程指标)+ Ambari Grafana(画图)Collector:master1
Monitor:所有 4 台
如果不打算重度用可以删掉(见常见问题)
日志检索Log Search(依赖 Infra Solr)集中化日志平台把 HDFS/YARN/Hive/HBase 等组件的 /var/log/*/ 日志聚合到 Solr,按级别/关键字/主机搜,比一台台 tail 方便Log Search Server:master1
Ambari 辅助SmartSense / Ambari Infra运维辅助 / 公共依赖SmartSense 是 Cloudera 式的配置分析工具(可跳过);Ambari Infra 是 Infra Solr / Ranger / Atlas / Log Search 等的公共基础设施Infra 跟着依赖组件一起装,SmartSense 可勾可不勾
机器学习(选装)Mahout / Spark MLlib机器学习算法库推荐、分类、聚类、回归等传统 ML 算法(现一般用外部 Python MLFlow,HDP 里偶尔用)Client 勾 master1 + Spark2 Client,MLlib 一般不用单独部署服务