概览
HiDataPlus (HDP)
HiDataPlus 是一个由国内熟悉开源大数据软件的团队构建的免费 Hadoop 集成发行版。由于 Cloudera 与 Hortonworks 合并后,原 HDP 版本不再免费更新,HiDataPlus 应运而生,持续跟进社区新版组件,完全免费使用。
安装包下载
下面是通过网盘分享的 HiDataPlus 安装包(主要用于部署 HDP 3.3.2 版本):
链接: https://pan.baidu.com/s/1_Hnd5n6WdTwiLeo1U51jUg 提取码:
vkfb——来自百度网盘超级会员 v8 的分享
官方介绍文档
- 官网快速开始 / 组件介绍 / 安装与运维文档入口:http://www.hdp.link/docs/intro
- 该文档主要内容:对 HiDataPlus HDP 发行版中可通过 Ambari 勾选安装的所有组件分别做「用途介绍 + 安装配置 + 使用指南 + 参数说明」。比如 HDFS/YARN/Hive/HBase/Spark/Atlas/Kafka/Ranger/ZooKeeper/Grafana/Infra Solr/Oozie/Zeppelin 等每个组件在官网 intro 里都有对应章节。
- 如果本分类的部署文档有遗漏的组件细节(例如具体调优参数、Kerberos 配置、Ranger 策略细节),建议到官网 intro 做交叉对照。
核心特性
- 基于开源社区的免费集成版本:所有组件均基于 Apache 开源版集成,免费使用,持续与社区最新版本保持同步。
- 使用 Apache Ambari 管理大数据组件:沿用 Ambari 作为集群管理 UI,自主集成了 Ambari Stack,保留原有使用习惯,老用户零学习成本。
- 广泛覆盖操作系统与 CPU 架构:
- 操作系统:Redhat、CentOS、银河麒麟、欧拉(openEuler)、龙蜥(Anolis)、Ubuntu
- CPU 架构:x86_64、c86(海光 / 兆芯)、aarch64(ARM64 / 鲲鹏 / 飞腾)
本文档针对版本
本分类下的部署文档主要基于 HiDataPlus HDP 3.3.2 版本编写。
HDP 3.3.2 可安装组件速览(与官网 intro 对齐)
下面是 HiDataPlus HDP 3.3.2 发行版中通过 Ambari 可一键勾选的常用组件,以及它们的主要作用、和你这 4 台集群(master1/master2/node1/node2)对应适合的部署位置。你在 Ambari 向导「Stack & Services」勾选组件时,可以按需参考下面勾选。
| 大类 | 组件名(Ambari 显示名) | 中文别名 | 主要作用 | 你当前 4 台集群建议部署 |
|---|---|---|---|---|
| 分布式存储 | HDFS | Hadoop 分布式文件系统 | 存所有离线/实时数据,按块冗余 3 副本存到多台 DataNode,支持 PB 级 | NameNode:master1+master2(HA) DataNode:node1/node2(master 也可兼任) |
| 资源调度 | YARN (MapReduce2、Tez) | 资源管理/作业调度 | 给 Spark/Flink/Hive/MapReduce 作业分配 CPU + 内存容器,统一调度集群资源 | ResourceManager:master1+master2(HA) NodeManager:所有 DataNode 节点 |
| 数据仓库 SQL | Hive(Hive Metastore、HiveServer2) | 数仓 SQL 引擎 | 把结构化数据映射成「表」,用 HQL(类 SQL)做离线 ETL/报表分析;Metastore 存元数据(表结构/分区/路径) | Metastore + HS2:master1 WebHCat:master1 或不装 |
| 分布式 NoSQL | HBase + Phoenix | 海量 KV / 宽表数据库 | 支持亿级行、百万级并发的随机读写(不像 HDFS 只能顺序读写),适合订单、画像标签、监控明细 | HMaster:master1/master2 RegionServer:node1/node2 Phoenix:Client 全勾 |
| 实时计算 | Spark2 / Spark Thrift Server | Spark 批/流计算 + JDBC | Spark SQL 替代 Hive 做离线加速(快 5~10 倍);Spark Streaming 做准实时;Thrift Server 让 BI 工具直连 Spark | Spark History:master1 Thrift Server:master1 或 master2 Client:全勾 |
| 分布式协调 | ZooKeeper(ZK) | 分布式锁/注册中心 | 所有依赖 HA、选主、分布式锁的组件都靠它(HDFS HA、YARN HA、HBase、Kafka、Hive、Solr) | 至少 3 台奇数节点:master1/master2/node1 |
| 消息队列 | Kafka | 高吞吐发布订阅消息队列 | 解耦生产者/消费者、做 CDC 数据同步、行为日志上报、实时数仓 ODS 层缓冲 | Broker:node1/node2(或者 3 台都上) |
| 数据同步工具 | Sqoop | RDBMS ↔ HDFS/Hive 批量导入导出 | 把 Oracle/MySQL 整表抽到 Hive,或把 Hive 结果回写关系库 | Client:master1 |
| Flume | 日志采集/汇聚 | 采集服务器/应用日志、按规则写入 HDFS/HBase/Kafka | Agent 放在需要采集日志的机器 | |
| 元数据管理 | Atlas(强依赖 HBase + Solr + ZK) | 数据治理/元数据/血缘 | 自动采集 Hive/Spark/HBase 的表、字段、分类标签、字段级血缘(A 表 → B 表跑了哪些 SQL),做数据资产盘点和合规审计 | Atlas Server:master1 依赖:需要前面勾了 HBase + Infra Solr + ZooKeeper |
| 权限管控 | Ranger + Ranger KMS(可选) | 细粒度权限 + 密钥管理 | 给 HDFS/Hive/HBase/Kafka/Solr 做 行/列/标签级权限(比如只让财务组看金额列);KMS 做 HDFS 透明加密 | Admin:master1 User Sync:master1 |
| 统一认证 | Kerberos(可选,Ambari 单独启用) | 身份认证 | 所有组件走 Kerberos Ticket 登录,避免「Hive 只要知道用户名就能写全库」的安全漏洞 | KDC:master1 或独立服务器 |
| 调度系统 | Oozie | 定时工作流调度 | 编排 Shell/Hive/Spark/Sqoop 任务,按 DAG 依赖 + 时间触发(功能老但稳,推荐 DolphinScheduler 替换) | Oozie Server:master1 DB:MySQL 的 oozie 库 |
| SQL 笔记本 | Zeppelin | 交互 SQL/Scala Notebook | 浏览器里写一段 HQL / Scala Spark / Markdown,直接跑结果,适合探索性分析 | Server:master1 |
| 数据可视化 BI | Ambari 自带 Grafana(依赖 AMS) | 大盘/仪表盘 | 由 Ambari Metrics 提供数据的预置大盘:主机 CPU/内存、HDFS/YARN/HBase 指标等;跟 AMS 强绑定 | Grafana:master1 配套:Ambari Metrics Collector |
| 全文索引服务 | Infra Solr | Ambari 自带的 SolrCloud | Atlas 做全文搜索、Ranger 审计日志、Log Search 日志检索,底层都走它 | 3 台节点随 ZK 同机部署:master1/master2/node1 |
| Ambari 自带监控 | Ambari Metrics(AMS,3 个角色) | Ambari 原生监控体系 | Metrics Collector(接收指标)+ Embedded HBase(存时序)+ Metrics Monitor(每台采集主机/进程指标)+ Ambari Grafana(画图) | Collector:master1 Monitor:所有 4 台 如果不打算重度用可以删掉(见常见问题) |
| 日志检索 | Log Search(依赖 Infra Solr) | 集中化日志平台 | 把 HDFS/YARN/Hive/HBase 等组件的 /var/log/*/ 日志聚合到 Solr,按级别/关键字/主机搜,比一台台 tail 方便 | Log Search Server:master1 |
| Ambari 辅助 | SmartSense / Ambari Infra | 运维辅助 / 公共依赖 | SmartSense 是 Cloudera 式的配置分析工具(可跳过);Ambari Infra 是 Infra Solr / Ranger / Atlas / Log Search 等的公共基础设施 | Infra 跟着依赖组件一起装,SmartSense 可勾可不勾 |
| 机器学习(选装) | Mahout / Spark MLlib | 机器学习算法库 | 推荐、分类、聚类、回归等传统 ML 算法(现一般用外部 Python MLFlow,HDP 里偶尔用) | Client 勾 master1 + Spark2 Client,MLlib 一般不用单独部署服务 |