You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Ubuntu系统下Java、Hadoop等大数据组件安装顺序解答

Ubuntu 搭建大数据运行环境的软件安装先后顺序

以下顺序按照组件依赖优先级排序,被依赖的底层组件优先安装,能最大程度避免后续部署时报依赖缺失、服务启动失败的问题:

  • 系统基础环境与Apache基础依赖包
    新装完Ubuntu先更新apt源,装齐系统级必备工具:openssh-server(分布式节点免密通信用)、rsync(跨节点文件同步)、wget/curl(下载安装包用)、build-essential(源码编译依赖)、net-tools(查端口、网络配置用),以及Apache开源组件通用的基础运行库(APR、APR-Util、Apache Commons等基础包,也就是清单里提到的Apache类基础软件)。装完这些统一配置主机名、hosts映射、节点间SSH免密登录,把分布式集群的基础网络环境打通。
  • Java运行环境(JDK)
    大数据生态绝大多数组件都是基于JVM开发,是所有上层大数据组件的核心底层依赖,必须最先装。生产环境优先选兼容性最广的JDK8版本,装完全局配置JAVA_HOME、JRE_HOME、CLASSPATH环境变量,执行java -version、javac -version能正常返回版本信息才算配置生效,别漏了配环境变量,不然后面所有组件都会找不到Java路径。
  • MySQL关系型数据库
    上层的Hive、Sqoop、Spark SQL、调度系统、可视化平台都要靠MySQL存元数据和配置信息,必须在这些组件之前部署。装完配置开机自启、root密码、远程访问权限,提前给后续组件建好专用的数据库账号,省得后面初始化元数据的时候反复报连接错误。
  • Hadoop分布式核心
    Hadoop是整个大数据生态的底座:HDFS提供分布式存储,YARN提供统一的集群资源调度,后面几乎所有数据处理、数仓、采集组件都要靠HDFS存文件、靠YARN分计算资源,必须在上层组件之前装完。装完先格式化HDFS,再启动NameNode、DataNode、ResourceManager、NodeManager这些核心服务,确认HDFS的9870端口(Hadoop2.x版本是50070)、YARN的8088端口的WebUI能正常访问,HDFS读写、YARN提交测试任务都正常再往下装。
  • Zookeeper分布式协调服务
    Zookeeper给分布式组件提供主节点选举、配置同步、状态一致性协调的能力,Kafka集群、HDFS高可用、Spark高可用、Flume集群都强依赖Zookeeper,要在这些组件之前部署。装完配好集群节点信息(单机部署配单节点就行),启动服务确认2181端口正常监听,四字命令能正常返回服务状态就算正常。
  • Kafka分布式消息队列
    Kafka目前主流稳定版本还是强依赖Zookeeper做集群协调(新版本的KRaft模式还没在生产环境大规模普及),本身作为消息中间件不依赖其他大数据组件就能独立跑,后面Flume采集的日志、流处理任务的数据源都要对接Kafka,所以放在Zookeeper之后、流处理相关组件之前装。装完启动Broker服务,确认9092端口正常监听,主题创建、消息生产消费测试通过就行。
  • Sqoop数据传输工具
    Sqoop用来做MySQL这类关系型数据库和Hadoop生态(HDFS、Hive、HBase)之间的批量数据导入导出,依赖Hadoop的HDFS、YARN能力,同时需要MySQL的JDBC驱动才能连数据库,所以放在Hadoop、MySQL之后装。装完配好Hadoop路径、JDBC驱动路径,测试数据库连接、数据导入导出任务能正常跑就行。
  • Spark分布式计算引擎
    Spark虽然能跑独立模式,但生产环境基本都是对接YARN做资源调度、对接HDFS存数据,对接Zookeeper做高可用,也能对接Kafka做流数据处理,所以放在Hadoop、Zookeeper、Kafka之后装。装完配置SPARK_HOME环境变量,对接好YARN集群,测试spark-shell本地模式、spark-submit提交任务到YARN都正常再往下。
  • Pig轻量级数据流处理工具
    Pig是面向Hadoop/Spark的脚本化数据处理工具,底层会把Pig Latin脚本转成MapReduce或者Spark任务提交到集群跑,依赖HDFS存数据、依赖Hadoop/Spark做计算引擎,所以放在Hadoop、Spark之后装。装完配好PIG_HOME环境变量,确认Grunt交互shell能正常启动、测试脚本能正常提交到集群运行就行。
  • Hive数据仓库工具
    Hive可以把SQL语句转成MapReduce/Spark/Tez任务在集群跑,依赖HDFS存数据文件、依赖计算引擎跑任务、依赖MySQL存元数据,所以放在Hadoop、Spark、MySQL之后装。装完把元数据连接地址配成之前装好的MySQL,执行元数据初始化脚本,测试hive交互shell能正常连接、SQL能正常提交执行就没问题。
  • Flume日志采集工具
    Flume用来做分布式日志的采集、聚合、传输,最常见的落地目的地是HDFS和Kafka,依赖HDFS做数据持久化、Kafka做消息缓冲,所以放在Hadoop、Kafka之后装。装完配置好source、channel、sink三类组件,测试日志采集、传输、落地全流程正常就完成部署了。

补充说明:如果还要部署HBase、Flink、Oozie、Hue这类扩展组件,按照依赖关系放在对应依赖组件之后即可:比如HBase依赖HDFS、Zookeeper,装完Zookeeper、Hadoop就可以部署;Flink依赖HDFS、YARN、Zookeeper、Kafka,装完Kafka、Spark之后再部署即可。

内容的提问来源于stack exchange,提问作者Moin

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.30 16:27:20