大数据是现代数据驱动型业务的支柱,hadoop已成为处理和分析海量数据集的首选凯发k8国际真人的解决方案。如果你想在 debian 12 系统上利用 hadoop 的强大功能,那么你来对地方了。

在 debian 12 书虫上
第 1 步。在我们安装任何软件之前,通过在终端中运行以下命令来确保您的系统是最新的非常重要:apt
sudo apt update
此命令将刷新存储库,允许您安装最新版本的软件包。
第 2 步。安装 java 开发工具包 (jdk)。
hadoop依赖于java,所以请确保你安装了jdk:
sudo apt install openjdk-11-jdk
使用以下命令验证 java 版本:
java --version
第 3 步。准备 hadoop 环境
在深入研究 hadoop 安装之前,最好为 hadoop 创建一个专用用户并设置必要的目录:
sudo adduser hadoopuser
授予新用户 sudo 权限并将其添加到组中:users
sudo usermod -ag sudo hadoopuser sudo usermod -ag users hadoopuser
第 4 步。在 debian 12 上安装 hadoop。
访问apache hadoop官方网站并下载适合您需求的hadoop发行版。在本指南中,我们将使用 hadoop 3.3.6:
wget https://www.apache.org/dyn/closer.cgi/hadoop/common/hadoop-3.3.6/hadoop-3.3.6-src.tar.gz
通过验证 sha-256 校验和确保下载未损坏:
wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6-src.tar.gz.sha512 sha256sum -c hadoop-3.3.6-src.tar.gz.sha512
接下来,为 hadoop 创建一个目录并提取下载的存档:
sudo mkdir /opt/hadoop sudo tar -xzvf hadoop-3.3.6.tar.gz -c /opt/hadoop --strip-components=1
第5步。配置hadoop。
hadoop的配置对于其正常运行至关重要。让我们深入研究必要的配置。
a. 了解核心 hadoop 配置文件
hadoop 有几个 xml 配置文件,但我们主要关注四个:、 和 。core-site.xmlhdfs-site.xmlyarn-site.xmlmapred-site.xml
b. 编辑核心站点.xml
编辑核心站点.xml配置文件:
sudo nano /opt/hadoop/etc/hadoop/core-site.xml
将以下属性添加到标记:
fs.defaultfs hdfs://localhost:9000
c. 编辑 hdfs 站点.xml
编辑配置文件:hdfs-site.xml
sudo nano /opt/hadoop/etc/hadoop/hdfs-site.xml
add the following properties:
dfs.replication 1
d. 配置纱线站点.xml
编辑配置文件:yarn-site.xml
sudo nano /opt/hadoop/etc/hadoop/yarn-site.xml
添加以下属性:
yarn.nodemanager.aux-services mapreduce_shuffle
e. 配置映射站点.xml
编辑配置文件:mapred-site.xml
sudo nano /opt/hadoop/etc/hadoop/mapred-site.xml
添加以下属性:
mapreduce.framework.name yarn
第 6 步。设置 ssh 身份验证。
hadoop依靠ssh来实现节点之间的安全通信。让我们设置 ssh 密钥。
为 hadoop 用户生成 ssh 密钥:
sudo su - hadoopuser ssh-keygen -t rsa -p ""
将公钥复制到文件:authorized_keys
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
测试与本地主机和其他节点的 ssh 连接:
ssh localhost
步骤 7.格式化 hadoop 分布式文件系统 (hdfs)。
在启动hadoop服务之前,我们需要格式化hadoop分布式文件系统(hdfs)。
初始化 namenode:
hdfs namenode -format
为 hdfs 创建必要的目录:
hdfs dfs -mkdir -p /user/hadoopuser hdfs dfs -chown hadoopuser:hadoopuser /user/hadoopuser
通过浏览位于 的 namenode web 界面来验证 hdfs 状态。http://localhost:9870
第8步。启动 hadoop 服务。
是时候启动hadoop服务了。启动 hadoop namenode 和 datanode:
start-dfs.sh
启动资源管理器和节点管理器:
start-yarn.sh
为确保一切顺利运行,请使用位于 的资源管理器 web 界面检查 hadoop 集群的状态。http://localhost:8088
第9步。运行一个简单的 hadoop 作业。
现在,让我们通过运行一个简单的mapreduce作业来测试我们的hadoop设置。
a. 准备输入数据
创建输入目录并上传示例文本文件:
hdfs dfs -mkdir -p /input hdfs dfs -put /path/to/your/inputfile.txt /input
b. 运行 mapreduce 作业
运行字数统计示例:
hadoop jar /opt/hadoop/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.6.jar wordcount /input /output
c. 监视作业进度
通过访问资源管理器 web 界面来监视作业进度。
第10步。排查常见问题
虽然hadoop功能强大,但它可能具有挑战性。以下是一些常见问题及其凯发k8国际真人的解决方案。
a. 诊断 hadoop 启动问题
- 检查日志中的错误消息。
/opt/hadoop/logs - 确保正确编辑所有配置文件。
b. 调试 hdfs 问题
- 通过浏览 namenode web 界面来验证 hdfs 状态。
- 检查数据目录中的磁盘空间和权限问题。
c. 处理资源分配问题
- 调整纱线站点.xml文件中的资源分配。
- 在资源管理器 web 界面中监视资源使用情况。
感谢您使用本教程在 debian 12 bookworm 上安装最新版本的 apache hadoop。有关其他帮助或有用信息,我们建议您查看。
未经允许不得转载:凯发k8国际真人 » 如何在 debian 12 上安装 apache hadoop