0% encontró este documento útil (0 votos)
3 vistas6 páginas

Guía de instalación de Hadoop y herramientas

El documento proporciona una guía paso a paso para instalar y configurar Hadoop, Hive y Pig en un sistema operativo basado en Linux. Incluye instrucciones para actualizar el sistema, crear un usuario, instalar Java, descargar e instalar Hadoop, y configurar los archivos necesarios. Finalmente, se detallan los pasos para instalar Hive y Pig, completando así la configuración del entorno de Big Data.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
3 vistas6 páginas

Guía de instalación de Hadoop y herramientas

El documento proporciona una guía paso a paso para instalar y configurar Hadoop, Hive y Pig en un sistema operativo basado en Linux. Incluye instrucciones para actualizar el sistema, crear un usuario, instalar Java, descargar e instalar Hadoop, y configurar los archivos necesarios. Finalmente, se detallan los pasos para instalar Hive y Pig, completando así la configuración del entorno de Big Data.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd

🟨 PASO 0: ACTUALIZAR EL SISTEMA

Abre una terminal y actualiza tu sistema operativo:

bash
CopiarEditar
sudo apt update && sudo apt upgrade -y

🟨 PASO 1: CREAR UN USUARIO NUEVO (NO


ROOT) PARA HADOOP
Este usuario evitará problemas al ejecutar Hadoop.

bash
CopiarEditar
sudo adduser hadoopuser

Sigue los pasos para crearle una contraseña y datos básicos.

Luego, dale permisos de sudo (para usar comandos administrativos):

bash
CopiarEditar
sudo usermod -aG sudo hadoopuser

✅ IMPORTANTE: Desde este punto, ¡usa este usuario para todo lo demás! Cambia a
él con:

bash
CopiarEditar
su - hadoopuser

🟨 PASO 2: INSTALAR JAVA 11


Hadoop necesita Java.

bash
CopiarEditar
sudo apt install openjdk-11-jdk -y

Verifica que se instaló bien:

bash
CopiarEditar
java -version

Deberías ver algo como:


openjdk version "11.0.22" (o parecido)
Ahora configura las variables de entorno para Java:

bash
CopiarEditar
echo "export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64" >>
~/.bashrc
echo "export PATH=\$PATH:\$JAVA_HOME/bin" >> ~/.bashrc
source ~/.bashrc

🟨 PASO 3: INSTALAR HADOOP


3.1 Descargar y descomprimir Hadoop:
bash
CopiarEditar
wget [Link]
[Link]
tar -xzf [Link]
sudo mv hadoop-3.3.6 /usr/local/hadoop
sudo chown -R hadoopuser:hadoopuser /usr/local/hadoop

3.2 Agregar las variables de entorno de Hadoop:


bash
CopiarEditar
echo "export HADOOP_HOME=/usr/local/hadoop" >> ~/.bashrc
echo "export HADOOP_CONF_DIR=\$HADOOP_HOME/etc/hadoop" >> ~/.bashrc
echo "export PATH=\$PATH:\$HADOOP_HOME/bin:\$HADOOP_HOME/sbin" >>
~/.bashrc
source ~/.bashrc

🟨 PASO 4: CONFIGURAR HADOOP


4.1 Editar archivo [Link]
bash
CopiarEditar
nano /usr/local/hadoop/etc/hadoop/[Link]

🔽 Al final del archivo, agrega esto:

bash
CopiarEditar
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
export HDFS_NAMENODE_USER=hadoopuser
export HDFS_DATANODE_USER=hadoopuser
export HDFS_SECONDARYNAMENODE_USER=hadoopuser

Guarda y cierra (Ctrl+O, Enter, Ctrl+X)


4.2 Configurar [Link]
bash
CopiarEditar
nano /usr/local/hadoop/etc/hadoop/[Link]

🔽 Reemplaza el contenido entre <configuration> con esto:

xml
CopiarEditar
<configuration>
<property>
<name>[Link]</name>
<value>hdfs://localhost:9000</value>
</property>
</configuration>

4.3 Configurar [Link]


bash
CopiarEditar
nano /usr/local/hadoop/etc/hadoop/[Link]

🔽 Reemplaza el contenido con esto:

xml
CopiarEditar
<configuration>
<property>
<name>[Link]</name>
<value>1</value>
</property>
<property>
<name>[Link]</name>
<value>file:/usr/local/hadoop/hdfs/namenode</value>
</property>
<property>
<name>[Link]</name>
<value>file:/usr/local/hadoop/hdfs/datanode</value>
</property>
</configuration>

Luego crea las carpetas necesarias:

bash
CopiarEditar
mkdir -p /usr/local/hadoop/hdfs/namenode
mkdir -p /usr/local/hadoop/hdfs/datanode

4.4 Configurar [Link]

Primero copia el archivo base:

bash
CopiarEditar
cp /usr/local/hadoop/etc/hadoop/[Link]
/usr/local/hadoop/etc/hadoop/[Link]

Ahora edítalo:

bash
CopiarEditar
nano /usr/local/hadoop/etc/hadoop/[Link]

🔽 Agrega esto:

xml
CopiarEditar
<configuration>
<property>
<name>[Link]</name>
<value>yarn</value>
</property>
</configuration>

4.5 Configurar [Link]


bash
CopiarEditar
nano /usr/local/hadoop/etc/hadoop/[Link]

🔽 Usa este contenido:

xml
CopiarEditar
<configuration>
<property>
<name>[Link]</name>
<value>localhost:8032</value>
</property>
<property>
<name>[Link]-services</name>
<value>mapreduce_shuffle</value>
</property>
</configuration>

🟨 PASO 5: FORMATEAR E INICIAR HADOOP


Formatear el sistema de archivos (solo la primera vez):
bash
CopiarEditar
hdfs namenode -format

Iniciar HDFS y YARN:


bash
CopiarEditar
[Link]
[Link]

Verificar que funciona:


bash
CopiarEditar
hadoop fs -ls /
yarn node -list

Abrir navegador:

 HDFS: [Link]
 YARN: [Link]

🟨 PASO 6: INSTALAR HIVE


Descargar Hive:
bash
CopiarEditar
wget [Link]
[Link]
tar -xzf [Link]
sudo mv apache-hive-3.1.3-bin /usr/local/hive
sudo chown -R hadoopuser:hadoopuser /usr/local/hive

Configurar variables de entorno:


bash
CopiarEditar
echo "export HIVE_HOME=/usr/local/hive" >> ~/.bashrc
echo "export PATH=\$PATH:\$HIVE_HOME/bin" >> ~/.bashrc
source ~/.bashrc

Inicializar metastore:
bash
CopiarEditar
schematool -initSchema -dbType derby

Iniciar Hive:
bash
CopiarEditar
hive

🟨 PASO 7: INSTALAR PIG


Descargar Pig:
bash
CopiarEditar
wget [Link]
tar -xzf [Link]
sudo mv pig-0.17.0 /usr/local/pig
sudo chown -R hadoopuser:hadoopuser /usr/local/pig

Configurar variables de entorno:


bash
CopiarEditar
echo "export PIG_HOME=/usr/local/pig" >> ~/.bashrc
echo "export PATH=\$PATH:\$PIG_HOME/bin" >> ~/.bashrc
source ~/.bashrc

Ejecutar Pig:
bash
CopiarEditar
pig

🟢 ¡Y LISTO!
Ya tienes todo configurado:

 ✅ Hadoop (HDFS + YARN)


 ✅ Hive (modo embebido)
 ✅ Pig (modo local o MapReduce)

También podría gustarte