UNIVERSIDAD CATÓLICA BOLIVIANA “SAN PABLO”
UNIDAD ACADÉMICA TARIJA – POSGRADO
DIPLOMADO EN ANALISIS DE DATOS CON INTELIGENCIA
ARTIFICIAL
PROYECTO SALUD
POSTULANTES: Joaquín Ezequiel Galean Ramírez
Cristhian Rivera Jurado
Carlos Josué Rojas Arenas
Jhonatan Deivis Laguna Costano
DOCENTE GUIA: PHD. Ing. Luis Gabriel Moreno Sandoval
COCHABAMBA – BOLIVIA
2024
CONTENIDO
1. COMPRENSIÓN DEL NEGOCIO...................................................................3
1.1. Objetivo del Proyecto....................................................................................3
1.2. Contexto del Negocio....................................................................................3
2. COMPRENSIÓN DE LOS DATOS..................................................................3
2.1. Descripción de los Datos..............................................................................3
2.2. Columnas Importantes:.................................................................................3
3. PREPARACIÓN DE LOS DATOS...................................................................3
3.1. Carga y Exploración Inicial............................................................................3
3.2. Preprocesamiento del Texto.........................................................................5
3.3. Descarga y Carga del Modelo de Lenguaje..................................................5
4. MODELADO....................................................................................................6
4.1. Generación de Nube de Palabras.................................................................6
4.2. Extracción de Comentarios Relevantes........................................................7
4.3. Análisis de Frecuencia de Palabras..............................................................7
5. EVALUACIÓN................................................................................................. 8
6. DESPLIEGUE................................................................................................. 8
1. COMPRENSIÓN DEL NEGOCIO
1.1. Objetivo del Proyecto
Desarrollar e implementar un sistema automatizado de análisis de texto que
permita la clasificación y detección de tópicos en grandes volúmenes de
documentos, utilizando técnicas avanzadas de Procesamiento de Lenguaje
Natural (NLP). El sistema debe ser capaz de preprocesar los textos, aplicar
modelos supervisados para la clasificación y métodos no supervisados para el
modelado de tópicos, evaluando y optimizando los modelos para garantizar su
precisión y efectividad.
1.2. Contexto del Negocio
El contexto del negocio, está relacionado con el análisis automatizado de texto
para la detección de tópicos y la clasificación de documentos. Este tipo de
análisis es crucial en muchas industrias que manejan grandes volúmenes de
datos textuales.
En la era digital, las empresas enfrentan el desafío de manejar y analizar
grandes cantidades de datos textuales provenientes de diversas fuentes, como
correos electrónicos, redes sociales, reseñas de productos, artículos de
noticias, entre otros. La capacidad de extraer información relevante, clasificar
documentos y descubrir temas subyacentes de manera automatizada es crucial
para tomar decisiones informadas y mejorar la eficiencia operativa.
2. COMPRENSIÓN DE LOS DATOS
2.1. Descripción de los Datos
La comprensión de los datos implica obtener una visión general del conjunto de
datos que se está utilizando para el análisis. Esto incluye información sobre la
fuente de los datos, el tipo de datos, y cualquier característica relevante que
pueda influir en el análisis.
En este caso, el conjunto de datos se carga desde un archivo de Excel alojado
en Google Sheets. El código usa pandas para cargar y explorar estos datos.
Fuente de los datos: Archivo de Excel accesible desde una URL pública de
Google Sheets.
Tipo de datos: (Texto). incluye documentos, comentarios, artículos, etc., que
serán analizados utilizando técnicas de NLP.
Este código carga el conjunto de datos en un DataFrame de pandas y muestra
las primeras filas para una revisión preliminar.
2.2. Columnas Importantes:
Texto: La columna que contiene el texto a analizar. Esta es la columna más
importante ya que el objetivo principal del análisis es preprocesar, clasificar y
extraer temas del texto.
Importancia: Es la columna principal que será preprocesada y utilizada para la
clasificación y el modelado de tópicos.
Categoría (opcional): Si el conjunto de datos incluye una columna con etiquetas
de categoría (para problemas de clasificación supervisada), esta columna es
crucial para entrenar los modelos supervisados.
Importancia: Permite la clasificación de textos en categorías predefinidas.
Identificador (opcional): Un identificador único para cada entrada de texto
puede ser útil para rastrear y manejar los datos.
Importancia: Facilita el manejo y seguimiento de las entradas en el conjunto de
datos.
3. PREPARACIÓN DE LOS DATOS
3.1. Carga y Exploración Inicial
Se cargaron los datos desde el archivo CSV utilizando la biblioteca numpy. Se
verificó la carga correcta mostrando los primeros registros y los nombres de las
columnas.
3.2. Preprocesamiento del Texto
Se preprocesaron los comentarios para convertir el texto a minúsculas,
eliminar la puntuación y las stopwords, y tokenizar las palabras.
3.3. Descarga y Carga del Modelo de Lenguaje
Se descargó y cargó el modelo de lenguaje adecuado para español utilizando
la biblioteca spacy para la extracción de partes del discurso.
4. MODELADO
4.1. Generación de Nube de Palabras
Se generó una nube de palabras para visualizar los adjetivos más comunes en
los comentarios.
4.2. Extracción de Comentarios Relevantes
Se definió una función para extraer comentarios relevantes a partir de una
palabra clave dada.
4.3. Análisis de Frecuencia de Palabras
Se realizó un análisis de frecuencia de palabras para visualizar la distribución
de frecuencias según la Ley de Zipf.
5. EVALUACIÓN
El análisis de frecuencia de palabras y la generación de la nube de palabras
proporcionaron información valiosa sobre los adjetivos más comunes y la
distribución de palabras en los comentarios. La extracción de comentarios
relevantes utilizando palabras clave permitió identificar fácilmente opiniones
específicas relacionadas con temas de interés.
6. DESPLIEGUE
Los resultados obtenidos pueden ser utilizados por los responsables de
políticas de salud para entender mejor las opiniones y preocupaciones de la
población. Además, el código puede ser reutilizado y adaptado para analizar
nuevos conjuntos de datos en el futuro, proporcionando un marco robusto para
el análisis de comentarios textuales en el ámbito de la salud y otros dominios.