0% encontró este documento útil (0 votos)
4 vistas13 páginas

Técnicas de Minería de Datos en Weka

Cargado por

8232200110
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
4 vistas13 páginas

Técnicas de Minería de Datos en Weka

Cargado por

8232200110
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd

UNIVERSIDAD

UNIVERMILENIUM

INGENIERÍA EN SISTEMAS COMPUTACIONALES

“Producto Final”

MINERÍA DE DATOS

Presenta:
Iori Uziel Huerta Tovar
Edgar Vázquez Jiménez
Santiago Tavera Puebla

Maestro:
José Emmanuel Sandoval Aguilar
11 de noviembre de 2024
Introduccion

En este análisis se explorarán diversas técnicas de minería de datos para


identificar patrones y obtener conclusiones relevantes a partir de un conjunto de
información. Se iniciará con la creación y preparación de una base de datos,
seguida de un preprocesamiento que permita optimizar su calidad.
Posteriormente, se aplicarán métodos de clasificación y clustering para categorizar
y agrupar la información de manera eficiente. Además, se generarán reglas de
asociación y se realizarán análisis gráficos para interpretar visualmente los
resultados.

Constitución de la Base de Datos

En esta captura se muestra la base de datos utilizada, la cual contiene una única
tabla con los siguientes atributos y sus respectivos tipos de datos:

1. Class:

 Tipo de dato: Nominal.

 Descripción: Indica la clase de viaje (como primera, segunda o


tercera clase).

2. Age:

 Tipo de dato: Nominal.


 Descripción: Representa la categoría de edad del pasajero, en este
caso clasificada como "adult".

3. Sex:

 Tipo de dato: Nominal.

 Descripción: Género del pasajero, que puede ser "male"


(masculino) o "female" (femenino).
4. Survived:

 Tipo de dato: Nominal.

 Descripción: Indica si el pasajero sobrevivió al evento analizado,


siendo los valores posibles "yes" (sí) o "no" (no).

La base de datos está estructurada en un formato que permite realizar análisis


categóricos y trabajar con técnicas de minería de datos como clasificación y
clustering. Además, todos los atributos son de tipo nominal, lo cual es ideal para
análisis en plataformas como WEKA.

En este paso del preprocesamiento, se utilizó el filtro RemoveWithValues para


deshacerse de las instancias con datos faltantes o erróneos. Esto ayuda a limpiar
el conjunto de datos, eliminando cualquier posible fuente de error antes de que los
datos sean utilizados en la construcción del modelo. Así, se asegura que el
análisis se realice solo con información completa y precisa.
En esta captura muestra cómo construir y evaluar un modelo de clasificación
basado en Random Forest. Los resultados obtenidos indican un buen desempeño
del modelo.

Matriz de Confusión del Modelo Random Forest

Como parte del análisis realizado con el algoritmo Random Forest en WEKA, se
generó una matriz de confusión para evaluar el desempeño del modelo. Esta
matriz proporciona una comparación entre los valores reales y las predicciones
realizadas, permitiendo analizar la calidad de las clasificaciones.

Predicción: Sí (yes) Predicción: No (no)


Real: Sí (yes) 344 367
Real: No (no) 126 1364

Explicación de la Matriz

1. 344 (Verdaderos Positivos): Casos que fueron correctamente clasificados como


"Sí".
2. 367 (Falsos Negativos): Casos que eran realmente "Sí", pero el modelo los clasificó
como "No".
3. 126 (Falsos Positivos): Casos que eran realmente "No", pero el modelo los clasificó
como "Sí".
4. 1364 (Verdaderos Negativos): Casos que fueron correctamente clasificados como
"No".

Esta captura muestra una representación visual de un árbol de decisión generado


por Weka. Esta visualización proporciona una idea general de cómo el modelo
toma decisiones.
Esta captura de pantalla presenta los resultados de un algoritmo de clustering
llamado K-Means aplicado a un conjunto de datos en el software Weka. El
clustering es una técnica de aprendizaje no supervisado que busca agrupar datos
similares en conjuntos (clusters) basados en sus características.

(2, 3 y 4 clusters)
Reglas de Asociación

Las reglas de asociación son una técnica de minería de datos que busca
identificar relaciones interesantes entre diferentes elementos o ítems en un
conjunto de datos. Estas reglas se expresan en la forma "Si X, entonces Y", donde
X e Y son conjuntos de ítems.

La captura de pantalla muestra los resultados de un algoritmo de asociación


aplicado a un conjunto de datos en Weka. Se han generado 10 reglas de
asociación.

Estructura de las reglas:

Cada regla se presenta en el siguiente formato:

 {antecedente} => {consecuente}: support, confidence, lift

 Antecedente: Conjunto de ítems que implica el consecuente.

 Consecuente: Conjunto de ítems que es implicado por el antecedente.

 Soporte: Proporción de transacciones que contienen tanto el antecedente


como el consecuente.
 Confianza: Probabilidad de que el consecuente ocurra dado que el
antecedente ya ha ocurrido.

 Lift: Mide cuánto más probable es que el consecuente ocurra cuando el


antecedente está presente, en comparación con lo que se esperaría si los
ítems fueran independientes.

En la imagen que compartiste, se muestran reglas de asociación generadas con el


algoritmo Apriori. Estas reglas están basadas en un conjunto de datos, y cada una
incluye medidas de evaluación como el soporte, la confianza y el lift. Vamos a
desglosar los conceptos y las reglas presentadas:

Conceptos Clave

1. Soporte (support): Indica la proporción de veces que ocurre una


combinación específica de ítems en el conjunto de datos.

2. Confianza (confidence): Representa la probabilidad de que el


consecuente de la regla ocurra dado que el antecedente ocurrió.

3. Lift: Mide la fuerza de la regla, comparando la probabilidad observada con


la probabilidad esperada si fueran independientes.

Las 10 Reglas

Cada regla tiene el formato Antecedente -> Consecuente, donde:

 Antecedente es lo que "dispara" la regla.

 Consecuente es el resultado que se espera.

1. class=crew => age=adult (885)

 Confianza: 1.00 (100%)

 Lift: 1.95

 Esto indica que el 100% de las personas de la clase crew tienen edad
adulta, con un lift que sugiere una fuerte relación positiva.
2. age=adult => class=crew (885)

 Confianza: 0.42 (42%)

 Lift: 1.95

 Si alguien es adulto, hay un 42% de probabilidad de que pertenezca a la


clase crew. El lift confirma una relación significativa.

3. class=crew => survived=no (863)

 Confianza: 0.97 (97%)

 Lift: 1.29

 El 97% de la clase crew no sobrevivió, con una relación moderada según el


lift.

4. survived=no => class=crew (863)

 Confianza: 0.41 (41%)

 Lift: 1.29

 Si no sobrevivieron, hay un 41% de probabilidad de que sean de la clase


crew. Lift confirma relación moderada.

5. class=crew => age=adult, survived=no (862)

 Confianza: 0.97 (97%)

 Lift: 1.87

 El 97% de los tripulantes adultos no sobrevivieron, con una relación fuerte.

6. age=adult, survived=no => class=crew (862)

 Confianza: 0.41 (41%)

 Lift: 1.87

 Si alguien adulto no sobrevivió, hay 41% de probabilidad de que sean


tripulantes.
7. class=3rd => survived=no (499)

 Confianza: 0.70 (70%)

 Lift: 1.29

 El 70% de los pasajeros de tercera clase no sobrevivieron.

8. survived=no => class=3rd (499)

 Confianza: 0.24 (24%)

 Lift: 1.29

 Si no sobrevivieron, hay un 24% de probabilidad de que estén en tercera


clase.

9. class=3rd, survived=no => age=adult (496)

 Confianza: 0.99 (99%)

 Lift: 1.01

 El 99% de los adultos en tercera clase no sobrevivieron, aunque la relación


con age=adult no es particularmente fuerte (lift ≈ 1).

10. age=adult => class=3rd, survived=no (496)

 Confianza: 0.23 (23%)

 Lift: 1.01

 Si alguien es adulto, la probabilidad de que pertenezca a tercera clase y no


haya sobrevivido es baja, pero está dentro de lo esperado (lift ≈ 1).
La captura muestra un proceso de selección de atributos en un contexto de
minería de datos. Este proceso es fundamental para construir modelos predictivos
precisos y eficientes.
La imagen proporciona una instantánea visual de un conjunto de datos
clasificados. La distribución de los puntos sugiere que existe una relación entre los
atributos y la clase.

Al igual que en la imagen anterior, el elemento central es un gráfico de dispersión


bidimensional. Cada punto representa una instancia o registro de los datos.
Al igual que en las imágenes anteriores, el componente principal es un gráfico de
dispersión bidimensional. Cada punto en este gráfico representa una instancia o
registro de los datos.

Conclusión

En este proyecto aprendí a implementar diferentes técnicas de minería de datos


para descubrir patrones y relaciones en un conjunto de datos categóricos. El
trabajo incluyó desde la preparación y limpieza de los datos hasta la aplicación de
algoritmos de clasificación, agrupamiento y asociación. Lo más destacado fue
comprender cómo las reglas de asociación permiten identificar tendencias
relevantes, como la relación entre la clase, la edad y la supervivencia. Además,
utilizar herramientas como Weka facilitó la representación visual de los resultados,
como árboles de decisión y gráficos de dispersión, lo que mejoró la interpretación
de los datos. Este proceso fue una experiencia enriquecedora que fortaleció tanto
mis conocimientos teóricos como mis habilidades prácticas en el análisis de datos.

También podría gustarte