0% encontró este documento útil (0 votos)
343 vistas16 páginas

Ejemplo de Minería de Datos en WEKA

El documento habla sobre minería de datos. Explica que es el proceso de descubrir patrones en grandes conjuntos de datos usando métodos de inteligencia artificial y aprendizaje automático. Detalla los pasos típicos de un proyecto de minería de datos como seleccionar datos, analizarlos, transformarlos, aplicar técnicas como redes neuronales o árboles de decisión, extraer conocimiento e interpretar los resultados. Finalmente menciona algunas aplicaciones como genética y mercadeo.

Cargado por

PaulTinoco
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
343 vistas16 páginas

Ejemplo de Minería de Datos en WEKA

El documento habla sobre minería de datos. Explica que es el proceso de descubrir patrones en grandes conjuntos de datos usando métodos de inteligencia artificial y aprendizaje automático. Detalla los pasos típicos de un proyecto de minería de datos como seleccionar datos, analizarlos, transformarlos, aplicar técnicas como redes neuronales o árboles de decisión, extraer conocimiento e interpretar los resultados. Finalmente menciona algunas aplicaciones como genética y mercadeo.

Cargado por

PaulTinoco
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd

ESCUELA POLITÉCNICA NACIONAL

INGENIERÍA EN SISTEMAS
INTELIGENCIA ARTIFICIAL
INFORME 8
NOMBRE: PAÚL TINOCO SILVA.

1. TÍTULO: MINERÍA DE DATOS.


2. OBJETIVOS:

1. Conocer los conceptos básicos de lo que es minería de datos y utilizar el programa WEKA para
aplicar la teoría con ejemplos prácticos.

2. MARCO TEÓRICO

La minería de datos (es la etapa de análisis de "Knowledge Discovery in Databases" o KDD), es un


campo de las ciencias de la computación referido al proceso que intenta descubrir patrones en
grandes volúmenes de conjuntos de datos. Utiliza los métodos de la inteligencia artificial,
aprendizaje automático, estadística y sistemas de bases de datos. El objetivo general del proceso de
minería de datos consiste en extraer información de un conjunto de datos y transformarla en una
estructura comprensible para su uso posterior. Además de la etapa de análisis en bruto, que
involucra aspectos de bases de datos y gestión de datos, procesamiento de datos, el modelo y las
consideraciones de inferencia, métricas de Intereses, consideraciones de la Teoría de la
complejidad computacional, post-procesamiento de las estructuras descubiertas, la visualización y
actualización en línea.

La tarea de minería de datos real es el análisis automático o semi-automático de grandes


cantidades de datos para extraer patrones interesantes hasta ahora desconocidos, como los grupos
de registros de datos (análisis cluster), registros poco usuales (la detección de anomalías) y
dependencias (Asociación Minera regla). Esto generalmente implica el uso de técnicas de bases de
datos como los índices espaciales. Estos patrones pueden entonces ser visto como una especie de
resumen de los datos de entrada, y puede ser utilizado en el análisis adicional o, por ejemplo, en la
máquina de aprendizaje y análisis predictivo. Por ejemplo, el paso de minería de datos podrían
identificar varios grupos en los datos, que luego pueden ser utilizados para obtener resultados más
precisos de predicción por un sistema de soporte de decisiones. Ni la recolección de datos,
preparación de datos, ni la interpretación de los resultados y la información son parte de la etapa
de minería de datos, pero que pertenecen a todo el proceso KDD como pasos adicionales.

Los términos relacionados con el dragado de datos, la pesca de datos y espionaje de los datos se
refieren a la utilización de métodos de minería de datos a las partes de la muestra de un conjunto
de datos de población más grandes establecidas que son (o pueden ser) demasiado pequeño para
las inferencias estadísticas fiables que se hizo acerca de la validez de cualquier patrones
descubiertos. Estos métodos pueden, sin embargo, ser utilizado en la creación de nuevas hipótesis
que se prueba contra las poblaciones de datos más grandes.

Un proceso típico de minería de datos consta de los siguientes pasos generales:

 Selección del conjunto de datos, tanto en lo que se refiere a las variables objetivo (aquellas
que se quiere predecir, calcular o inferir), como a las variables independientes (las que
sirven para hacer el cálculo o proceso), como posiblemente al muestreo de los registros
disponibles.
 Análisis de las propiedades de los datos, en especial los histogramas, diagramas de
dispersión, presencia de valores atípicos y ausencia de datos (valores nulos).
 Transformación del conjunto de datos de entrada, se realizará de diversas formas en
función del análisis previo, con el objetivo de prepararlo para aplicar la técnica de minería
de datos que mejor se adapte a los datos y al problema, a este paso también se le conoce
como preprocesamiento de los datos.
 Seleccionar y aplicar la técnica de minería de datos, se construye el modelo predictivo, de
clasificación o segmentación.
 Extracción de conocimiento, mediante una técnica de minería de datos, se obtiene un
modelo de conocimiento, que representa patrones de comportamiento observados en los
valores de las variables del problema o relaciones de asociación entre dichas variables.
También pueden usarse varias técnicas a la vez para generar distintos modelos, aunque
generalmente cada técnica obliga a un pre procesado diferente de los datos.
 Interpretación y evaluación de datos, una vez obtenido el modelo, se debe proceder a su
validación comprobando que las conclusiones que arroja son válidas y suficientemente
satisfactorias. En el caso de haber obtenido varios modelos mediante el uso de distintas
técnicas, se deben comparar los modelos en busca de aquel que se ajuste mejor al
problema. Si ninguno de los modelos alcanza los resultados esperados, debe alterarse
alguno de los pasos anteriores para generar nuevos modelos.

Si el modelo final no superara esta evaluación el proceso se podría repetir desde el principio o, si el
experto lo considera oportuno, a partir de cualquiera de los pasos anteriores. Esta
retroalimentación se podrá repetir cuantas veces se considere necesario hasta obtener un modelo
válido.

Una vez validado el modelo, si resulta ser aceptable (proporciona salidas adecuadas y/o con
márgenes de error admisibles) éste ya está listo para su explotación. Los modelos obtenidos por
técnicas de minería de datos se aplican incorporándolos en los sistemas de análisis de información
de las organizaciones, e incluso, en los sistemas transaccionales. En este sentido cabe destacar los
esfuerzos del Data Mining Group, que está estandarizando el lenguaje PMML (Predictive Model
Markup Language), de manera que los modelos de minería de datos sean interoperables en
distintas plataformas, con independencia del sistema con el que han sido construidos. Los
principales fabricantes de sistemas de bases de datos y programas de análisis de la información
hacen uso de este estándar.

Protocolo de un proyecto de minería de datos

Un proyecto de minería de datos tiene varias fases necesarias que son, esencialmente:
 Comprensión del negocio y del problema que se quiere resolver.
 Determinación, obtención y limpieza de los datos necesarios.
 Creación de modelos matemáticos.
 Validación, comunicación, etc. de los resultados obtenidos.
 Integración, si procede, de los resultados en un sistema transaccional o similar.

La relación entre todas estas fases sólo es lineal sobre el papel. En realidad, es mucho más compleja
y esconde toda una jerarquía de subfases. A través de la experiencia acumulada en proyectos de
minería de datos se han ido desarrollando metodologías que permiten gestionar esta complejidad
de una manera más o menos uniforme.

Técnicas de minería de datos

Como ya se ha comentado, las técnicas de la minería de datos provienen de la Inteligencia artificial


y de la estadística, dichas técnicas, no son más que algoritmos, más o menos sofisticados que se
aplican sobre un conjunto de datos para obtener unos resultados.
Las técnicas más representativas son:

 Redes neuronales.- Son un paradigma de aprendizaje y procesamiento automático


inspirado en la forma en que funciona el sistema nervioso de los animales. Se trata de un
sistema de interconexión de neuronas en una red que colabora para producir un estímulo
de salida. Algunos ejemplos de red neuronal son:
o El Perceptrón.
o El Perceptrón multicapa.
o Los Mapas Auto organizados, también conocidos como redes de Kohonen.
 Regresión lineal.- Es la más utilizada para formar relaciones entre datos. Rápida y eficaz
pero insuficiente en espacios multidimensionales donde puedan relacionarse más de 2
variables.
 Árboles de decisión.- Un árbol de decisión es un modelo de predicción utilizado en el
ámbito de la inteligencia artificial, dada una base de datos se construyen estos diagramas
de construcciones lógicas, muy similares a los sistemas de predicción basados en reglas,
que sirven para representar y categorizar una serie de condiciones que suceden de forma
sucesiva, para la resolución de un problema. Ejemplos:
o Algoritmo ID3.
o Algoritmo C4.5.
 Modelos estadísticos.- Es una expresión simbólica en forma de igualdad o ecuación que se
emplea en todos los diseños experimentales y en la regresión para indicar los diferentes
factores que modifican la variable de respuesta.
 Agrupamiento o Clustering.- Es un procedimiento de agrupación de una serie de vectores
según criterios habitualmente de distancia; se tratará de disponer los vectores de entrada
de forma que estén más cercanos aquellos que tengan características comunes. Ejemplos:
o Algoritmo K-means.
o Algoritmo K-medoids.
 Reglas de asociación.- Se utilizan para descubrir hechos que ocurren en común dentro de
un determinado conjunto de datos.

Según el objetivo del análisis de los datos, los algoritmos utilizados se clasifican en supervisados y
no supervisados (Weiss y Indurkhya, 1998):
 Algoritmos supervisados (o predictivos): predicen un dato (o un conjunto de ellos)
desconocido a priori, a partir de otros conocidos.
 Algoritmos no supervisados (o del descubrimiento del conocimiento): se descubren
patrones y tendencias en los datos.

Aplicaciones

Genética.- En el estudio de la genética humana, el objetivo principal es entender la relación


cartográfica entre las partes y la variación individual en las secuencias del ADN humano y la
variabilidad en la susceptibilidad a las enfermedades. En términos más llanos, se trata de saber
cómo los cambios en la secuencia de ADN de un individuo afectan al riesgo de desarrollar
enfermedades comunes (como por ejemplo el cáncer). Esto es muy importante para ayudar a
mejorar el diagnóstico, prevención y tratamiento de las enfermedades. La técnica de minería de
datos que se utiliza para realizar esta tarea se conoce como "reducción de dimensionalidad
multifactorial".2
Ingeniería eléctrica.- En el ámbito de la ingeniería eléctrica, las técnicas minería de datos han sido
ampliamente utilizadas para monitorizar las condiciones de las instalaciones de alta tensión. La
finalidad de esta monitorización es obtener información valiosa sobre el estado del aislamiento de
los equipos. Para la vigilancia de las vibraciones o el análisis de los cambios de carga en
transformadores se utilizan ciertas técnicas para agrupación de datos (clustering) tales como los
Mapas Auto-Organizativos (SOM, Self-organizing map). Estos mapas sirven para detectar
condiciones anormales y para estimar la naturaleza de dichas anomalías.3
Análisis de gases.- También se han aplicado técnicas de minería de datos para el análisis de gases
disueltos (DGA, Dissolved gas analysis) en transformadores eléctricos. El análisis de gases disueltos
se conoce desde hace mucho tiempo como herramienta para diagnosticar transformadores. Los
Mapas Auto-Organizativos (SOM) se utilizan para analizar datos y determinar tendencias que
podrían pasarse por alto utilizando las técnicas clásicas DGA.

3. HISTORIAL

Abrimos el programa WEKA y damos clic en “Explorer”

Cargamos los datos de iris en la ruta c:\Archivos de programa (x86)\Weka-3-6\data

Seleccionamos la base “iris”


Y se nos presenta:

En “Classify” escogemos el algoritmo J48 que es un buen algoritmo.


Cross – validation |10| fold -> se divide al conjunto de datos en 10 partes iguales.
Luego se aplica el algoritmo de aprendizaje a las 9 décimas y se usa la última decima para
validación. Nuevamente se selecciona otra decima para validación y continua.
Finalmente damos clic en “Start” para que corra el algoritmo.

El árbol de decisión es el siguiente:


La matriz de condusión es la siguiente:

Vamos a iniciar un perceptron multicapa:


Con el perceptron se nos presenta el siguiente resumen:

Observamos la matriz de confusión

Seleccionamos otro algoritmo, el RBF network (Radial Basis Funtion) el cual utiliza una función de
Gauss para la clasificación de los datos.
Damos clic derecho en el nombre del algoritmo y cambiamos las propiedades para reducir al
mínimo los errores
Ahora abrimos la base de datos del problema de la soya que se encuentra en el mismo directorio
anterior.

Seleccionamos “Class” y vemos los datos que nos pueden servir para clasificar las enfermedades
que tiene la soya.
Primero escogemos el algoritmo J48 y lo iniciamos. El árbol de decisión es el siguiente:
El resumen de resultados es el siguiente

Y la siguiente es matriz de confusión

Ahora escogemos el algoritmo J48graft, en este nos da muchas más reglas de decisión,
probablemente este sobre-ajustado:
Seleccionamos y abrimos otra vez la base de datos iris, vamos a “Cluster” y escogemos el algoritmo
“simplekmeans”

Cambiamos el número de clusters


El resultado es el siguiente:
Ahora vamos a visualizar los resultados en la pestaña “Visualize” y escogemos el siguiente grafico

Reglas de asociación

Abrimos la base de datos de lentes de contacto


Miramos las reglas de asociación de esta base de datos con el algoritmo a priori

4. CONCLUSIONES

 La minería de datos puede ser de gran utilidad cuando se tiene un volumen de datos
demasiado extenso, par poder explorarlos mucho más rápido.
 Dependiendo de la calidad del algoritmo probabilidad que utilicemos, los resultados de la
exploración de datos mediante minería puede variar, siendo unos resultados mejor que otros.

5. REFERENCIAS

 [Link]

Common questions

Con tecnología de IA

Los SOM son redes neuronales utilizados para la clasificación y reducción de dimensionalidad, inspirados en la corteza cerebral, para organizar datos de manera no supervisada. Son efectivos en visualización de datos, detección de anomalías, y análisis de tendencias en grandes volúmenes de datos, como en monitoreo de condiciones en ingeniería eléctrica .

La validación de modelos garantiza que un modelo sea robusto, generalizable y produzca resultados precisos. Estrategias de validación incluyen la validación cruzada, donde los datos se dividen en subconjuntos de entrenamiento y prueba repetidamente, y la comparación con modelos alternativos para seleccionar el más adecuado. Sin validación, los modelos podrían reflejar solo datos específicos sin aplicabilidad general .

Los algoritmos supervisados son utilizados para predicción basándose en datos conocidos, ejemplos incluyen la regresión lineal y los árboles de decisión. Los algoritmos no supervisados descubren patrones intrínsecos en los datos sin predefinir etiquetas de salida, como en el clustering (K-means) y las reglas de asociación. Estos métodos permiten comprender estructuras subyacentes sin supervisión explícita .

El proceso de minería de datos dentro del marco de 'Knowledge Discovery in Databases' (KDD) incluye varias etapas: selección del conjunto de datos, análisis de las propiedades de los datos, transformación del conjunto de datos, selección y aplicación de la técnica de minería de datos, y extracción de conocimiento. Las etapas se relacionan de manera secuencial pero también pueden retroceder y ajustarse según los resultados obtenidos, permitiendo revisar pasos anteriores si el resultado final no es satisfactorio .

Las reglas de asociación son esenciales para identificar relaciones frecuentes entre conjuntos de datos, ayudando a descubrir patrones recurrentes. Aplicaciones comunes incluyen la cesta de compras de un supermercado, donde puede detectar qué productos se compran juntos frecuentemente, mejorando la oferta comercial y la disposición de productos .

El conocimiento extraído se puede integrar en sistemas transaccionales para enriquecer las bases de datos y mejorar la toma de decisiones. Por ejemplo, el PMML permite que modelos predictivos interoperen en diversas plataformas. Esto facilita la integración de nuevas reglas de negocio basadas en hallazgos descubiertos, optimizando operaciones y servicios al personalizar recomendaciones o optimizar el inventario .

La aplicación de técnicas como la reducción de dimensionalidad multifactorial en genética humana permite identificar variaciones genéticas asociadas con enfermedades de forma más eficiente. Al reducir el dimensionalidad de los datos, se pueden distinguir correlaciones significativas en grandes secuencias de ADN, facilitando el diagnóstico, prevención y tratamiento de enfermedades al personalizar el enfoque médico .

Las metodologías acumuladas en minería de datos, como el CRISP-DM, proporcionan un marco estructurado que ayuda a gestionar la complejidad de proyectos mediante guía en fases cruciales: desde la comprensión del negocio hasta la validación de modelos. Estas metodologías permiten abordar proyectos de manera iterativa y flexible, adaptándose según retroalimentación y nuevos descubrimientos, asegurando la eficacia en tiempos y recursos utilizados .

El PMML, un estándar de modelado predictivo, permite que modelos de minería de datos se ejecuten en múltiples plataformas independientemente del sistema con el que fueron creados. Esto facilita la interoperabilidad al ofrecer un formato uniforme y tolerante a las variaciones, permitiendo que modelos puedan implementarse y reutilizarse en varios contextos sin necesidad de reconstruirlos .

El preprocesamiento de datos es crucial porque asegura que los datos sean adecuados para la aplicación de técnicas de minería de datos. Incluye la transformación de los datos para simplificar su estructura, corregir errores o anomalías, y asegurar la consistencia y calidad. Esto impacta significativamente en los resultados obtenidos, ya que los modelos dependen de la calidad y adecuación de los datos procesados. Si los datos son inadecuados, los resultados pueden ser imprecisos o engañosos .

ESCUELA POLITÉCNICA NACIONAL 
INGENIERÍA EN SISTEMAS 
INTELIGENCIA ARTIFICIAL 
INFORME 8 
NOMBRE: PAÚL TINOCO SILVA. 
 
1. 
T
 
Transformación del conjunto de datos de entrada, se realizará de diversas formas en 
función del análisis previo, con el o
Las técnicas más representativas son: 
 
 
Redes neuronales.- Son un paradigma de aprendizaje y procesamiento automático 
in
Mapas Auto-Organizativos (SOM, Self-organizing map). Estos mapas sirven para detectar 
condiciones anormales y para estimar l
 
 
Y se nos presenta: 
 
 
En “Classify” escogemos el algoritmo J48 que es un buen algoritmo.
Cross – validation |10| fold -> se divide al conjunto de datos en 10 partes iguales.  
Luego se aplica el algoritmo de ap
 
La matriz de condusión es la siguiente: 
 
Vamos a iniciar un perceptron multicapa:
Con el perceptron se nos presenta el siguiente resumen: 
 
Observamos la matriz de confusión 
 
Seleccionamos otro algori
 
 
Damos clic derecho en el nombre del algoritmo y cambiamos las propiedades para reducir al 
mínimo los errores
Ahora abrimos la base de datos del problema de la soya que se encuentra en el mismo directorio 
anterior. 
 
 
Selecciona

También podría gustarte