Fases del proceso de descubrimiento del conocimiento de Dataminig
“Data Mining es una parte de un proceso de rango superior: el
descubrimiento del conocimiento. Sin embargo, Data Mining es un
proceso en sí mismo, que a su vez consta de varias fases.”
Fases de Data Mining
Como se ha comentado anteriormente, Data Mining es una parte de un
proceso de rango superior: el descubrimiento del conocimiento. Sin
embargo, Data Mining es un proceso en sí mismo, que a su vez consta de
varias fases. Vamos a tomar como referencia el modelo CRISP (se
denomina así por sus siglas en inglés Cross Industry Standard Process)
de proceso de Data Mining. Este modelo proporciona la descripción del
ciclo de vida del proyecto de Data Mining, las fases de este proyecto, las
tareas respectivas a cada fase y las distintas relaciones entre ellas. El ciclo de vida del proyecto de
minería de datos consiste en seis fases: comprensión del negocio, comprensión de los datos,
preparación de datos, modelado, evaluación y despliegue.
En este nivel de descripción, no es posible identificar todas las relaciones, sin embargo, es
importante señalar que el movimiento reiterativo entre fases diferentes es importante para asegurar
una visión de conjunto, es decir, como existe una dependencia entre las fases y los resultados
producidos en ellas, tras completar las tareas de cada fase es necesario comprobar su impacto en el
resto para mantener la coherencia del proceso. Las relaciones pueden existir entre cualquier fase o
tarea del proceso de minería de datos, variando de acuerdo a los objetivos del proceso, el contexto
del mismo o por el interés del usuario sobre los datos. De forma similar a lo comentado
anteriormente, la minería de datos no se termina una vez que la solución es desplegada.
A continuación, veremos un pequeño detalle de cada fase del proceso:
Comprensión del negocio
Esta es la fase con la que se abre el proceso. Se encuentra enfocada en la comprensión de los
objetivos y exigencias de proyecto partiendo desde la perspectiva del negocio.
Tras ello, es necesario adquirir este conocimiento de los datos (repetimos, siempre desde el punto
de vista del negocio) y convertirlo en la definición de un problema de minería de datos, trazando un
plan preliminar de acuerdo a los objetivos planificados.
Comprensión de los datos
La fase de comprensión de datos comienza con la colección de datos inicial para continuar con las
actividades que permiten alcanzar una familiaridad con ellos que permita identificar los problemas de
calidad de datos. La calidad de datos tiene varias dimensiones: exactitud (que se refleje lo que está
pasando), totalidad (que se encuentren los datos completos en el sistema), oportunidad (accesible
cuando sea necesario), relevancia, nivel de detalle y consistencia (mismos datos en todas las áreas
o sistemas), por lo que será necesario comprobar como son los datos en cada una de estas
dimensiones. De esta manera ya se puede empezar a descubrir los primeros conocimientos en los
datos, detectar aquellos conjuntos o subconjuntos de información interesantes para formar hipótesis
que permitan avanzar en el descubrimiento de información oculta.
Preparación de datos
En esta fase de preparación de datos se quieren cubrir todas las actividades necesarias para adaptar
los datos origen en bruto y aproximarlos al conjunto de datos final (los datos que serán fuente de las
herramientas de modelado). Las tareas de preparación o de limpieza de datos van a ser realizadas
repetidas veces y no en cualquier orden. Entre estas tareas tenemos la selección de tablas, registros
y atributos, así como la transformación y la limpieza de datos para su preparación para las
herramientas de modelado.
Modelado
Como veremos en el próximo apartado, existen múltiples técnicas de modelado de datos, siendo en
esta fase del proceso cuando, tras el conocimiento adquirido, se seleccionan las adecuadas (siempre
de acuerdo a los objetivos de negocio y del proyecto) y se aplican.
En esta fase se buscan los siguientes cuatro tipos de relaciones:
Clases: las observaciones se asignan a grupos predeterminados.
Clusters: se construyen grupos de observaciones similares según un criterio prefijado.
Asociaciones: las observaciones son usadas para identificar asociaciones entre variables.
Patrones secuenciales: se trata de identificar patrones de comportamiento y tendencias.
Entre estas técnicas podemos encontrar: la caracterización o resumen, la discriminación o contraste,
el análisis de asociación, la clasificación, la predicción, el clustering o la detección de agrupamientos,
la detección de anomalías, el análisis de la evolución y de la desviación… También existen
diferentes técnicas para resolver el mismo tipo de problema de minería de datos. Algunas técnicas
tienen requerimientos específicos sobre la forma de datos. Por lo tanto, volver a la fase de
preparación de datos para adecuar estos a la técnica pues ser necesario.
Evaluación
Como resultado de la fase anterior, en esta etapa en el proyecto ya se ha construido un modelo.
Para asegurarnos de que se cumple con los estándares de calidad propuestos para el proyecto es
necesario evaluarlo desde una perspectiva de análisis de datos. Es decir, antes del proceder al
despliegue final y su puesta en producción, es importante realizar una batería de pruebas junto con
la revisión de cada paso ejecutados en la creación del modelo, que ayude a comparar el modelo
obtenido con los objetivos de negocio. Un objetivo clave es determinar si se han cubierto todas las
expectativas de negocio, asegurando que no hay “gaps” o lagunas que no hayan sido cubiertas.
Despliegue o Explotación
En esta fase se realiza la explotación y uso de los resultados del proceso de Data Mining lo que,
dependiendo de los requerimientos, puede ser tan sencillo como la generación de un informe o tan
complejo como la realización repetida de un proceso cruzado de minería de datos a través de la
empresa. Por lo que, en muchos casos, es el propio cliente y no el analista de datos, quien realiza la
explotación. Data Mining es un proceso iterativo, por lo que, la creación del modelo no implica el final
del proyecto. El conocimiento ganado como resultado del proceso es perfectamente utilizable de
nuevo como información de entrada para volver a realizar otro ciclo del proceso KKD completo.
Técnicas de Data Mining
Existe una relación entre los tipos de patrones que se pueden descubrir y las tareas empleadas en el
proceso de Data Mining o minería de datos. Se puede decir que existen dos tipos de tareas de
minería de datos: aquellas orientadas a describir las propiedades generales de los datos existentes,
y las tareas orientadas a la predicción, estas intentan realizar predicciones basadas en la inferencia
de los datos disponibles.
una breve lista donde se describen estas técnicas.
Caracterización o resumen. La caracterización de datos consiste en la realización de un
resumen de las características generales de los objetos de una clase y produce lo que se
denomina normas características. Los datos correspondientes a una clase especificada por el
usuario son normalmente recuperados por una consulta de base de datos y ejecutada a través
de un módulo de integración para extraer la esencia de los datos para los distintos niveles de
abstracción.
Discriminación o contraste. La discriminación de datos produce lo que se denomina normas
discriminantes, que consiste básicamente en la comparación de las características generales
de los objetos entre dos clases, referidas como clase de objetivo y clase de contraste.
Análisis de asociación. Análisis de asociación es la búsqueda de lo que comúnmente se
llama como reglas de asociación. Se estudia la frecuencia con la que los dos o más elementos
aparecen juntos en las bases de datos transaccionales, y sobre la base de un umbral
denominado apoyo, identifica los conjuntos de elementos frecuentes. Otro umbral, la
confianza, que es la probabilidad condicional con la que un elemento aparece en una
transacción cuando otro elemento aparece, se utiliza para determinar las reglas de asociación.
Esta técnica es ampliamente en empresas de comercio electrónico para analizar la cesta de la
compra de sus clientes que ayude a identificar los gustos de los clientes.
Clasificación. La clasificación se basa en el análisis de la organización de los datos dentro de
las clases. También se conoce como clasificación supervisada, la clasificación usa las
etiquetas de la clase para ordenar los objetos dentro de la colección de datos.
El procedimiento normal consiste en la utilización de un grupo de aprendizaje o de testeo donde
todos los objetos ya se encuentran asociados a las etiquetas de clase conocidas. Posteriormente el
algoritmo de clasificación aprende de este conjunto de testeo y construye un modelo con el que se
clasifican los objetos nuevos.
Predicción. La predicción es una técnica muy interesante en un contexto de negocios por su
alto potencial y las implicaciones en caso de pronóstico exitoso. Existen dos grandes tipos de
predicciones: unos pueden tratar de predecir algunos valores de datos no disponibles o
tendencias dentro de estos datos, el otro puede predecir una etiqueta de clase para algunos
datos. Este último está vinculado a la técnica vista anteriormente, la clasificación.
Una vez que se construye un modelo de clasificación sobre la base de un conjunto de testeo, la
clase etiqueta de un objeto puede ser deducida sobre la base de los valores de atributo del objeto y
los valores de los atributos de las clases. Sin embargo, la predicción se refiere más frecuentemente
como deducción de valores numéricos inexistentes, o el incremento / disminución de las tendencias
en un plazo.
La idea principal es utilizar un gran número de valores pasados para determinar posibles
valores futuros.
Clustering o detección de agrupamientos. Similar a la clasificación, el clustering consiste
en la organización de los datos dentro de clases. Sin embargo, la diferencia se encuentre en
que, en esta técnica, se desconocen las etiquetas de las clases, por lo que es el algoritmo de
“clusterización” o agrupamiento el que se encarga de descubrir clases aceptables. La
“clusterización” también se conoce como su clasificación sin supervisión puesto que no se
realiza o no está dictada por las etiquetas de clase dadas.
Existen distintas maneras de aproximación a la “clusterización”, todos ellas basadas en el principio
de maximizar la similitud entre los objetos de una misma clase (similitud intraclase) y minimizar la
similitud entre los objetos de clases diferentes (similitud inter-clase).
Outlier analysis o detección de anomalías. Los valores atípicos son elementos de datos
que no pueden ser agrupados dentro de una clase dada o clúster. También se conocen como
excepciones, sorpresas o anomalías y a menudo son muy importantes de identificar. Mientras
que los valores atípicos suelen considerarse como ruido y ser desechado en algunas
aplicaciones; en otros dominios, estos valores pueden revelar un conocimiento muy
importante, por lo tanto, su análisis puede ser muy valioso aportando gran información a la
organización.
Evolución y análisis de desviación. La evolución y el análisis de desviación se refieren al
estudio de los datos y sus cambios dentro de una escala temporal.
La evolución analiza los modelos de tendencias en los datos, a través de la caracterización,
comparación, clasificación o agrupación de los datos dentro del marco temporal. Por otro lado, el
análisis de la desviación observa las diferencias entre los valores medidos y los valores esperados,
intentando determinar la causa de estas desviaciones.
Aplicaciones de Data Mining
Entre las distintas aplicaciones del Data Mining podemos encontrar las siguientes:
Comercio/Marketing, donde, a través del proceso KDD, podemos descubrir patrones de
compra o gustos de los clientes, que a su vez pueden ser utilizados para realizar
recomendaciones.
También se pueden descubrir patrones de compra de acuerdo a su edad, estado civil…, relacionar
las compras de los clientes de acuerdo a características comunes.
Banca/Seguros, la identificación de la capacidad adquisitiva de los clientes, perfil del cliente
de acuerdo a su grado de riesgo, medición del grado de lealtad o riesgo de fuga, detección de
patrones de uso fraudulento de tarjetas de crédito.
Se utiliza ampliamente en Seguros para señalar el uso fraudulento, la posibilidad de incrementar la
venta cruzada de acuerdo al perfil del cliente, determinar el grado de riesgo.
Salud. En este campo se están descubriendo nuevos usos cada día, siendo muy útil para, por
ejemplo, la segmentación de pacientes, la identificación de terapias médicas adecuadas para
diferentes enfermedades, la asociación de síntomas y la clasificación diferencial de
patologías, el estudio de factores de riesgo (genéticos, precedentes, hábitos, alimenticios,
etc.), en estudios epidemiológicos, análisis de rendimientos de campañas de información,
prevención, sustitución de fármacos, etc.