0% encontró este documento útil (0 votos)
0 vistas10 páginas

22

La minería de datos se define como un conjunto de técnicas para descubrir información en grandes conjuntos de datos, utilizando herramientas informáticas y técnicas estadísticas. Este documento analiza herramientas comunes de minería de datos como IBM SPSS y SAS, y clasifica las técnicas en modelado dirigido por la teoría y modelado dirigido por los datos. Se presentan ejemplos prácticos y metodologías interactivas para entender los conceptos de minería de datos e inteligencia de negocios.

Cargado por

john morales
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
0 vistas10 páginas

22

La minería de datos se define como un conjunto de técnicas para descubrir información en grandes conjuntos de datos, utilizando herramientas informáticas y técnicas estadísticas. Este documento analiza herramientas comunes de minería de datos como IBM SPSS y SAS, y clasifica las técnicas en modelado dirigido por la teoría y modelado dirigido por los datos. Se presentan ejemplos prácticos y metodologías interactivas para entender los conceptos de minería de datos e inteligencia de negocios.

Cargado por

john morales
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

INTRODUCCIÓN

De un modo sencillo podemos definir la minería de datos como un conjunto de


técnicas encaminadas al descubrimiento de la información contenida en grandes
conjuntos de datos. Se trata de analizar comportamientos, patrones, tendencias,
asociaciones y otras características del conocimiento inmerso en los datos.
Actualmente se dispone de grandes cantidades de datos y es más necesario que
nunca poder analizarlos ordenadamente para extraer de un modo automatizado la
inteligencia contenida en ellos utilizando técnicas especializadas apoyadas en
herramientas informáticas. Estas técnicas constituyen la minería de datos.

El intenso desarrollo de las herramientas de tratamiento automatizado de la


información ha llevado aparejado el uso de las técnicas estadísticas de análisis
multivariante de datos de una forma sencilla. Al crecer los medios informáticos se ha
facilitado sobremanera la manejabilidad de los algoritmos estadísticos.

Pero por otro lado, podemos decir que las técnicas de minería de datos son tan
antiguas como la estadística misma. De hecho, las técnicas estadísticas que utiliza la
minería de datos coinciden en su mayoría con las técnicas estadísticas de análisis
multivariante de datos. Las herramientas de minería de datos presentan en sus menús,
de un modo ordenado, las técnicas de análisis multivariante de datos lógicamente
secuenciadas.

Este libro analiza las herramientas más habituales en minería de datos y sus
posibilidades de trabajo. Se utilizarán IBM SPSS, IBM SPSS MODELER, SAS, SAS
ENTERPRISE GUIDE y SAS ENTERPRISE MINER.
MINERÍA DE DATOS A TRAVÉS DE EJEMPLOS

A través de ejemplos totalmente resueltos a lo largo del libro se irán presentando


las diferentes técnicas de minería de datos. Los archivos se encuentran en la página
web de la editorial, para acceder a ellos, ingrese a [Link]
y dé doble clic en la imagen de la portada del libro.

Se trata de exponer, con sencillez y mediante una metodología interactiva, los


conceptos de minería de datos e inteligencia de negocios.

XIV © Alfaomega - RC Libros


CAPÍTULO

TÉCNICAS DE
MINERÍA DE DATOS Y
HERRAMIENTAS
CLASIFICACIÓN DE LAS TÉCNICAS DE MINERÍA DE
DATOS Y HERRAMIENTAS MÁS COMUNES
Inicialmente las técnicas de minería de datos pueden clasificarse en técnicas de
modelado originado por la teoría (en las que las variables pueden clasificarse en
dependientes e independientes), técnicas de modelado originado por los datos (en las
que todas las variables tienen inicialmente el mismo) y técnicas auxiliares.

Las técnicas de modelado originado por la teoría especifican el modelo para los
datos en base a un conocimiento teórico previo. El modelo supuesto para los datos
debe contrastarse después del proceso de minería de datos antes de aceptarlo como
válido. Formalmente, la aplicación de todo modelo debe superar las fases de
identificación objetiva (a partir de los datos se aplican reglas que permitan identificar
el mejor modelo posible que ajuste los datos), estimación (proceso de cálculo de los
parámetros del modelo elegido para los datos en la fase de identificación), diagnosis
(proceso de contraste de la validez del modelo estimado) y predicción (proceso de
utilización del modelo identificado, estimado y validado para predecir valores futuros
de las variables dependientes). Podemos incluir entre estas técnicas todos los tipos
de regresión y asociación, análisis de la varianza y covarianza, análisis discriminante y
series temporales.
MINERÍA DE DATOS A TRAVÉS DE EJEMPLOS

En las técnicas de modelado originado por los datos no se asigna ningún papel
predeterminado a las variables. No se supone la existencia de variables dependientes
ni independientes y tampoco se supone la existencia de un modelo previo para los
datos. Los modelos se crean automáticamente partiendo del reconocimiento de
patrones. El modelo se obtiene como mezcla del conocimiento obtenido antes y
después de la minería de datos y también debe contrastarse antes de aceptarse
como válido. Por ejemplo, las redes neuronales permiten descubrir modelos
complejos y afinarlos a medida que progresa la exploración de los datos. Gracias a su
capacidad de aprendizaje, permiten descubrir relaciones complejas entre variables
sin ninguna intervención externa.

Por su parte, las técnicas de clasificación extraen perfiles de comportamiento o


clases, siendo su objetivo construir un modelo que permita clasificar cualquier nuevo
dato. Asimismo, los árboles de decisión permiten dividir datos en grupos basados en
los valores de las variables. Esta técnica permite determinar las variables
significativas para un elemento dado. El mecanismo de base consiste en elegir un
atributo como raíz y desarrollar el árbol según las variables más significativas.
Además de las redes neuronales, los árboles de decisión y las técnicas de clasificación
(cluster, etc.), podemos incluir en este grupo las técnicas de reducción de la
dimensión (factorial, componentes principales, correspondencias, etc.), las técnicas
de escalamiento óptimo y multidimensional, y el análisis conjunto.

Las técnicas auxiliares son herramientas más superficiales y limitadas. Son nuevos
métodos basados en técnicas estadísticas descriptivas e informes.

A continuación se muestra una clasificación inicial de las técnicas de minería de


datos.
  Modelos de regresión
  Análisis de la varianza
 
  Series temporales
 Modelado dirigido por la teoría (Técnicas Predictivas ) 
  Análisis discriminante
  Árboles de decisión
 
  Redes neuronales


Técnicas 
  Análisis cluster
  Escalamiento multidimensional
 
 Modelado dirigido por los datos (Técnicas Descriptivas)  Escalamiento óptimo
  Reducción de la dimensión
 
  Segmentaci ón

Técnicas auxiliares  Proceso analítico de transacciones (OLAP)
  Reporting

2 © Alfaomega - RC Libros
CAPÍTULO 1: TÉCNICAS DE MINERÍA DE DATOS Y HERRAMIENTAS

Entre las herramientas de minería de datos más habituales tenemos actualmente el


software de IBM y el software de SAS. IBM dispone de las herramientas IBM SPSS
Statistics e IBM SPSS Modeler. La primera de ellas es un software para el trabajo
estadístico en general (que contiene varios procedimientos de minería de datos) y la
segunda es una herramienta específica de minería de datos sucesora de SPSS
Clementine. Por su parte SAS dispone del software estadístico general, de SAS
Enterprise Guide para el trabajo con procedimientos estadísticos y de minería por
menús y del software SAS Enterprise Miner, específico de minería de datos.

MODELADO ORIGINADO POR LA TEORÍA (TÉCNICAS


EXPLICATIVAS O DE LA DEPENDENCIA)
En los análisis que no es aceptable una importancia equivalente en las variables
que intervienen, porque alguna variable se destaca como dependiente principal
(MÉTODOS DE DEPENDENCIA), habrá que utilizar técnicas analíticas o inferenciales,
considerando la variable dependiente como explicada por las demás variables
independientes explicativas, y tratando de relacionar todas las variables por medio
de una posible ecuación o modelo que las ligue. El método elegido podría ser
entonces la regresión lineal, generalmente con todas las variables cuantitativas.

Una vez configurado el modelo matemático se podrá llegar a predecir el valor de


la variable dependiente conocido el perfil de todas las demás. Si la variable
dependiente fuera cualitativa dicotómica (1,0; sí o no) podrá usarse como
clasificadora, estudiando su relación con el resto de variables clasificativas a través
de la regresión logística.

Si la variable dependiente cualitativa observada constatara la asignación de cada


individuo a grupos previamente definidos (dos, o más de dos), puede ser utilizada para
clasificar nuevos casos en que se desconozca el grupo a que probablemente pertenecen,
en cuyo caso estamos ante el análisis discriminante, que resuelve el problema de
asignación en función de un perfil cuantitativo de variables clasificativas.

Si la variable dependiente es cuantitativa y las explicativas son cualitativas


estamos ante los modelos del análisis de la varianza, que puede extenderse a los
modelos loglineales para el análisis de tablas de contingencia de dimensión elevada.
Si la variable dependiente puede ser cualitativa o cuantitativa y las independientes
cualitativas, estamos ante el caso de la Segmentación.

Con la intención de clarificar un poco más ese tipo de técnicas de análisis de la


dependencia se presenta el cuadro siguiente, que las clasifica en función de la naturaleza
métrica o no métrica de las variables independientes y dependientes.
© Alfaomega-RCLibros 3
MINERÍA DE DATOS A TRAVÉS DE EJEMPLOS

MODELADO ORIGINADO POR LOS DATOS (TÉCNICAS


DESCRIPTIVAS O DE LA INTERDEPENDENCIA)
El investigador tendrá que considerar si asigna a todas sus variables una
importancia equivalente, es decir, si ninguna variable destaca como dependiente
principal (MÉTODOS DE INTERDEPENDENCIA) en el objetivo de la investigación. Si es
así, puede acudir para su tratamiento en bloque a lo que podría llamarse técnicas
multivariantes descriptivas.
Y puede hacerlo con dos orientaciones diferentes: por una parte, para reducir la
dimensión de una tabla de datos excesivamente grande por el elevado número de
variables que contiene y quedarse con unas cuantas variables ficticias que, aunque no
observadas, sean combinación de las reales y sinteticen la mayor parte de la información
contenida en sus datos. En este caso también deberá tener en cuenta el tipo de variables
que maneja. Si son variables cuantitativas, las técnicas que le permiten este tratamiento
pueden ser el Análisis de componentes principales y el Análisis factorial, si son variables
cualitativas, puede acudir al Análisis de correspondencias, y si son variables cualitativas
ordinales se acude al Escalamiento multidimensional.

4 © Alfaomega - RC Libros
CAPÍTULO 1: TÉCNICAS DE MINERÍA DE DATOS Y HERRAMIENTAS

La Tipología acepta variables cualitativas y cuantitativas. Por otra parte, la otra


orientación posible ante una colección de variables sin ninguna destacada en
dependencia, sería la de clasificar sus individuos en grupos más o menos homogéneos
con relación al perfil que en aquellas presenten, en cuyo caso utilizará por ejemplo el
Análisis de clusters, donde los grupos, no definidos previamente, serán configurados
por las propias variables que utiliza.

Con la intención de clarificar un poco más este tipo de técnicas de análisis de la


interdependencia se presenta el cuadro siguiente, que las clasifica en función de la
naturaleza métrica o no métrica de las variables.

EL ENTORNO DE TRABAJO DE IBM SPSS


Para empezar a trabajar con el programa, basta elegir la opción Programas del
menú Inicio de Windows y seleccionar la subopción IBM SPSS Statistics 20 de la opción
IBM SPSS Statistics (Figura 1-1). Se obtiene la pantalla temporal de la Figura 1-2 con
información de la versión. A continuación se obtiene la pantalla de la Figura 1-3, que
nos permitirá comenzar la tarea con SPSS de varias formas. Se puede comenzar
ejecutando el tutorial, introduciendo los datos para el análisis, ejecutando una consulta
en lenguaje SPSS creada anteriormente, creando una nueva consulta o abriendo una
fuente de datos ya existente u otro tipo de archivo a elegir en la Figura 1-3. No
obstante, si se desea que esta pantalla no vuelva a aparecer al ejecutar posteriormente
SPSS, basta señalar la casilla No volver a mostrar este cuadro de diálogo. Si se pulsa
Cancelar, se obtiene la pantalla de entrada de SPSS con la hoja de cálculo disponible
para introducir los datos de nuestro análisis en sus celdas (Figura 1-4). Cada columna
será una variable.

© Alfaomega-RCLibros 5
MINERÍA DE DATOS A TRAVÉS DE EJEMPLOS

Figura 1-1

Figura 1-2

Figura 1-3

6 © Alfaomega - RC Libros
CAPÍTULO 1: TÉCNICAS DE MINERÍA DE DATOS Y HERRAMIENTAS

Figura 1-4
La pantalla inicial de la Figura 1-4 (Editor de datos de SPSS), que es el marco de trabajo
inicial que se utilizará para introducir los datos y elegir el procedimiento adecuado para el
análisis. En la línea superior de esta pantalla vemos el icono de SPSS y el nombre del
archivo de datos activo. En la línea siguiente se presenta la barra de menú, que contiene
el menú general de SPSS con todas sus opciones (Archivo, Edición, Ver, Datos,
Transformar, Analizar, Marketing directo, Gráficos, Utilidades, Ventana y Ayuda). Cada
una de estas opciones contiene distintos procedimientos para el trabajo estadístico. La
tercera línea presenta la barra de herramientas, cuyo contenido son diferentes iconos
que permiten acceder rápidamente a los procedimientos más comunes en el trabajo con
la aplicación, sin necesidad de acudir al menú general (Figura 1-5). El significado de cada
icono puede verse dinámicamente situando el ratón sobre el propio icono.

Figura 1-5
Por orden de colocación de izquierda a derecha, los iconos de la barra de
herramientas significan lo siguiente:
-Abrir archivo
-Guardar archivo
-Imprimir
-Recuperar cuadros de diálogo
-Deshacer
-Rehacer
-Ir a caso
-Ir a variable
-Variables
-Buscar
© Alfaomega-RCLibros 7
MINERÍA DE DATOS A TRAVÉS DE EJEMPLOS

-Insertar caso
-Insertar variable
-Segmentar archivo
-Ponderar casos
-Seleccionar casos
-Etiquetas de valor
-Usar conjuntos de variables
-Mostrar todas las variables
-Corregir ortografía
Cuando se ha abierto un archivo en el editor (por ejemplo, abrimos el archivo
[Link] mediante Archivo → Abrir →Datos), en la línea situada debajo de la
barra de herramientas se presenta el nombre de la variable relativa a la celda en la
que están situados actualmente el cursor y su valor (Figura 1-6). En la parte inferior
de la Figura 1-6 se presentan las solapas Vista de datos (Figura 1-6) y Vista de
variables (Figura 1-7) para el fichero cargado actualmente. En la Vista de variables se
define nombre, tipo, anchura, número de decimales, etiquetas, rango de valores para
las categorías de las variables cualitativas, valores perdidos, columnas, tipo de
variable y papel de las variables. Para las variables, y en la Vista de datos se
introducen sus datos sobre las celdas. Cada columna es una variable.

Figura 1-6

Figura 1-7

8 © Alfaomega - RC Libros

También podría gustarte