0% encontró este documento útil (0 votos)
3 vistas4 páginas

Resumen Libro

La minería de datos puede llevar a decisiones erróneas si se aprende información incorrecta o irrelevante, y los patrones identificados pueden no reflejar reglas subyacentes útiles. Existen diferentes estilos de minería de datos, como la prueba de hipótesis y la minería dirigida y no dirigida, cada una con sus propias técnicas y objetivos. La preparación de datos y la selección de técnicas adecuadas son cruciales para lograr resultados significativos en la minería de datos.

Cargado por

lizsuarez03
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
3 vistas4 páginas

Resumen Libro

La minería de datos puede llevar a decisiones erróneas si se aprende información incorrecta o irrelevante, y los patrones identificados pueden no reflejar reglas subyacentes útiles. Existen diferentes estilos de minería de datos, como la prueba de hipótesis y la minería dirigida y no dirigida, cada una con sus propias técnicas y objetivos. La preparación de datos y la selección de técnicas adecuadas son cruciales para lograr resultados significativos en la minería de datos.

Cargado por

lizsuarez03
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd

¿¿Que puede salir mal en la minería de datos??

Aprender cosas que no son ciertas: Este es un problema peligroso dado a que llevan a tomar
decisiones empresariales importantes basadas en información incorrecta. La transformación
de los datos puede destruir u ocultar información importante.

Los patrones pueden no representar ninguna regla subyacente: El reto para los mineros
de datos es averiguar que patrones son útiles y cuáles no.
El conjunto de modelos puede no reflejar la población relevante: Para que las inferencias
sean validadas, el conjunto del modelo debe reflejar la población que el modelo debe
describir, clasificar o puntuar. Una muestra que no refleje adecuadamente la población
que se está puntuando esta sesgada.
Los datos pueden tener un nivel de detalle incorrecto: Al resumir los datos, elija un nivel
de agregación que no oculte patrones importantes dentro de un mismo periodo. Una
empresa con fuertes cambios semanales no debería informar sobre sus actividades de
forma mensual.

Aprender cosas que son ciertas, pero que no son útiles:


Aprender cosas que ya saben (o deberían saberse): La minería de datos debe
proporcionar nueva información. Aunque aprender cosas que ya se conocen tiene un
propósito útil. Demuestra que, a nivel técnico, las técnicas de extracción de datos
funcionan y los datos son razonablemente precisos.
Aprender cosas que no se pueden usar

Estilos de minería de datos:

Prueba de hipótesis: Una hipótesis es una propuesta de explicación cuya validez puede
comprobarse mediante el análisis de datos. Pasos de este estilo
o Generación de hipótesis: El objetivo es proponer ideas que se puedan probar y
poner en practica, para esto se puede apoyar en aportaciones de diversas de toda
la organización o también fuera de ella.
o Comprobación de hipótesis con los datos existentes: A veces es posible probar
una hipótesis buscando pruebas en los datos históricos existentes.
o Prueba de hipótesis y experimentación: Si bien hay hipótesis que pueden
probarse con datos históricos, otras no. Por tanto, para el segundo caso es
necesario definir un experimento con su respectivo grupo control con la finalidad
de poder cuantificar el impacto de la aplicación de las hipótesis planteadas, entre
los experimientos que se pueden usar esta:
 Control y tratamiento: Este consiste en crear dos grupos uno llamado
grupo de tratamiento que es donde se aplica el tratamiento o lo que se
busca probar y un grupo de control que es el que no recibe ninguna
afectación. Estos grupos se seleccionan lo mas parecido posibles, y
cualquier diferencia significativa entre los grupos puede atribuirse al
tratamiento.
 Pruebas A/B: Estas pruebas comparan dos tratamientos, aquí los grupos
reciben tratamientos diferentes con la finalidad de determinar el efecto
de cambio entre tratamientos.
 Pruebas Champions/Challenger: Es una forma de las pruebas A/B pero en
este caso se comparar un tratamiento nuevo llamado retador contra el
tratamiento existente llamado campeón.
Minería de datos dirigida: Se centra en una o más variables que son objetivos, y los datos
históricos contienen ejemplos de todos los valores objetivos. La minería de datos dirigida
no busca cualquier patrón en los datos sino patrones que expliquen los valores objetivos.
Las variables objetivo son los objetos de estudio y el resto de las variables se utilizan para
explicar o predecir los valores de los objetivos.
Minería de datos no dirigida: Esta no utiliza variables objetivo, no hay papeles especiales.
El objetivo es encontrar patrones generales y una vez detectados es responsabilidad de
una persona interpretarlos y decidir si son útiles. Aunque no haya variables objetivos, se
debe tener presente los objetivos empresariales.

Objetivos, tareas y técnicas: La minería de datos siempre comienza con un objetivo de negocio, y
es tarea de el conseguir una buena comprensión de ese objetivo. La siguiente tarea consiste en
replantear el objetivo empresarial en términos de tareas de minería de datos y solo entonces se
seleccionan las técnicas de minería de datos concretas.

Objetivos empresariales de la minería de datos: No todos los objetivos empresariales se


prestan a la minería de datos directamente, por tanto, necesitan ser convertidos a
objetivos de negocio de minería de datos, este se expresa en términos de algo medible.
Tareas de minería de datos: Son actividades técnicas que pueden describirse
independientemente de cualquier objetivo empresarial concreto.
o Preparación de los datos para su extracción (Preparación de los datos para la
minería de datos): El esfuerzo depende de la naturaleza de las fuentes de datos y
los requisitos de determinadas técnicas. Mejores datos significan mejores
modelos. Aquí se pueden realizar diferentes técnicas como:
 Resumir la información de transacciones para dejar registros por cliente
 Los datos categóricos representarlos de manera numérica para aquellas
técnicas que solo reciben este tipo de datos
 Tratar los datos faltantes y valores atípicos
 Equilibrar los datos
 Estandarizar las variables cuando se tienen diferentes escalas.
 Crear nuevas variables combinando las existentes
 Reducir el numero de variables mediante técnicas de componentes
principales y otras técnicas.
o Análisis exploratorio de datos: El análisis inicial en esta etapa tiene la incapacidad
de distinguir causa y efecto.
o Modelización de la respuesta binaria: Muchos de los objetivos empresariales se
reducen a separar dos categorías entre sí, por ejemplo, los buenos de los malos.
Aquí se pueden encontrar técnicas como la regresión logística.
o Clasificación de valores discretos y predicciones: Al categorizar, clasificar y graduar
la información buscamos comprender mejor el problema. La tarea de clasificación
se caracteriza por una buena definición de las clases y un conjunto de modelos
que consisten en ejemplos preclasificados.
o Estimación de valores numéricos: A partir de unos valores de entrada la estimación
proporciona un valor para una variable continua y desconocida.
o Búsqueda de agrupaciones y asociaciones: Aquí se busca definir los grupo de
afinidad donde se busca segmentar una población heterogénea en una serie de
subgrupos más homogéneas.
o Aplicación de un modelo a nuevos datos: La aplicación de un modelo a nuevos
datos se denomina puntuación. Una de las razones para aplicar un modelo a datos
que el valor objetivo ya se conoce es evaluar el modelo, una vez desplegado, su
objetivo es puntuar nuevos datos en los que se desconoce la probabilidad de
respuesta, clase o valor a estimar.

Técnicas de minería de datos: Un modelo es una explicación o descripción de cómo


funciona algo que refleja la realidad lo suficientemente bien como para que pueda
utilizarse para hacer inferencias sobre el mundo real.
Un modelo de minería de datos tiene dos propósitos:
1. Producir puntuación que puedan utilizarse para orientar decisiones
2. Proporcionar una visión de la relación entre las variables explicativas utilizadas para su
construcción y el objetivo.

Las técnicas de minería de datos se dividen en dos categorías: Dirigidas o no dirigidas, lo


que significa que unas técnicas requieren variable objetivo y otras no.

Se tiene un variable objetivo: Aquí encontramos técnicas como la regresión, los árboles de
decisión y las redes neuronales. En caso de tenerse se puede aplicar una técnica no dirigida como
la agrupación o el análisis exploratorio.

Para datos numéricos se tiene estrategias como los modelos de regresión, las redes neuronales,
los árboles de regresión, modelos de búsqueda de tablas.

Para datos binarios tendríamos, los árboles de decisión, las redes neuronales o la regresión
logística

También podría gustarte