0% encontró este documento útil (0 votos)
1 vistas5 páginas

Sesión 2

El documento aborda el proceso de minería de datos y su importancia en la toma de decisiones, destacando herramientas como el scraping y el proceso KDD. Se describen las etapas para desarrollar un proyecto de minería de datos, así como los tipos de modelos y técnicas de aprendizaje, incluyendo aprendizaje supervisado, no supervisado y por refuerzo. Además, se menciona la relevancia del Big Data y sus características fundamentales: volumen, velocidad y variedad.

Cargado por

jerry_miitchell
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
1 vistas5 páginas

Sesión 2

El documento aborda el proceso de minería de datos y su importancia en la toma de decisiones, destacando herramientas como el scraping y el proceso KDD. Se describen las etapas para desarrollar un proyecto de minería de datos, así como los tipos de modelos y técnicas de aprendizaje, incluyendo aprendizaje supervisado, no supervisado y por refuerzo. Además, se menciona la relevancia del Big Data y sus características fundamentales: volumen, velocidad y variedad.

Cargado por

jerry_miitchell
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd

SESIÓN 2

Para obtener datos se pueden utilizar varias herramientas, como por ejemplo el
scraping de información, qué básicamente es una técnica en la cual un
programa informático extrae datos del resultado generado por otro programa.
¿Para qué necesitamos conocimiento?
Para poder tener un panorama más amplio y poder tomar mejores decisiones
que beneficien a una empresa o a una persona.
Minería de datos busca construir un modelo sin disponer de cosas previas.
La minería captura los datos relevantes y se les manipula para luego construir
una vista minable de los datos.
Una vista es una consulta SQL que termina siendo como una tabla temporal de
los datos vistos de otra manera, de la manera que definamos.
Nosotros somos responsables de ir a buscar los datos y procesarlos para
realizar el modelo que se necesita.
Es importante que siempre nos hagamos preguntas para poder realizar el
modelo.
Etapa de minería de datos no es la más fácil, es la más directa.
Una base de datos relacional es un tipo de base de datos que almacena un
proporciona acceso a puntos de datos relacionados entre sí.
El modelo de minería de datos se construye a partir de una sola tabla, esto es
porque
Introducción al proceso KDD (extracción del conocimiento)
 Proyectos de minería de datos y clasificación de los sistemas y tipos de
modelos de data mining
 La inteligencia artificial, el aprendizaje automático (machine learning), el
aprendizaje estadístico, la minería de datos y el nuevo reto del big data
 El proceso KDD (Knowledge Discovery in Databases)
¿Cómo se desarrolla un proyecto de minería de datos?
1. Elegir un origen de datos, como un cubo, una base de datos o incluso
archivos de texto o de Excel, que contenga los datos sin formato que
utilizará para generar los modelos
2. Defina un subconjunto de los datos del origen de datos que se usarán
para el análisis y guárdelos como vista del origen de datos
3. Defina una estructura de minería de datos para el modelado
4. Agregue modelos de minería de datos a la estructura, elija un algoritmo
y especifique el modo en que el algoritmo controlará los datos
5. Entrene los modelos rellenándolos con los datos seleccionados o con un
subconjunto filtrado de los datos
6. Explore, pruebe y genere modelos.
Cuando el proyecto esté completo, puede implementarlo para que los usuarios
lo examinen y lo consulten, o se puede proporcionar acceso mediante
programación a los modelos de minería de datos en una aplicación, para
permitir las predicciones y el análisis.

 El modelo de minería de datos define el algoritmo o método de análisis


que utilizará en los datos. Para cada estructura de minería de datos,
agrega uno o varios modelos de minería de datos.
 Según el proyecto se puedne requerir:
o Combinar varios modelos
o Crear varios proyectos para cada tarea analítica
 Entrenar el modelo con los datos almacenados
 Explorar visualmente el modelo y realizar consultas para la obtención de
detalles
 Explotar el modelo: implementar el modelo:
o Asegurarse de que las opciones de procesamiento
o Actualizar el modelo con nuevos datos si procede

Tipos de modelos
 Reglas de asociación: detecta asociaciones comunes entre elementos
 Clustering: busca elementos afines dentro de un conjunto
 Arboles de decisión: clasificación de elementos
 Series temporales: para predecir una magnitud en función del tiempo
 Naive Bayes: para explotar datos, puede usarse para buscar
correlaciones entre atributos
 Redes neuronales: regresión y clasificación pero es difícilmente
descriptible.
Inteligencia Artificial
 Es una rama de la informática:
 Meta: conseguir que sistemas no naturales resuelvan (o ayuden a
resolver) los mismos problemas que resolvemos los humanos (de la
misma manera que nosotros)
 Por tanto, estudia y resuelve problemas situados en la frontera de la
informática
 Se basa en dos ideas fundamentales:
o Representación del conocimiento explícita y declarativa
o Resolución de problemas heurística

¿Qué es la inteligencia?
 Consciencia
 Comunicación
o Test de Turing
 Sentimientos, sociabilidad
o Agentes sociales
o Kismet: (ver en youtube)
 Creatividad
 Percepción: visión, reconocimiento
Tipos de aprendizaje
 Aprendizaje supervisado: establece una correspondencia entre las
entradas y las salidas del sistema, donde la base de conocimientos del
sistema está formada por ejemplos etiquetados a priori. La diferencia
entre el supervisado y no supervisado es la variable que se utiliza para
clasificar el dato. No es un identificador único, es el valor que permite
clasificar el dato en una categoría.
 Aprendizaje no supervisado: el proceso de modelado se lleva a cabo
sobre un conjunto de ejemplos formados únicamente por entradas al
sistema, sin conocer su clasificación correcta
 Aprendizaje por refuerzo: el algoritmo aprende observando el mundo
que le rodea y con un continuo flujo de información en las dos
direcciones realizando un proceso de ensayo-error, y reforzando aquellas
acciones que reciben una respuesta positiva en el mundo.
Aprendizaje estadístico
 El aprendizaje estadístico se refiere a un conjunto de herramientas para
modelar y comprender conjuntos de datos complejos
 Es un área desarrollada en estadística y combina desarrollos paralelos
en informática y, en particular, aprendizaje automático
 Estas herramientas se pueden clasificar como supervisadas o no
supervisadas (ya que está dentro del aprendizaje automático).
 Pero se refiere a un conjunto de técnicas o enfoques para estimar una
función f.

Minería de datos
 El data mining (minería de datos, es el conjunto de técnicas que
permiten explorar grandes bases de datos, de manera automática o
semiautomática, con el objetivo de encontrar patrones repetitivos,
tendencias o reglas que expliquen el comportamiento de los datos en un
determinado contexto
o Determinación de los objetivos
o Preprocesamiento de datos
o Determinación del modelo
o Análisis de los resultados

Las 3 V del Big Data:


 Volumen: no hablamos de GB, si no de TB, PB, EB o incluso ZB
 Velocidad: información generada a gran velocidad, como la de la bolsa
 Variedad: nuestra información puede ser estructurada o no serlo

También podría gustarte