Sesión 2
Sesión 2
Para obtener datos se pueden utilizar varias herramientas, como por ejemplo el
scraping de información, qué básicamente es una técnica en la cual un
programa informático extrae datos del resultado generado por otro programa.
¿Para qué necesitamos conocimiento?
Para poder tener un panorama más amplio y poder tomar mejores decisiones
que beneficien a una empresa o a una persona.
Minería de datos busca construir un modelo sin disponer de cosas previas.
La minería captura los datos relevantes y se les manipula para luego construir
una vista minable de los datos.
Una vista es una consulta SQL que termina siendo como una tabla temporal de
los datos vistos de otra manera, de la manera que definamos.
Nosotros somos responsables de ir a buscar los datos y procesarlos para
realizar el modelo que se necesita.
Es importante que siempre nos hagamos preguntas para poder realizar el
modelo.
Etapa de minería de datos no es la más fácil, es la más directa.
Una base de datos relacional es un tipo de base de datos que almacena un
proporciona acceso a puntos de datos relacionados entre sí.
El modelo de minería de datos se construye a partir de una sola tabla, esto es
porque
Introducción al proceso KDD (extracción del conocimiento)
Proyectos de minería de datos y clasificación de los sistemas y tipos de
modelos de data mining
La inteligencia artificial, el aprendizaje automático (machine learning), el
aprendizaje estadístico, la minería de datos y el nuevo reto del big data
El proceso KDD (Knowledge Discovery in Databases)
¿Cómo se desarrolla un proyecto de minería de datos?
1. Elegir un origen de datos, como un cubo, una base de datos o incluso
archivos de texto o de Excel, que contenga los datos sin formato que
utilizará para generar los modelos
2. Defina un subconjunto de los datos del origen de datos que se usarán
para el análisis y guárdelos como vista del origen de datos
3. Defina una estructura de minería de datos para el modelado
4. Agregue modelos de minería de datos a la estructura, elija un algoritmo
y especifique el modo en que el algoritmo controlará los datos
5. Entrene los modelos rellenándolos con los datos seleccionados o con un
subconjunto filtrado de los datos
6. Explore, pruebe y genere modelos.
Cuando el proyecto esté completo, puede implementarlo para que los usuarios
lo examinen y lo consulten, o se puede proporcionar acceso mediante
programación a los modelos de minería de datos en una aplicación, para
permitir las predicciones y el análisis.
Tipos de modelos
Reglas de asociación: detecta asociaciones comunes entre elementos
Clustering: busca elementos afines dentro de un conjunto
Arboles de decisión: clasificación de elementos
Series temporales: para predecir una magnitud en función del tiempo
Naive Bayes: para explotar datos, puede usarse para buscar
correlaciones entre atributos
Redes neuronales: regresión y clasificación pero es difícilmente
descriptible.
Inteligencia Artificial
Es una rama de la informática:
Meta: conseguir que sistemas no naturales resuelvan (o ayuden a
resolver) los mismos problemas que resolvemos los humanos (de la
misma manera que nosotros)
Por tanto, estudia y resuelve problemas situados en la frontera de la
informática
Se basa en dos ideas fundamentales:
o Representación del conocimiento explícita y declarativa
o Resolución de problemas heurística
¿Qué es la inteligencia?
Consciencia
Comunicación
o Test de Turing
Sentimientos, sociabilidad
o Agentes sociales
o Kismet: (ver en youtube)
Creatividad
Percepción: visión, reconocimiento
Tipos de aprendizaje
Aprendizaje supervisado: establece una correspondencia entre las
entradas y las salidas del sistema, donde la base de conocimientos del
sistema está formada por ejemplos etiquetados a priori. La diferencia
entre el supervisado y no supervisado es la variable que se utiliza para
clasificar el dato. No es un identificador único, es el valor que permite
clasificar el dato en una categoría.
Aprendizaje no supervisado: el proceso de modelado se lleva a cabo
sobre un conjunto de ejemplos formados únicamente por entradas al
sistema, sin conocer su clasificación correcta
Aprendizaje por refuerzo: el algoritmo aprende observando el mundo
que le rodea y con un continuo flujo de información en las dos
direcciones realizando un proceso de ensayo-error, y reforzando aquellas
acciones que reciben una respuesta positiva en el mundo.
Aprendizaje estadístico
El aprendizaje estadístico se refiere a un conjunto de herramientas para
modelar y comprender conjuntos de datos complejos
Es un área desarrollada en estadística y combina desarrollos paralelos
en informática y, en particular, aprendizaje automático
Estas herramientas se pueden clasificar como supervisadas o no
supervisadas (ya que está dentro del aprendizaje automático).
Pero se refiere a un conjunto de técnicas o enfoques para estimar una
función f.
Minería de datos
El data mining (minería de datos, es el conjunto de técnicas que
permiten explorar grandes bases de datos, de manera automática o
semiautomática, con el objetivo de encontrar patrones repetitivos,
tendencias o reglas que expliquen el comportamiento de los datos en un
determinado contexto
o Determinación de los objetivos
o Preprocesamiento de datos
o Determinación del modelo
o Análisis de los resultados