0% encontró este documento útil (0 votos)
4 vistas69 páginas

Fundamentos de Deep Learning y ML

Cargado por

pomodessu
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
4 vistas69 páginas

Fundamentos de Deep Learning y ML

Cargado por

pomodessu
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

DEEP LEARNING

Machine Learning

• Inferencias sobre las


clases a las que
pertenecen los datos
• Predicciones a futuro
Diferencias ML DL

En Deep Learning

• No hay variables de entrada xi


• Las variables significativas las
debe encontrar el propio
modelo
Dataset Iris
• En ML le suministramos al
algoritmo cuatro características
(largo/ancho de sépalo/ pétalo).
Iris en Deep Learning
• En el caso de la clasificación de las plantas, no suministraríamos al
algoritmo las cuatro características o variables de entrada (largo/ancho
de sépalo/ pétalo).
• Podríamos entregar la fotografía de las plantas. En lugar de medir y
entregar al algoritmo cuatro características, le entrego la foto completa
para que sea el propio algoritmo el que segmente las fotos,
encontrando esas características u otras segmentaciones en las que
puede que no hubiéramos reparado.
Rendimiento Deep Learning
• El rendimiento no se
estanca a partir de un
cierto número de datos.
Cuantos más datos,
mejor.
Tipos de aprendizaje DL
• Los mismos que ML. Es un tipo de ML
Dataset MNIST
Aprendizaje supervisado. Dataset MNIST
Aprendizaje supervisado. Dataset MNIST
Aprendizaje NO supervisado. Dataset MNIST
Aprendizaje por refuerzo
Funcionamiento Deep Learning
• El mismo que DL. Redes neuronales
REDES NEURONALES EN
MACHINE LEARNING

CONSTRUCCIÓN DE
MODELOS
Construcción de un modelo ML. Clasificación

OBJETIVO: Crear un modelo que sea capaz de clasificar especies de una planta.
Una vez creado el modelo, le presentamos una nueva observación para que la
clasifique en una de las tres categorías Iris Versicolor, Iris Setosa o Iris Virginica.
Datos
Estadística Reglas
Estadística Reglas
ML Redes neuronales. Primera aproximación

Longitud sépalo x1
w1
Ancho sépalo x2 w2
S S =x1·w1+x2·w2+x3·w3+x4·w4
w3
Longitud pétalo x3 S entre 0 y 10 Iris Setosa
w4
S entre 10 y 20 Iris Virginica
Ancho pétalo x4 S entre 20 y 30 Iris Versicolor
ML Redes neuronales. Primera aproximación
Capa oculta
Multicapa
Completa
Reconocimiento de imágenes
Alimentada por datos no estructurados
Experimentando con redes. Clasificación
Entrenar una red neuronal consiste en ajustar cada uno de los pesos de las
entradas de todas las neuronas que forman parte de la red neuronal, para que las
respuestas de la capa de salida se ajusten lo más posible a los datos que
conocemos.
Experimentando con redes. Clasificación
Ejemplo. Para detectar si la imagen es un gato o no. El grosor de cada flecha
representa el peso que tiene esa entrada en la red neuronal. A medida que se van
ajustando los pesos el error disminuye.
Experimentando con redes. Clasificación

● Curso intensivo ML Google

● TensorFlow playground
Experimentando con redes. Clasificación
Para conseguir buenos resultados, es importante utilizar un elevado número de
imágenes para realizar el entrenamiento, tanto de imágenes que son gatos
(etiquetadas como 1) como de imágenes que no son gatos (etiquetadas como 0),
incluyendo la mayor variabilidad posible.
Experimentando con redes. Clasificación
MACHINE LEARNING
IA, ML, DL
Qué es Machine Learning
● El Machine Learning es el diseño y estudio de las herramientas informáticas
que utilizan la experiencia pasada para tomar decisiones futuras, aprendiendo
de los datos.

● El objetivo fundamental del Machine Learning es generalizar, o inducir una


regla desconocida a partir de ejemplos donde esa regla es aplicada.

● Machine Learning combina conceptos y técnicas de diferentes áreas del


conocimiento, como las matemáticas, estadísticas y las ciencias de la
computación.
Aplicaciones de Machine Learning
Amplia gama de aplicaciones. Entre otras:

● Motores de búsqueda
● Diagnósticos médicos
● Detección de fraude en el uso de tarjetas de crédito
● Análisis del mercado de valores
● Clasificación de secuencias de ADN
● Reconocimiento del habla y del lenguaje escrito
● Juegos y robótica.
Tipos de Aprendizaje automático

● Aprendizaje supervisado

● Aprendizaje no supervisado

● Aprendizaje por refuerzo


Aprendizaje supervisado
Aprendizaje supervisado

● En los problemas de aprendizaje supervisado se enseña o entrena al


algoritmo a partir de datos que ya vienen etiquetados con la respuesta
correcta.
● Cuanto mayor es el conjunto de datos más puede aprender el algoritmo.
● Una vez concluido el entrenamiento, se le alimenta con nuevos datos, ya
sin las etiquetas de las respuestas correctas, y el algoritmo de aprendizaje
utiliza la experiencia pasada que adquirió durante la etapa de
entrenamiento para predecir un resultado.
● Esto es similar al método de aprendizaje que se utiliza en el colegio,
donde se nos enseñan problemas y las formas de resolverlos, para que
luego podamos aplicar los mismos métodos en situaciones similares.
Aprendizaje supervisado
Aprendizaje no supervisado
Aprendizaje no supervisado

● En los problemas de aprendizaje no supervisado el algoritmo es entrenado


usando un conjunto de datos que no tiene ninguna etiqueta. Nunca se le
dice al algoritmo lo que representan los datos.
● Un ejemplo de este método es buscar grupos de clientes con hábitos de
compra similares.
● La idea es que el algoritmo pueda encontrar por sí solo patrones que ayuden
a entender el conjunto de datos.
● El aprendizaje no supervisado es similar al método que utilizamos para
aprender a hablar cuando somos bebés, en un principio escuchamos hablar
a nuestros padres y no entendemos nada; pero a medida que vamos
escuchando miles de conversaciones, nuestro cerebro comenzará a formar
un modelo sobre cómo funciona el lenguaje y comenzaremos a reconocer
patrones y a esperar ciertos sonidos.
Aprendizaje por refuerzo
Aprendizaje por refuerzo

● En los problemas de aprendizaje por refuerzo, el algoritmo aprende


observando el mundo que le rodea.
● Su información de entrada es el feedback o retroalimentación que obtiene
del mundo exterior como respuesta a sus acciones. Por lo tanto, el sistema
aprende a base de ensayo-error.
● Un buen ejemplo de este tipo de aprendizaje lo podemos encontrar en los
juegos, donde vamos probando nuevas estrategias y vamos seleccionando y
perfeccionando aquellas que nos ayudan a ganar el juego.
● A medida que vamos adquiriendo más práctica, el efecto acumulativo del
refuerzo a nuestras acciones victoriosas terminará creando una estrategia
ganadora.
Aprendizaje por refuerzo
Dudas

Fundamentos de ML y casos de uso:


● [Link]
Tfc
Introducción a la
Ciencia de los Datos
¿Qué es Data Science?

• No existe una definición de consenso, sino que difiere según las fuentes.
• Podemos decir que trata del estudio de la extracción generalizada de
conocimiento a partir de información, de datos.

• ¿Esto es algo nuevo? ¿No se parece a alguna ciencia con la que ya estamos
familiarizados?
Data Science y Estadística (I)
• La Estadística consiste en el estudio de la recolección, análisis, interpretación,
presentación y organización de datos.

• La Ciencia de Datos trata del estudio de la extracción generalizada de


conocimiento a partir de información, de datos.

• ¿Estamos hablando de lo mismo?


Data Science y Estadística (II)

• Existen diferencias:
• El enfoque de Data Science es más global, para partiendo de grandes volúmenes
de datos poder extraer conocimiento que aporte valor a una determinada
organización del tipo que sea.
• El foco principal se sitúa en la extracción de conocimiento, empleando para ello las
herramientas que estén al alcance.

• Veamos en qué se traduce lo anterior, mediante una definición más completa.


¿Qué es Data Science? (II)

• Técnicas y teorías de muchos campos dentro de amplias áreas como la


Matemática, la Estadística y las Tecnologías de la Información,
incluyendo: procesamiento de señales, modelos probabilísticos, machine
learning, aprendizaje estadístico, programación, ingeniería de datos,
reconocimiento de patrones, visualización, modelización de la incertidumbre,
data warehousing y computación de altas prestaciones.
¿Por qué ahora?
• Con la emergencia los últimos años del Big Data, existe una disponibilidad enorme
de datos tanto a nivel de Internet como en las organizaciones.
• Gobiernos y compañías han puesto énfasis en el valor de la cantidad de datos
disponibles y la posibilidad de extraer conocimiento de ellos, relevante para su
operativa y la ayuda a una mejor toma de decisiones.
El científico de datos (data scientist)
Hoy día un perfil muy demandado a nivel internacional es el de Data Scientist o
científico de datos, capaz de:

• Estudiar las diversas fuentes de información disponibles en una organización,


• Extraer datos a partir de diversos formatos tanto de bases de datos relacionales y no
relacionales como de muchos otros tipos y fuentes.
• Depurar los datos, analizarlos, idear y desarrollar algoritmos, realizar inferencias,
preparar y comunicar los resultados de dichos análisis y ser capaz de transmitir
conclusiones acerca de los estudios para finalmente repercutir en un mayor
conocimiento que ayude a la Gerencia del organismo o compañía a tomar mejores
decisiones.
Conocimientos necesarios

• Muchos de los conocimientos tienen que ver con la Matemática y la


Estadística, pero además se precisa de diversos conocimientos tecnológicos:

• Bases de datos relacionales, SQL


• Bases de datos no relacionales, Big Data, NoSQL…
• Lenguajes de programación: R, Python
• Machine Learning
• Programación de altas prestaciones, programación distribuida, Hadoop
Una oferta de trabajo actual…
Científico de datos

[Link]
Ideas fundamentales

Data Science es mucho más que estadística. La estadística es una pequeña parte de DS

Data Science persigue el conocimiento y la predicción a partir de los datos

Almacenar datos es cada vez más barato

Cada día se generan más datos

Cada día hay más capacidad de cálculo y más herramientas de análisis

El científico de datos debe poseer conocimientos multidisciplinares


BIG DATA
¿Qué es Big Data?

● Cantidades de datos a gran escala que sobrepasan la capacidad del software


convencional para ser capturadas, procesadas y almacenadas en un tiempo
razonable.
○ La cantidad de datos almacenadas en el mundo se está duplicando cada dos años
○ Cada día utilizamos muchos dispositivos

● Infraestructuras, tecnologías y servicios que han sido creados para poder
gestionar esta gran cantidad de información.
Big Data no son datos masivos
No nos referimos únicamente a los datos, sino sobre todo a la capacidad de
poderlos explotar para extraer información y conocimiento de valor.

Una vez recogida y almacenada la información, se deben extraer indicadores que


puedan ser útiles para tomar decisiones, incluso en tiempo real.
Características del Big Data. Las cinco “V”
Volumen: Cantidad de datos es “Big” cuando su almacenamiento, procesamiento
y explotación empieza a ser un reto para una organización.

Velocidad: Ritmo a los cuales los datos se están generando, que suele aumentar
constantemente

Variedad: Gran diversidad de formatos distintos. Esta diversidad:

○ Es clave para la riqueza de posibilidades del Big Data.


○ Aumenta la complejidad de almacenamiento, procesamiento y análisis.

Veracidad: Los datos tienen que ser confiables

Valor: Los datos y su análisis tienen que generar un beneficio para las empresas.
Tipos de Big Data

● Procedencia

● Estructura
Tipos de datos en Big Data
● Procedencia
○ Web y Redes Sociales.
○ Machine-to-Machine (M2M).
○ Transacciones.
○ Biométricos.
○ Generados por personas
■ Correos electrónicos.
■ Servicios de mensajería.
■ Grabaciones de llamadas.
○ Generados por organizaciones tanto públicas como privadas
■ Medioambientales.
■ Estadísticas gubernamentales sobre población y economía.
■ Historiales clínicos electrónicos.
Tipos de Big Data
● Estructura
○ Estructurados: datos que tienen definidos su formato, tamaño y longitud, como las base de
datos relacionales.
○ Semiestructurados: datos almacenados según una cierta estructura flexible
■ XML
■ HTML
■ JSON
■ Hojas de cálculo (CSV, Excel).
○ No estructurados: datos sin formato específico
■ Ficheros de texto (Word, PDF, correos electrónicos)
■ Contenido multimedia (audio, vídeo, o imágenes).

➔ Solo el 20% de información es estructurada y eso puede provocar muchos errores si no acometemos
un proyecto de calidad de datos.
➔ Se necesita mucho tiempo para transformar los tipos no estructurados en tipos estructurados y
procesar esos datos.
Para qué sirve el Big Data en las empresas
Las empresas que han entendido qué es Big Data y para qué sirve tienen:

● Dos veces más probabilidades de obtener un rendimiento financiero superior


que la media de sus industrias.
● Cinco veces más probabilidades de tomar decisiones mucho más rápido que
sus competidores.
● Tres veces más probabilidades de ejecutar las decisiones según lo previsto.
● El doble de probabilidades de tomar decisiones basadas en datos.
Ejemplos de qué es Big Data y para qué sirve
● Marketing: segmentación de clientes.
● Deportes: optimización del rendimiento. Sensores, smart watches
● Salud pública: decodificación de material genético para comprender mejor las
enfermedades y encontrar nuevos tratamientos.
● Nuevas tecnologías: desarrollo de dispositivos autónomos. Coches
inteligentes.
● Seguridad: detección y prevención de crímenes. Localizar a criminales o
prevenir actividades delictivas como ataques cibernéticos.
Herramientas Big Data
● Hadoop: Herramienta open source para gestionar, analizar y procesar datos.
Implementa MapReduce (soporte a la computación paralela).
● NoSQL: Sistemas que no usan el estándar de consulta SQL
● Spark: Para escribir aplicaciones en Java, Python, R y SQL sobre Hadoop
● Storm: Sistema de computación en tiempo real distribuido de código libre.
● Hive:Facilita la lectura, escritura y administración de grandes conjuntos de
datos con consultas SQL sobre Hadoop.
● R: Análisis estadísticos e integración con distintas bases de datos.
Retos del Big Data
● Tecnología: Herramientas como Hadoop
○ No son fáciles de administrar
○ Requieren profesionales de datos especializados
○ Mantenimiento costoso.
● Escalabilidad: un proyecto de Big Data puede crecer a gran velocidad
○ Asignar recursos para su continuidad.
● Profesionales escasos.
● Datos
○ Analizar los datos apropiados para alcanzar los objetivos de la empresa.
● Calidad de datos:
● Costes: Dimensionarlos correctamente
● Seguridad: Asegurar el acceso a los datos
○ Autenticación de usuarios, restricciones de acceso, cifrado de datos en tránsito o
almacenados y cumpliendo las principales normativas de protección de datos.

También podría gustarte