Módulo 2
Fundamentos de Machine
Learning
1
Índice
Objetivos .......................................................................................................................................... 5
Introducción .................................................................................................................................... 6
Tema 1. Algoritmos de Aprendizaje Supervisado ............................................................... 7
1.1 Regresión Lineal y Logística: Técnicas para predecir valores continuos y
probabilidades .......................................................................................................................................................... 7
1.1.1 Regresión Lineal: Principios y Aplicaciones .............................................................................. 7
1.1.2 Componentes Clave en la Regresión Lineal ............................................................................8
1.1.3 Regresión Logística: Clasificación Binaria y Probabilidades ......................................... 9
1.1.4 Comparación de Regresión Lineal y Logística....................................................................... 9
1.2 Clasificación: Modelos que permiten categorizar datos en clases; ejemplos
incluyen Máquinas de Soporte Vectorial (SVM) y Naive Bayes ............................................... 10
1.2.1 Clasificación y Su Importancia en Machine Learning .................................................... 10
1.2.2 Máquinas de Soporte Vectorial (SVM) ...................................................................................... 10
1.2.3 Naive Bayes: Modelo Probabilístico y Aplicaciones Prácticas ................................... 13
1.3 Árboles de Decisión y Random Forest: Herramientas para construir modelos
interpretables basados en decisiones ..................................................................................................... 15
1.3.1 Árboles de Decisión: Construcción y Aplicación en Problemas de
Clasificación ......................................................................................................................................................... 16
1.3.2 Random Forest: Combinación de Árboles para Mejorar la Precisión .................. 19
1.4 Redes Neuronales Básicas: Introducción a los conceptos de redes neuronales,
incluidas las multicapa ..................................................................................................................................... 20
1.4.1 Redes Neuronales Artificiales: Inspiración y Funcionamiento Básico ................. 21
1.4.2 Estructura y Funciones de una Neurona Artificial .......................................................... 21
1.4.3 Redes Multicapa: Incremento de la Complejidad y Aprendizaje Profundo ... 22
1.4.4 Aplicaciones Prácticas: Casos de Uso de Redes Neuronales Básicas y
Multicapa .............................................................................................................................................................. 23
1.5 Embeddings: Representación Densa de Características Complejas .......................... 23
1.5.1 Embeddings en Procesamiento de Lenguaje Natural (NLP) .................................... 24
1.5.2 Funcionamiento y Ventajas de los Embeddings ............................................................. 24
2
1.5.3 Algoritmos de Embeddings en Procesamiento de Lenguaje Natural ............... 25
1.5.4 Representación Vectorial y Similitud Semántica ............................................................. 25
1.5.5 Ajuste de Embeddings para Capturar Relaciones Complejas ................................ 26
1.5.6 Tipos de Embeddings y Ejemplos de Aplicación ............................................................. 26
1.5.7 Importancia de los Embeddings en el Procesamiento de Datos Complejos 27
1.5.8 Creación de Embeddings en Gráficos de Conocimiento ........................................... 27
Tema 2. Algoritmos de Aprendizaje No Supervisado ...................................................... 29
2.1 Clustering: Métodos como K-means para agrupar datos no etiquetados .............. 29
2.1.1 Funcionamiento del Algoritmo K-means .............................................................................. 29
2.1.2 Selección del Número Óptimo de Clusters: Método del Codo................................ 30
2.1.3 Ventajas y Limitaciones del K-means ....................................................................................... 31
2.1.4 Aplicaciones Prácticas del K-means.......................................................................................... 31
2.1.5 Tabla de ejemplos de métodos de clustering y sus aplicaciones prácticas ... 32
2.2 Análisis de Componentes Principales (PCA): Reducción de dimensiones para
mejorar la eficiencia del modelo ............................................................................................................... 33
2.2.1 Concepto y Objetivos del PCA ...................................................................................................... 33
2.2.2 Funcionamiento del PCA ................................................................................................................ 34
2.2.3 Ejemplos Prácticos de PCA ........................................................................................................... 34
2.3 Asociación: Técnicas para identificar patrones y relaciones en grandes conjuntos
de datos...................................................................................................................................................................... 36
2.3.1 Concepto y Objetivo de las Técnicas de Asociación ....................................................... 36
2.3.2 Reglas de Asociación y el Algoritmo Apriori....................................................................... 37
2.3.3 Tabla de ejemplos prácticos de asociación en diversos sectores ......................... 37
Tema 3. Técnicas de Evaluación de Modelos ..................................................................... 38
3.1 Validación Cruzada: Evaluación del rendimiento del modelo en diferentes
subconjuntos de datos ..................................................................................................................................... 38
3.1.1 Concepto y Funcionamiento de la Validación Cruzada ................................................ 38
3.1.2 Ejemplos de Aplicación en la Práctica .................................................................................... 39
3.2 Matriz de Confusión: Análisis de la precisión del modelo en tareas de clasificación
........................................................................................................................................................................................... 41
3.2.1 Estructura de la Matriz de Confusión........................................................................................ 41
3
3.2.3 Tabla de la estructura y ejemplos de aplicación de una matriz de confusión
.................................................................................................................................................................................... 44
3.3 Métricas de Evaluación: Introducción a las métricas clave como la precisión, el
recall, la F1-score y el ROC-AUC .................................................................................................................. 45
3.3.1 Importancia de las Métricas de Evaluación .........................................................................46
3.3.2 Precisión y su Aplicación Práctica ............................................................................................. 46
3.3.3 Recall y Casos de Uso ........................................................................................................................ 47
3.3.4 F1-Score: Equilibrio entre Precisión y Recall ....................................................................... 47
3.3.5 Área Bajo la Curva (ROC-AUC): Evaluación Gráfica del Modelo ............................ 48
3.3.6 Tabla de las principales métricas de evaluación y sus aplicaciones prácticas
..................................................................................................................................................................................... 50
Ejercicios prácticos ...................................................................................................................... 51
Ejercicio Práctico 1: Predicción de Gastos Médicos......................................................................... 51
Solucionario ......................................................................................................................................................... 51
Ejercicio Práctico 2: Segmentación de Clientes para Estrategias de Marketing ........ 52
Solucionario ........................................................................................................................................................ 53
Ejercicio Práctico 3: Evaluación de un Modelo de Clasificación de Clientes en Riesgo
de Cancelación ...................................................................................................................................................... 53
Solucionario ........................................................................................................................................................ 54
Resumen......................................................................................................................................... 56
Glosario ........................................................................................................................................... 58
Bibliografía .................................................................................................................................... 62
4
Objetivos
A continuación, se detallan los objetivos que busca alcanzar este módulo:
• Comprender los conceptos y principios fundamentales del Machine Learning.
• Conocer los distintos tipos de algoritmos supervisados y no supervisados y sus
aplicaciones prácticas.
• Aprender a evaluar el rendimiento de los modelos mediante técnicas de
validación y métricas de precisión.
• Desarrollar habilidades para seleccionar el tipo de algoritmo adecuado según el
problema y los datos disponibles.
Este enfoque permitirá una sólida base para aplicar Machine Learning en diferentes
contextos y con diversas finalidades, optimizando su impacto en soluciones
inteligentes.
5
Introducción
En el mundo actual, Machine Learning ha emergido como una de las áreas más
relevantes de la inteligencia artificial, impulsando innovaciones en múltiples sectores,
desde la medicina hasta las finanzas y la tecnología de consumo.
Este módulo, enfocado en los Fundamentos de Machine Learning, aborda los
aspectos teóricos y prácticos esenciales para comprender y aplicar modelos que
transforman datos en conocimiento y decisiones.
La importancia de Machine Learning radica en su capacidad para mejorar la precisión
en la predicción de resultados y en la automatización de tareas complejas, lo que lo
convierte en una herramienta invaluable para el avance tecnológico.
A lo largo de este módulo, se exploran los principales algoritmos supervisados y no
supervisados, que representan la base de muchos sistemas de recomendación,
reconocimiento de patrones y clasificación de datos.
Asimismo, se presentarán técnicas de evaluación de modelos que permiten validar y
optimizar el rendimiento de los algoritmos, asegurando su efectividad en distintos
contextos y aplicaciones.
Este tema es fundamental no solo por su aplicabilidad inmediata, sino también
porque establece los conocimientos necesarios para comprender desarrollos más
avanzados en IA. La comprensión profunda de estos conceptos permite al lector
abordar de forma crítica y efectiva la implementación de Machine Learning,
contribuyendo a su profesionalización en el campo de la inteligencia artificial.
6
Tema 1. Algoritmos de
Aprendizaje Supervisado
El aprendizaje supervisado es uno de los pilares en el campo del Machine Learning y
se basa en el uso de datos etiquetados para entrenar modelos que puedan hacer
predicciones o clasificaciones sobre datos nuevos.
Este planteamiento permite que los algoritmos aprendan de ejemplos concretos,
facilitando aplicaciones prácticas como la predicción de valores, la identificación de
patrones y la toma de decisiones automatizadas en entornos dinámicos.
A través del uso de distintos algoritmos, el aprendizaje supervisado ofrece la
capacidad de mejorar la precisión y efectividad en áreas tan diversas como la
detección de fraudes, la segmentación de clientes y el diagnóstico médico, lo que
contribuye a la innovación tecnológica y al desarrollo de soluciones prácticas en
múltiples sectores.
1.1 Regresión Lineal y Logística: Técnicas para
predecir valores continuos y
probabilidades
La regresión lineal y la regresión logística son técnicas esenciales en Machine
Learning, empleadas para modelar relaciones y hacer predicciones sobre variables en
función de los datos. La regresión lineal se utiliza principalmente cuando el objetivo
es predecir valores continuos, como ingresos o temperaturas, a partir de variables
independientes.
Por otro lado, la regresión logística se centra en problemas de clasificación,
permitiendo estimar la probabilidad de eventos binarios como “éxito/fallo” o
“fraude/no fraude”. Estas técnicas resultan indispensables en campos que requieren
precisión predictiva, como las finanzas, el marketing y la medicina, al facilitar
decisiones informadas y estratégicas.
1.1.1 Regresión Lineal: Principios y Aplicaciones
La regresión lineal es un método estadístico utilizado para predecir valores continuos
mediante la relación entre una variable dependiente y una o más variables
independientes. Su representación gráfica es una línea recta que minimiza el error de
predicción al ajustar los datos disponibles.
7
La fórmula de la regresión lineal simple, (y = b_0 + b_1x), representa cómo el valor de
(y) cambia en función de (x) y es muy valiosa para entender y prever comportamientos
de variables económicas y comerciales.
Una aplicación destacada es en finanzas, donde se emplea para proyectar tendencias
en el precio de activos.
Por ejemplo, se puede prever el precio de una acción basándose en indicadores
históricos como la volatilidad o el volumen de operaciones. Esta capacidad de
predicción es decisiva para optimizar la asignación de recursos.
Otro caso práctico es en salud pública, donde la regresión lineal se usa para estimar
el impacto de factores ambientales en la incidencia de enfermedades. Aquí, se
pueden analizar variables como el nivel de polución o la temperatura y su relación con
el incremento de afecciones respiratorias, permitiendo tomar decisiones informadas
en políticas de salud.
A continuación, se muestra el enlace a un video explicativo de la regresión lineal.
Enlace a video: [Link]
1.1.2 Componentes Clave en la Regresión Lineal
En el proceso de regresión lineal, la pendiente y la intersección son componentes
determinantes que configuran la relación entre las variables. La pendiente (o (b_1))
refleja el cambio en la variable dependiente por unidad de cambio en la
independiente, mientras que la intersección (o (b_0)) representa el valor de (y) cuando
(x) es cero.
Estos parámetros permiten ajustar el modelo y aplicarlo en diferentes contextos,
desde la predicción de costes de producción hasta el análisis del impacto de las ventas
en función de la publicidad.
La siguiente tabla describe y muestra un ejemplo práctico de la pendiente y la
intersección en el proceso de regresión lineal.
Componente Descripción Ejemplo Práctico
Intersección Valor de la variable dependiente Precio base de una vivienda
(b₀) cuando la independiente es cero en una zona específica
8
Componente Descripción Ejemplo Práctico
Pendiente Cambio en la variable Incremento de ventas por
(b₁) dependiente por unidad de cada campaña publicitaria
cambio en la independiente adicional
Tabla 1: Componentes en la regresión lineal
1.1.3 Regresión Logística: Clasificación Binaria y
Probabilidades
La regresión logística se utiliza para modelos de clasificación binaria, donde el
objetivo es determinar la probabilidad de que ocurra un evento. Su característica más
importante es el uso de la función sigmoide, que transforma la combinación lineal de
variables en una probabilidad entre 0 y 1. Esto la convierte en una herramienta muy
útil para predecir eventos en entornos de alta incertidumbre.
En el ámbito de la seguridad digital, este modelo permite identificar intentos de
ciberataques mediante patrones de actividad. Al detectar irregularidades en el tráfico,
como múltiples intentos de inicio de sesión, el modelo puede predecir la probabilidad
de que se trate de un intento de hackeo, activando mecanismos de seguridad
preventivos.
En el sector bancario, se emplea para analizar el riesgo de impago de clientes,
considerando factores como la antigüedad de la cuenta y el historial de crédito.
A continuación, se muestra el enlace a un video explicativo de la regresión logística.
Enlace a video: [Link]
1.1.4 Comparación de Regresión Lineal y Logística
Mientras que la regresión lineal se orienta a la predicción de valores cuantitativos, la
regresión logística se centra en clasificaciones binarias, siendo ambas técnicas
decisivas en la toma de decisiones estratégicas.
En marketing, una empresa puede usar la regresión lineal para prever el retorno de
una campaña publicitaria, mientras que la regresión logística ayuda a evaluar si un
usuario realizará una compra tras ver un anuncio.
9
1.2 Clasificación: Modelos que permiten
categorizar datos en clases; ejemplos
incluyen Máquinas de Soporte Vectorial
(SVM) y Naive Bayes
La clasificación en Machine Learning es una técnica que permite asignar datos a
distintas categorías o clases, facilitando la toma de decisiones en entornos que
requieren segmentación precisa.
Entre los modelos de clasificación más utilizados se encuentran las Máquinas de
Soporte Vectorial (SVM) y el algoritmo Naive Bayes.
Las SVM son eficaces en problemas de alta dimensionalidad, como el reconocimiento
facial o la detección de fraude, donde logran una separación clara entre clases
mediante hiperplanos.
Por otro lado, Naive Bayes, basado en principios probabilísticos, es ideal para tareas
de clasificación de texto y filtrado de spam, aportando rapidez y eficacia en el
procesamiento de grandes volúmenes de datos.
1.2.1 Clasificación y Su Importancia en Machine Learning
La clasificación es un área de Machine Learning que permite categorizar datos en
clases distintas basándose en patrones identificables en las características de entrada.
Los modelos de clasificación tienen aplicaciones en una amplia gama de sectores, ya
que ofrecen soluciones para problemas en los que el objetivo es determinar a qué
categoría pertenece un conjunto de datos.
En sectores como el marketing digital o la medicina, la clasificación permite tomar
decisiones precisas, optimizando recursos y mejorando los resultados de estrategias y
diagnósticos.
Dos modelos especialmente destacados para resolver problemas de clasificación son
las Máquinas de Soporte Vectorial (SVM) y el algoritmo de Naive Bayes, cada uno de
los cuales utiliza un planteamiento único y útil para distintas aplicaciones prácticas.
1.2.2 Máquinas de Soporte Vectorial (SVM)
Las Máquinas de Soporte Vectorial (SVM) son modelos de clasificación utilizados
principalmente para problemas donde se requiere una separación clara entre clases.
Su objetivo principal es encontrar el hiperplano óptimo que maximice el margen
10
entre las clases en el espacio de características, permitiendo clasificaciones más
precisas y generalizables en datos nuevos.
Figura 1: Gráfica ilustrativa del algoritmo de Máquinas de Soporte Vectorial (SVM).
Fuente:[Link]
aquinas-vectores-de-soporte-clasificacion-
teoria%2F&psig=AOvVaw3an7zHSm9wK3jny_RYYsJN&ust=1730450984575000&sourc
e=images&cd=vfe&opi=89978449&ved=0CBQQjRxqFwoTCLinvLOeuIkDFQAAAAAdA
AAAABAf
A. CONCEPTO DE MARGEN Y VECTORES DE SOPORTE
En el contexto de SVM, el margen se define como la distancia entre el hiperplano de
separación y los puntos más cercanos de cada clase, denominados vectores de
soporte. Estos vectores determinan la posición del hiperplano y son los puntos críticos
que influyen directamente en su ubicación. La SVM selecciona el hiperplano que
maximiza este margen, logrando una mejor capacidad de generalización.
Matemáticamente, el hiperplano en un espacio de características (n)-dimensional se
define como:
[w ∙ x + b = 0]
Donde:
• (w) representa el vector de pesos,
11
• (x) es el vector de características,
• (b) es un término de sesgo.
Para una clasificación binaria, los datos se separan en dos clases: una donde w⋅x+b>0
y otra donde w⋅x+b<0.
B. TIPOS DE SVM: HARD MARGIN VS. SOFT MARGIN
• Hard Margin: Se aplica cuando los datos son linealmente separables, es decir, que
es posible separar las clases sin errores de clasificación. En este caso, el modelo se
ajusta para crear un hiperplano sin admitir clasificaciones incorrectas.
• Soft Margin: En escenarios donde las clases no son completamente separables, se
permiten algunos errores de clasificación mediante el uso de variables de
holgura. El modelo minimiza la función objetivo que combina el margen y la
penalización por errores de clasificación:
C. SVM NO LINEALES Y KERNELS
Cuando los datos no son linealmente separables en el espacio original, se utiliza
un kernel para transformar los datos a un espacio de características de mayor
dimensión en el cual sean separables linealmente. Algunas funciones de kernel
comunes son:
• Kernel Lineal: Utilizado cuando los datos son aproximadamente lineales. Su
función es simplemente K (x, x′) =x⋅x′.
• Kernel Gaussiano (RBF): Utilizado para problemas no lineales, donde la similitud
entre puntos disminuye exponencialmente con la distancia.
La SVM no lineal realiza la separación mediante la función de kernel que calcula
la similitud entre vectores de soporte y nuevas instancias, asignándolas a la clase
correspondiente según el resultado de la suma ponderada de las similitudes. Así, una
SVM con un kernel Gaussiano puede capturar relaciones no lineales de forma
eficiente.
La siguiente tabla muestra las aplicaciones prácticas de del algoritmo de Máquinas
de Soporte Vectorial (SVM) y los tipos de kernel empleados.
12
Tipo de Kernel
Aplicación Utilizado Ejemplo de Uso
Clasificación de Lineal o Detección de spam en correos
Texto Gaussiano electrónicos
Reconocimiento de Gaussiano (RBF) Identificación de rostros en seguridad
Imágenes
Diagnóstico Médico Gaussiano o Clasificación de enfermedades
Polinómico mediante patrones genéticos o de
imagen
Tabla 2: Tipos de Kernel en SVM y Aplicaciones Prácticas
Además, SVM es popular en aplicaciones de reconocimiento facial, donde se clasifica
una imagen como perteneciente a un usuario específico o no.
Por ejemplo, la empresa Apple utiliza SVM en su tecnología de reconocimiento facial
para desbloquear dispositivos, basándose en características faciales de los usuarios.
El algoritmo permite una categorización rápida y precisa de las imágenes, lo cual es
ideal en entornos con grandes volúmenes de datos y alta demanda de exactitud.
1.2.3 Naive Bayes: Modelo Probabilístico y Aplicaciones
Prácticas
El Naive Bayes es un algoritmo de clasificación basado en el teorema de Bayes, que
asume una independencia condicional entre las características, es decir, que la
presencia de una característica en una clase es independiente de la presencia de otras
características.
Esta suposición simplifica considerablemente el modelo, haciendo que sea rápido y
eficiente, a la vez que obtiene buenos resultados en múltiples aplicaciones. Naive
Bayes es especialmente útil cuando se trabaja con grandes conjuntos de datos, dado
que su simplicidad permite realizar clasificaciones precisas sin requerir un alto poder
computacional.
13
A. FUNCIONAMIENTO DEL MODELO NAIVE BAYES
Naive Bayes utiliza el teorema de Bayes para calcular la probabilidad de que una
instancia pertenezca a una clase específica. La fórmula general del teorema de Bayes
es:
𝐏(𝐁|𝐀)×𝐏(𝐀)
P(A|B) =
𝐏(𝐁)
Donde:
• (P(A|B)) es la probabilidad de que ocurra (A) dado que (B) ha ocurrido (probabilidad
posterior).
• (P(B|A)) es la probabilidad de que ocurra (B) dado que (A) ha ocurrido (probabilidad
de verosimilitud).
• (P(A)) y (P(B)) son las probabilidades previas de (A) y (B) respectivamente.
En un contexto de clasificación, (A) representa una clase específica y (B) representa
una característica de los datos. Naive Bayes calcula las probabilidades para todas las
clases posibles y selecciona la clase con la probabilidad más alta.
B. VARIANTES DE NAIVE BAYES
Existen varias variantes del algoritmo Naive Bayes, cada una optimizada para tipos de
datos específicos:
• Naive Bayes Gaussiano: Se utiliza cuando los datos son continuos y se asume que
siguen una distribución normal.
• Naive Bayes Multinomial: Adecuado para datos discretos, como la frecuencia de
palabras en un análisis de texto.
• Naive Bayes Bernoulli: Ideal para datos binarios o de tipo sí/no, como la detección
de palabras en un correo electrónico.
C. APLICACIONES PRÁCTICAS DE NAIVE BAYES
Naive Bayes es ampliamente utilizado en aplicaciones prácticas, especialmente en
aquellas que requieren clasificación rápida y eficiente. Algunos ejemplos destacados
son:
14
Aplicación Tipo de Naive Bayes Ejemplo de Uso
Análisis de Naive Bayes Clasificación de reseñas en
Sentimientos Multinomial positivo/negativo
Filtrado de Spam Naive Bayes Bernoulli Clasificación de correos como
spam o no spam
Diagnóstico Naive Bayes Gaussiano Diagnóstico de enfermedades a
Médico partir de síntomas
Clasificación de Naive Bayes Clasificación rápida en
Imágenes Multinomial o Bernoulli reconocimiento facial
Tabla 3: Variantes de Naive Bayes y Aplicaciones Prácticas
1.3 Árboles de Decisión y Random Forest:
Herramientas para construir modelos
interpretables basados en decisiones
Los árboles de decisión y el método Random Forest son modelos de Machine
Learning diseñados para realizar predicciones claras y fáciles de interpretar. Los
árboles de decisión estructuran el proceso de toma de decisiones en una serie de
nodos que dividen los datos en ramas, permitiendo clasificar o predecir resultados a
partir de las características más relevantes.
Random Forest, por otro lado, crea múltiples árboles de decisión y combina sus
resultados para mejorar la precisión y evitar el sobreajuste, lo que lo hace
especialmente útil en problemas complejos.
Ambos modelos son ampliamente utilizados en áreas como la medicina, las finanzas
y la seguridad informática, donde se requiere una combinación de interpretabilidad
y precisión en la toma de decisiones.
15
1.3.1 Árboles de Decisión: Construcción y Aplicación en
Problemas de Clasificación
Los árboles de decisión son una técnica de aprendizaje automático utilizada para la
clasificación y la predicción, que permite tomar decisiones mediante una estructura
de árbol visual que muestra los caminos y resultados de cada opción.
Cada nodo representa una decisión o prueba en una característica específica, y las
ramas resultantes representan las opciones que se derivan de esta decisión. Esta
estructura facilita la comprensión del modelo y permite hacer predicciones precisas e
interpretables a partir de datos de entrada.
A. ESTRUCTURA Y FUNCIONAMIENTO DE UN ÁRBOL DE DECISIÓN
Un árbol de decisión se compone de varios elementos clave:
• Nodos de Decisión: Son puntos donde se realiza una prueba sobre una
característica específica. Cada nodo de decisión plantea una pregunta sobre un
atributo y divide los datos en subconjuntos en función de las respuestas.
• Hojas: Representan los resultados finales o categorías de predicción. Cada hoja
contiene una clase o valor específico que el árbol asocia con un conjunto de datos.
• Ramas: Conectan los nodos y hojas, representando las opciones o caminos
posibles a partir de cada decisión.
La estructura de los árboles de decisión es especialmente útil en problemas donde es
necesario tomar decisiones basadas en múltiples factores. El árbol se crea utilizando
un proceso de división iterativa, que selecciona las características más relevantes para
maximizar la pureza de las hojas.
Esto se hace mediante medidas de impureza como el índice de Gini o la entropía, las
cuales calculan la homogeneidad de los datos en cada nodo. Por ejemplo, al dividir un
nodo en función de una característica como el ingreso en un análisis de crédito, el
árbol buscará agrupar clientes de características homogéneas en términos de riesgo.
B. ALGORITMOS PARA LA CONSTRUCCIÓN DE ÁRBOLES DE DECISIÓN
Existen diversos algoritmos para construir árboles de decisión, siendo los más
conocidos el ID3, C4.5 y CART (Classification and Regression Trees):
• ID3: Usa el concepto de ganancia de información para seleccionar las divisiones
en cada nodo. El objetivo es maximizar la reducción de la incertidumbre al dividir
los datos.
16
• C4.5: Una mejora del ID3 que maneja datos continuos y permite la poda del árbol
para reducir el sobreajuste.
• CART: Este algoritmo crea árboles binarios (donde cada nodo tiene dos ramas) y
utiliza el índice Gini o la entropía para dividir los datos. Además, puede ser usado
tanto para clasificación como para regresión, lo que lo hace muy versátil.
C. VENTAJAS Y DESVENTAJAS DE LOS ÁRBOLES DE DECISIÓN
Los árboles de decisión son populares debido a varias ventajas:
• Interpretabilidad: La estructura visual del árbol hace que el proceso de toma de
decisiones sea claro y fácil de entender.
• Versatilidad: Pueden manejar tanto problemas de clasificación como de
regresión.
• Requieren poco preprocesamiento: No necesitan normalización de variables y
pueden manejar datos categóricos y continuos.
Sin embargo, presentan algunas limitaciones:
• Propensos al sobreajuste: Los árboles de decisión tienden a aprender en exceso
los datos de entrenamiento, lo que afecta su capacidad de generalización.
• Sensibles a cambios en los datos: Un pequeño cambio en los datos puede llevar
a una estructura de árbol completamente diferente.
• Dependencia de la complejidad: Un árbol muy profundo puede volverse
complejo, lo que afecta su interpretabilidad y capacidad de generalización.
17
Figura 2: Ventajas y desventajas de los árboles de decisión. Fuente:
[Link]
project-planning-decision-tree-analysis-2-es-
2x?io=transform:fill,width:1680&format=webp
La siguiente tabla muestra las aplicaciones prácticas de los Árboles de Decisión.
Aplicación Descripción Ejemplo Práctico
Diagnóstico Clasificación de pacientes en Detección temprana de
Médico función de síntomas y enfermedades cardíacas
antecedentes
Evaluación Clasificación del riesgo crediticio Decisión sobre aprobación
Crediticia de clientes de préstamos
18
Aplicación Descripción Ejemplo Práctico
Marketing Segmentación de clientes según Personalización de
el comportamiento de compra campañas de marketing
Estrategia de Evaluación de opciones Decisión sobre el
Negocios estratégicas y resultados lanzamiento de un
producto
Tabla 4: Aplicaciones Prácticas de los Árboles de Decisión
1.3.2 Random Forest: Combinación de Árboles para Mejorar
la Precisión
Random Forest es una extensión de los árboles de decisión, que combina múltiples
árboles independientes para formar un modelo más robusto y preciso. Al crear una
“jungla” de árboles, cada uno construye una predicción individual, y el modelo final
toma la decisión en función de la mayoría de los votos (clasificación) o del promedio
de los resultados (regresión).
Esta técnica reduce el riesgo de sobreajuste que presentan los árboles de decisión
individuales, permitiendo obtener resultados más consistentes y fiables.
En el sector financiero, Random Forest se aplica para predecir la probabilidad de
impago de un cliente, combinando múltiples factores como ingresos, antigüedad
crediticia y porcentaje de endeudamiento. Este modelo es ideal para los bancos, ya
que permite analizar conjuntos de datos grandes y variados, obteniendo una
clasificación precisa de los clientes según su perfil de riesgo.
Por ejemplo, en el ámbito de la logística el Random Forest se emplea para prever las
fluctuaciones en la demanda de productos. Considerando factores como la
temporada, la localización de los puntos de venta y las tendencias históricas, Random
Forest permite a las empresas logísticas planificar sus inventarios y optimizar la
distribución de los productos en función de las predicciones de demanda.
Además, en la industria tecnológica, Random Forest se aplica en la detección
de ciberataques. Las empresas de ciberseguridad construyen modelos que
combinan información sobre patrones de tráfico y comportamiento inusual en las
redes, logrando identificar amenazas con mayor precisión y anticipar posibles
ataques.
19
La combinación de múltiples árboles aporta una capacidad de detección más
detallada, permitiendo a los expertos actuar preventivamente en la seguridad de la
red.
La siguiente tabla establece una comparativa entre los usos y ventajas de los árboles
de decisión y el método Random Forest.
Modelo Características Ejemplos de Uso Ventajas
Árbol de Basado en Diagnóstico médico, Interpretabilidad y
Decisión decisiones predicción de riesgos en facilidad de uso
secuenciales con seguros, personalización
una estructura de en comercio electrónico
ramas
Random Combinación de Predicción de impago Precisión elevada y
Forest múltiples árboles en bancos, planificación reducción del
para mejorar de inventarios en sobreajuste
precisión logística, detección de
ciberataques
Tabla 5: Comparación entre Árboles de Decisión y Random Forest en el análisis de
datos
Ambos modelos, tanto los árboles de decisión como Random Forest, son
herramientas de gran utilidad para empresas que requieren decisiones rápidas y
efectivas basadas en múltiples variables.
Al proporcionar interpretabilidad y precisión, estos métodos se han convertido en
herramientas indispensables en sectores como la banca, la medicina y la tecnología,
donde la toma de decisiones basada en datos es prioritaria.
1.4 Redes Neuronales Básicas: Introducción a
los conceptos de redes neuronales, incluidas
las multicapa
Las redes neuronales básicas son modelos computacionales inspirados en el
funcionamiento de las neuronas biológicas, diseñadas para aprender y procesar
patrones complejos en los datos. Compuestas por capas de neuronas artificiales, estas
20
redes reciben información, la procesan mediante conexiones ponderadas y producen
un resultado.
Las redes multicapa, una versión avanzada de las redes neuronales básicas,
incorporan capas adicionales que les permiten resolver problemas de clasificación y
predicción no lineales. Su aplicación en áreas como la visión por ordenador, el
reconocimiento de voz y la detección de anomalías demuestra su eficacia en tareas
de aprendizaje profundo y toma de decisiones basada en datos.
1.4.1 Redes Neuronales Artificiales: Inspiración y
Funcionamiento Básico
Las redes neuronales artificiales (RNA) se inspiran en el funcionamiento del cerebro
humano, especialmente en cómo las neuronas biológicas se interconectan y procesan
información de forma distribuida y paralela. Una red neuronal básica consta
de neuronas artificiales o nodos, organizados en capas: una capa de entrada, capas
ocultas y una capa de salida.
Cada nodo recibe una serie de entradas, las procesa aplicando un peso sináptico y las
transforma mediante una función de activación. Este proceso permite que la red
aprenda patrones complejos y realice tareas de clasificación y regresión en distintos
tipos de datos.
Por ejemplo, en el reconocimiento de voz, una red neuronal puede aprender a
distinguir palabras mediante el análisis de señales acústicas. Los datos son
introducidos en la capa de entrada, donde cada nodo analiza fragmentos de la señal.
A través de las capas ocultas, la red extrae características relevantes y, en la capa de
salida, se genera la probabilidad de correspondencia con cada palabra.
Este proceso se realiza de manera rápida y adaptativa, permitiendo a los asistentes
virtuales reconocer distintos idiomas y patrones de voz con precisión.
1.4.2 Estructura y Funciones de una Neurona Artificial
La neurona artificial recibe varias señales de entrada que se ponderan mediante
pesos asignados y se suman. Esta suma es transformada por una función de
activación, que determina si la señal se transmitirá a la siguiente capa.
Entre las funciones de activación más utilizadas se encuentran la función sigmoide,
que convierte las entradas en un rango entre 0 y 1, y la función ReLU (Rectified Linear
Unit), que transmite valores positivos y filtra los negativos, acelerando el aprendizaje
en redes profundas.
21
Las aplicaciones de estos modelos se extienden a sectores como la finanza, donde las
redes neuronales ayudan a predecir el comportamiento de los mercados mediante la
identificación de patrones en series temporales.
Un ejemplo es el uso de RNA en la estimación de la probabilidad de cambio de
acciones, donde la función de activación ReLU es especialmente útil para manejar
grandes volúmenes de datos financieros y extraer características relevantes.
La siguiente tabla refleja los tipos de función de activación, así como las aplicaciones
que éstas tienen.
Tipo de Función Rango de Salida Aplicación
Sigmoide (0,1) Clasificación binaria
ReLU [0, ∞) Procesamiento de imágenes
Tanh (-1,1) Redes multicapa para tareas complejas
Tabla 6: Tipos de funciones de activación en neuronas artificiales
1.4.3 Redes Multicapa: Incremento de la Complejidad y
Aprendizaje Profundo
Las redes multicapa, o perceptrones multicapa (MLP), representan un avance
significativo respecto a las RNA básicas. Estas redes incluyen múltiples capas ocultas,
lo que les permite aprender patrones no lineales complejos y abordar problemas de
clasificación y predicción de mayor dificultad.
Una de las características clave de las redes multicapa es su capacidad de aprendizaje
mediante el algoritmo de retropropagación del error, que ajusta los pesos de las
conexiones minimizando el error de predicción a lo largo de las capas.
Un ejemplo práctico del uso de redes multicapa es en el diagnóstico médico, donde
ayudan a identificar enfermedades a partir de imágenes médicas. En estos casos, la
red aprende a detectar anomalías en radiografías o resonancias magnéticas, logrando
una precisión que apoya al diagnóstico médico.
En empresas de tecnología médica, como Siemens Healthineers, el uso de redes
multicapa en la detección temprana de cáncer mejora la calidad y rapidez del análisis
médico, permitiendo que los especialistas actúen de forma más informada y
temprana.
22
1.4.4 Aplicaciones Prácticas: Casos de Uso de Redes
Neuronales Básicas y Multicapa
Las redes neuronales básicas y multicapa han demostrado su valor en una amplia
gama de aplicaciones, desde la detección de fraudes en sistemas bancarios hasta la
personalización de recomendaciones en plataformas de streaming como Netflix.
En el sector financiero, las RNA permiten detectar transacciones sospechosas
analizando patrones de actividad en tiempo real. Los sistemas identifican actividades
inusuales, como transacciones de gran volumen en ubicaciones diferentes, y alertan
a las entidades bancarias, mejorando así la seguridad.
En el sector del entretenimiento, Netflix utiliza RNA multicapa para ofrecer
recomendaciones personalizadas a sus usuarios. El algoritmo analiza el historial de
visualización de cada usuario y utiliza esta información para sugerir contenido similar,
mejorando la experiencia del usuario y aumentando la retención en la plataforma.
1.5 Embeddings: Representación Densa de
Características Complejas
Los embeddings son representaciones numéricas densas que permiten transformar
características complejas de los datos en vectores de menor dimensión, manteniendo
la información relevante. Estas representaciones son especialmente útiles en
problemas que involucran datos no estructurados, como el procesamiento de texto,
imágenes o gráficos.
Al reducir la dimensionalidad de los datos de entrada, los embeddings facilitan el
trabajo de los algoritmos de Machine Learning al proporcionarles una entrada
manejable y coherente, logrando capturar relaciones entre palabras, imágenes u
objetos en un espacio vectorial común.
En lugar de trabajar directamente con datos en bruto, los embeddings codifican
información relevante en menos dimensiones, facilitando la captura de relaciones
complejas entre los datos y mejorando el rendimiento de los modelos. Estas
representaciones han demostrado ser de gran utilidad en áreas como el
procesamiento de lenguaje natural (NLP), la recomendación de productos y el análisis
de redes sociales.
23
1.5.1 Embeddings en Procesamiento de Lenguaje Natural
(NLP)
En NLP, los embeddings permiten representar palabras, frases o documentos como
vectores, de modo que palabras con significados similares tengan representaciones
cercanas en el espacio vectorial. Uno de los usos más conocidos de embeddings en
NLP es la creación de word embeddings, mediante técnicas
como Word2Vec o GloVe.
Estas técnicas permiten que palabras como “gato” y “perro” estén más próximas entre
sí en el espacio de embeddings, mientras que palabras como “coche” o “mesa” estarán
más alejadas. Este tipo de representación densa facilita tareas como la clasificación
de texto, el análisis de sentimientos y la traducción automática.
Por ejemplo, en una empresa de comercio electrónico, los word embeddings
permiten analizar la intención de búsqueda de los clientes para ofrecer resultados
relevantes. Si un usuario busca “pantallas de televisión”, el sistema puede
recomendarle otros productos relacionados, como soportes de pared o sistemas de
sonido, basándose en la proximidad semántica de las palabras en el espacio de
embeddings.
A continuación, se muestra el enlace a un video que explica de manera más visual qué
son los embeddings y cómo funcionan.
Enlace a video: [Link]
1.5.2 Funcionamiento y Ventajas de los Embeddings
Los embeddings se construyen utilizando redes neuronales, que aprenden a
representar características de los datos en espacios de menor dimensión mediante
entrenamiento supervisado o no supervisado.
Esta representación densa permite reducir el ruido de los datos y extraer sus
características más importantes, haciendo que los embeddings sean un método
altamente eficiente para representar grandes volúmenes de datos. A diferencia de las
representaciones tradicionales de datos, que suelen ser dispersas o escasamente
pobladas, los embeddings optimizan el procesamiento computacional y el
rendimiento del modelo.
La construcción de embeddings parte de entrenar un modelo que aprenda a
representar datos en un espacio vectorial de acuerdo con sus relaciones internas. En
NLP, esto implica representar palabras en vectores de dimensiones reducidas, donde
la cercanía entre palabras refleja similitudes semánticas.
24
Por ejemplo, palabras como “rey” y “reina” estarán próximas en el espacio vectorial, al
igual que “ciudad” y “pueblo”. Esta relación semántica es resultado de modelos de
entrenamiento que procesan enormes cantidades de texto para captar patrones de
co-ocurrencia y contextos de las palabras.
1.5.3 Algoritmos de Embeddings en Procesamiento de
Lenguaje Natural
En NLP, existen métodos específicos para generar embeddings que reflejan la
semántica del lenguaje. Word2Vec, desarrollado por Google, es uno de los más
conocidos y consta de dos enfoques principales: CBOW (Continuous Bag of
Words) y Skip-Gram. Ambos enfoques intentan predecir palabras en función de su
contexto, aunque difieren en la dirección de la predicción:
• CBOW predice una palabra en función de sus palabras vecinas, lo cual es eficaz en
la creación de embeddings para palabras comunes.
• Skip-Gram predice el contexto de una palabra dada, lo cual es útil en grandes
conjuntos de datos donde los contextos de palabras poco frecuentes pueden
proporcionar información valiosa.
Por otro lado, GloVe (Global Vectors for Word Representation), desarrollado por
Stanford, utiliza una estrategia distinta. En lugar de analizar el contexto de palabras
individuales, GloVe captura estadísticas globales de palabras en un corpus completo,
generando embeddings que reflejan relaciones semánticas de mayor alcance.
1.5.4 Representación Vectorial y Similitud Semántica
El funcionamiento de los embeddings se basa en representar cada unidad (palabra,
imagen, usuario, etc.) en un espacio vectorial de baja dimensión, donde cada vector
contiene una combinación ponderada de características que captura patrones de
similitud entre los datos. En la práctica, si los embeddings de dos palabras (o
entidades) están muy cercanos en este espacio, se interpreta que poseen una relación
semántica o una similitud significativa.
Por ejemplo, en una aplicación de recomendación de música, los embeddings
podrían representar géneros musicales, permitiendo que géneros similares, como
“jazz” y “blues”, queden próximos en el espacio de características.
Así, un sistema de recomendación basado en embeddings podrá sugerir
automáticamente artistas de blues a usuarios interesados en el jazz, aprovechando
esta representación densa de datos.
25
1.5.5 Ajuste de Embeddings para Capturar Relaciones
Complejas
Los embeddings no solo funcionan en NLP; también se aplican en otros contextos
donde es necesario capturar relaciones complejas en los datos. Un caso específico es
el de los gráficos de conocimiento (knowledge graphs), donde los embeddings
permiten representar entidades y relaciones en un espacio vectorial.
En este tipo de gráficos, las entidades (como “persona”, “lugar” o “empresa”) y sus
relaciones se transforman en vectores, lo que facilita la búsqueda y la organización de
la información en sistemas avanzados, como los motores de búsqueda. Google, por
ejemplo, utiliza embeddings de gráficos de conocimiento para mejorar los resultados
de búsqueda, conectando información de forma eficiente en base a su contexto
semántico.
Para garantizar que los embeddings capturen relaciones reales y no ruido, se
implementan técnicas de regularización durante el entrenamiento, que buscan
minimizar el sobreajuste. Esto es particularmente relevante en aplicaciones de redes
neuronales profundas, donde los embeddings se ajustan de acuerdo con la tarea
objetivo.
Por ejemplo, en una red de recomendación de productos, los embeddings se pueden
ajustar continuamente para representar no solo productos, sino también a los
usuarios, permitiendo que las recomendaciones se ajusten a las preferencias
individuales.
1.5.6 Tipos de Embeddings y Ejemplos de Aplicación
Existen diversos tipos de embeddings según el tipo de datos a representar y el objetivo
de la aplicación. Algunos de los embeddings más utilizados incluyen:
A. WORD EMBEDDINGS
Empleados principalmente en procesamiento de lenguaje natural (NLP), los word
embeddings convierten palabras en vectores que capturan relaciones semánticas.
Técnicas como Word2Vec y GloVe permiten representar palabras de forma que el
modelo entiende que “parís” y “francia” tienen una relación similar a “berlín” y
“alemania”.
Este tipo de embedding es útil en aplicaciones como los sistemas de recomendación
de contenido en Amazon, que sugieren productos basándose en el historial de
búsqueda de palabras clave de los usuarios (BBVA AI Factory, 2022).
26
B. EMBEDDINGS DE IMÁGENES
En visión artificial, los embeddings permiten convertir características visuales de
imágenes en vectores. Redes neuronales convolucionales (CNNs) extraen atributos
visuales, generando embeddings que representan aspectos de las imágenes como
formas, colores y patrones.
En reconocimiento facial, empresas como Facebook emplean embeddings de
imágenes para identificar rostros similares en fotos de usuarios, mejorando la
precisión en la detección de personas.
C. GRAPH EMBEDDINGS
Estos embeddings se utilizan para representar estructuras complejas en grafos, como
redes sociales o conexiones neuronales. Los grafos representan objetos y sus
relaciones, permitiendo que los modelos capturen tanto la información de los nodos
como de las relaciones.
Por ejemplo, en el análisis de redes sociales, los graph embeddings se usan para
predecir la probabilidad de que dos usuarios se conecten en función de sus relaciones
mutuas, aplicándose en plataformas como LinkedIn para recomendar contactos.
1.5.7 Importancia de los Embeddings en el Procesamiento
de Datos Complejos
Los embeddings ofrecen una solución práctica para manejar datos complejos en
modelos de aprendizaje automático al transformar información densa y no
estructurada en vectores que facilitan su análisis. Esto optimiza el rendimiento y la
capacidad del modelo para generalizar en nuevas tareas.
La flexibilidad de los embeddings permite su uso en diferentes campos,
adaptándose tanto a texto, como a imágenes y grafos, lo cual los convierte en una
herramienta versátil y poderosa en la inteligencia artificial moderna.
1.5.8 Creación de Embeddings en Gráficos de
Conocimiento
Los gráficos de conocimiento, o knowledge graphs, utilizan embeddings para
representar entidades y relaciones en un espacio vectorial, facilitando el
entendimiento de conexiones complejas entre conceptos. Este método es utilizado
por empresas como Google para entender cómo están relacionadas distintas
entidades, como nombres de personajes, lugares y eventos históricos.
27
Los embeddings en gráficos de conocimiento permiten realizar consultas complejas
y encontrar información relevante basada en relaciones no obvias, optimizando el
rendimiento de los motores de búsqueda.
A. EJEMPLO PRÁCTICO: EMBEDDINGS EN EL RECONOCIMIENTO DE IMÁGENES
En el campo del reconocimiento de imágenes, los embeddings permiten transformar
características visuales en vectores, facilitando la comparación y clasificación de
imágenes.
Un modelo de embeddings en una aplicación de e-commerce puede, por ejemplo,
organizar catálogos de ropa de acuerdo con características visuales, como estilo, color
o textura.
Si un usuario está interesado en un tipo específico de camisa, el sistema puede
recomendar productos similares con base en su posición en el espacio de
embeddings visual. Este tipo de representación permite que los modelos entiendan y
clasifiquen datos visuales de forma precisa y eficaz, mejorando la experiencia del
usuario.
28
Tema 2. Algoritmos de
Aprendizaje No Supervisado
El aprendizaje no supervisado es un campo de Machine Learning que permite a los
algoritmos descubrir patrones y relaciones dentro de los datos sin la necesidad de
etiquetas o clasificaciones predefinidas.
A diferencia del aprendizaje supervisado, aquí el modelo analiza los datos y estructura
la información en grupos o representaciones internas, lo que es de gran utilidad en
situaciones en las que no se dispone de un conjunto de datos clasificados. Esta
capacidad de identificar similitudes ocultas y tendencias en los datos hace que el
aprendizaje no supervisado sea esencial para tareas como la segmentación de
clientes, la detección de anomalías y la reducción de dimensionalidad.
Con estas técnicas, las empresas y organizaciones pueden extraer insights valiosos y
tomar decisiones informadas, optimizando sus procesos y mejorando sus estrategias
de análisis de datos.
2.1 Clustering: Métodos como K-means para
agrupar datos no etiquetados
El clustering es una técnica de aprendizaje no supervisado utilizada para agrupar
datos no etiquetados en conjuntos que comparten características similares. Uno de
los métodos más conocidos para realizar clustering es K-means, que organiza los
datos en función de su proximidad a ciertos puntos centrales llamados centroides.
Este proceso permite identificar patrones y relaciones ocultas entre los datos, siendo
de gran utilidad en aplicaciones como la segmentación de clientes en marketing, la
detección de patrones en medicina o la organización de grandes bases de datos. El
clustering facilita así el análisis de datos complejos, permitiendo tomar decisiones
informadas sin requerir etiquetas previas.
2.1.1 Funcionamiento del Algoritmo K-means
El algoritmo K-means es un proceso iterativo que asigna puntos de datos a uno de los
(K) clusters definidos. El funcionamiento básico del K-means puede resumirse en los
siguientes pasos:
29
A. INICIALIZACIÓN DE CENTROIDES
El algoritmo selecciona de forma aleatoria (K) centroides, que actuarán como puntos
centrales para los clusters.
B. ASIGNACIÓN DE DATOS A CLUSTERS
Cada punto de datos se asigna al cluster cuyo centroide esté más cercano,
generalmente calculando la distancia euclidiana.
C. ACTUALIZACIÓN DE CENTROIDES
Para cada cluster, el centroide se recalcula como la media de todos los puntos
asignados al cluster. Esto asegura que el centroide se desplace hacia la posición
óptima dentro de su grupo.
D. ITERACIÓN Y CONVERGENCIA
Los pasos 2 y 3 se repiten hasta que los centroides se estabilizan y los puntos de datos
no cambian de cluster, logrando así la convergencia.
Al final de este proceso, el K-means logra una agrupación en la que los datos de cada
cluster presentan una similitud interna máxima y una disimilitud externa respecto a
los datos de otros clusters.
2.1.2 Selección del Número Óptimo de Clusters: Método del
Codo
Uno de los principales desafíos al implementar K-means es la elección del número
óptimo de clusters (K). Para determinar el valor adecuado, se emplea el método del
codo o elbow method. Este método se basa en la suma de los errores al cuadrado
dentro de los clusters (inercia) y cómo disminuye con un mayor número de clusters.
En el método del codo:
1. Se ejecuta K-means con diferentes valores de (K).
2. Para cada (K), se calcula la inercia, que mide la dispersión de los datos dentro de
cada cluster.
3. Los valores de (K) se representan en un gráfico de inercia vs. número de clusters, y
el número óptimo es el punto donde la disminución de inercia empieza a
estabilizarse, formando un “codo”. Este punto marca el valor a partir del cual añadir
más clusters no reduce significativamente la dispersión, es decir, no mejora
mucho la agrupación.
30
El método del codo permite seleccionar un (K) adecuado de forma visual y sencilla,
asegurando que el número de clusters sea el más representativo posible para los
datos.
2.1.3 Ventajas y Limitaciones del K-means
El algoritmo K-means presenta varias ventajas y limitaciones:
A. VENTAJAS
• Simplicidad y Eficiencia: K-means es fácil de implementar y tiene un bajo coste
computacional, lo que lo hace adecuado para grandes volúmenes de datos.
• Versatilidad en Aplicaciones: K-means se utiliza en una variedad de aplicaciones
prácticas, como la segmentación de clientes, la agrupación de documentos y el
análisis de imágenes.
• Interpretabilidad: La simplicidad de los clusters obtenidos facilita la interpretación
de los resultados, lo que es beneficioso en aplicaciones donde la claridad del
modelo es esencial.
B. LIMITACIONES
• Sensibilidad a la Inicialización: La elección inicial de los centroides puede afectar
el resultado final, por lo que se recomienda ejecutar K-means varias veces con
diferentes inicializaciones.
• Dependencia de la Forma de los Clusters: K-means asume que los clusters son
esféricos y de tamaños similares. No es adecuado para datos donde los clusters
tienen formas irregulares.
• Número Fijo de Clusters: K-means requiere que el número de clusters se defina
previamente, lo que puede ser un desafío si no se conoce el valor adecuado de
antemano.
2.1.4 Aplicaciones Prácticas del K-means
La siguiente tabla describe y plantea ejemplos de uso de las distintas aplicaciones del
K-means:
31
Aplicación Descripción Ejemplo de Uso
Segmentación de Agrupación según patrones Personalización de
Clientes de compra campañas de marketing
Análisis de Imágenes Segmentación de colores Reconocimiento de
en imágenes objetos y seguridad
Agrupación de Clasificación temática de Recomendación de
Documentos textos artículos
Agrupamiento de Identificación de patrones Investigación de
Datos Genéticos en secuencias genéticas enfermedades genéticas
Tabla 7: Aplicaciones Prácticas del K-means
2.1.5 Tabla de ejemplos de métodos de clustering y sus
aplicaciones prácticas
La siguiente tabla ofrece una breve descripción de los métodos de clustering y plantea
ejemplos prácticos de cada método.
Método Descripción Ejemplos de Aplicación
K-means Agrupa datos en (K) clusters Segmentación de clientes,
basándose en la cercanía al visión artificial
centroide
Clustering Genera una jerarquía de clusters Clasificación de genes,
jerárquico mediante fusiones sucesivas de análisis de redes sociales
datos
DBSCAN Detecta clusters en función de Detección de anomalías,
densidad y distancia mínima análisis geoespacial
Tabla 8: Ejemplos de métodos de clustering y sus aplicaciones prácticas
32
El clustering y, en particular, K-means, ofrece un valor significativo para el análisis
exploratorio en ciencia de datos, permitiendo extraer información relevante de
grandes conjuntos de datos sin necesidad de supervisión.
2.2 Análisis de Componentes Principales
(PCA): Reducción de dimensiones para
mejorar la eficiencia del modelo
El Análisis de Componentes Principales (PCA) es una técnica de reducción de
dimensiones que permite simplificar conjuntos de datos con muchas variables,
conservando solo aquellas características que contienen la mayor cantidad de
información.
Al transformar las variables originales en componentes principales no
correlacionados, PCA facilita el análisis de grandes volúmenes de datos, mejorando la
eficiencia y velocidad de los modelos de aprendizaje automático.
Su aplicación es especialmente útil en áreas como el reconocimiento de imágenes, la
genómica y la detección de patrones financieros, donde ayuda a extraer los datos más
relevantes, optimizando así el rendimiento del modelo sin perder precisión.
2.2.1 Concepto y Objetivos del PCA
El Análisis de Componentes Principales (PCA) es una técnica de reducción de
dimensiones que busca transformar un conjunto de variables posiblemente
correlacionadas en un conjunto de componentes principales no correlacionados.
Su objetivo es simplificar los datos conservando la mayor cantidad de información
posible. En la práctica, PCA convierte las dimensiones originales en nuevas variables
llamadas componentes principales, ordenadas de tal manera que los primeros
componentes explican la mayor varianza posible en los datos.
La reducción de dimensiones es de gran utilidad para mejorar la eficiencia de los
modelos de Machine Learning, ya que permite trabajar con conjuntos de datos más
manejables y reducir el tiempo de procesamiento. Además, disminuye la complejidad
del modelo, ayudando a evitar el sobreajuste.
En contextos donde el número de características es alto, como en genética o análisis
de imágenes, el uso de PCA facilita una mejor interpretación de los datos y permite
centrar el análisis en las variables realmente relevantes.
33
2.2.2 Funcionamiento del PCA
PCA identifica las direcciones (componentes principales) en las que los datos varían
más y proyecta los datos en estas direcciones, logrando así una representación de
menor dimensión. Los pasos básicos de este proceso incluyen el escalado de los datos,
el cálculo de la matriz de covarianza, la obtención de los vectores propios y valores
propios y, finalmente, la proyección de los datos en las nuevas dimensiones
principales.
Un ejemplo clásico de aplicación de PCA es en el análisis de imágenes de alta
resolución. Imaginemos un conjunto de imágenes donde cada pixel actúa como una
característica independiente.
PCA reduce las dimensiones al identificar patrones y características comunes en estas
imágenes, permitiendo que un algoritmo de reconocimiento facial trabaje con menos
datos, sin sacrificar precisión. Así, el modelo puede identificar rostros o atributos
importantes en un menor tiempo y con mayor eficiencia, ya que PCA ha simplificado
el conjunto de datos original.
2.2.3 Ejemplos Prácticos de PCA
A continuación, se exponen tres ejemplos de la aplicación del Análisis de
Componentes Principales (PCA) en diferentes sectores.
A. EJEMPLO 1:
En el sector financiero, PCA se utiliza para reducir la cantidad de variables en el
análisis de riesgos. En lugar de analizar cientos de indicadores económicos y
financieros que pueden estar altamente correlacionados, PCA selecciona los
componentes que mejor explican el comportamiento del mercado, facilitando
decisiones informadas.
Una entidad bancaria, por ejemplo, podría aplicar PCA para reducir la complejidad en
el análisis de perfiles de riesgo, obteniendo una representación simplificada que
permite categorizar a los clientes de forma más precisa y rápida.
B. EJEMPLO 2:
En el campo de la biología molecular, PCA es determinante para el análisis de datos
genéticos. Con miles de variables genómicas por cada muestra, el uso de PCA ayuda
a encontrar patrones de expresión genética comunes en diferentes tipos de células o
en el desarrollo de enfermedades.
34
Empresas como Illumina, especializada en análisis de datos genómicos, emplean PCA
para detectar variaciones genéticas significativas en estudios de enfermedades
complejas, logrando así identificar posibles causas genéticas de enfermedades
crónicas.
C. EJEMPLO 3:
También en el procesamiento de textos y análisis de sentimientos, PCA contribuye
a reducir la dimensionalidad de las representaciones vectoriales de palabras
(embeddings) que utilizan modelos como Word2Vec o GloVe.
En el ámbito de las redes sociales, por ejemplo, se puede aplicar PCA para extraer los
principales temas de discusión en grandes volúmenes de datos textuales, reduciendo
el tiempo de procesamiento sin perder precisión en la interpretación de la
información. Esto permite a las empresas analizar de manera más rápida y eficiente
las opiniones de los usuarios sobre sus productos.
Sector Aplicación de PCA Beneficios
Finanzas Análisis de riesgos, Reducción de variables,
simplificación de mejor clasificación de
indicadores clientes
Biología Molecular Análisis de datos genéticos, Identificación de patrones
expresión génica genéticos relevantes
Procesamiento de Reducción de dimensiones Mayor eficiencia en análisis
Textos en embeddings de sentimientos
Tabla 9: Aplicaciones de PCA en distintos sectores
PCA es una herramienta indispensable en el análisis de datos, ya que permite trabajar
con modelos simplificados sin perder precisión, lo cual resulta en una ejecución más
rápida y un mejor rendimiento en los modelos de aprendizaje automático.
35
2.3 Asociación: Técnicas para identificar
patrones y relaciones en grandes conjuntos
de datos
Las técnicas de asociación en minería de datos permiten descubrir patrones
recurrentes y relaciones significativas dentro de grandes conjuntos de datos.
Mediante reglas de asociación, es posible identificar elementos que suelen aparecer
juntos, como en el caso de productos frecuentemente comprados en conjunto o
síntomas comunes en pacientes de ciertas patologías.
Estas técnicas son valiosas para optimizar decisiones estratégicas en sectores como el
comercio, la medicina y las ciencias sociales, pues permiten no solo analizar
comportamientos de forma automatizada, sino también anticipar tendencias. Las
reglas de asociación facilitan así una toma de decisiones informada y basada en
patrones objetivos.
2.3.1 Concepto y Objetivo de las Técnicas de Asociación
Las técnicas de asociación en el análisis de datos son métodos de minería que
permiten identificar relaciones frecuentes entre elementos de un conjunto de datos
sin necesidad de supervisión.
Estas técnicas se basan en el descubrimiento de patrones recurrentes o itemsets que
aparecen juntos en distintos registros, proporcionando información clave sobre las
conexiones ocultas entre variables.
Uno de los enfoques más comunes en asociación es el uso de reglas de asociación,
que permiten determinar qué elementos tienden a ocurrir de manera conjunta,
facilitando la extracción de conocimiento en ámbitos como el comercio, la medicina
y las ciencias sociales.
En términos prácticos, la asociación se usa para analizar la frecuencia de co-
ocurrencias entre diferentes variables y así crear reglas de tipo “si… entonces…”. Esto
facilita no solo la identificación de patrones, sino también la predicción de
comportamientos.
Por ejemplo, en el comercio minorista se podría descubrir que los clientes que
compran ciertos productos suelen adquirir otros específicos, lo que aporta
información valiosa para mejorar estrategias de ventas y optimizar la disposición de
productos en tiendas.
36
2.3.2 Reglas de Asociación y el Algoritmo Apriori
Las reglas de asociación se representan de la forma “si X, entonces Y”, y se calculan
en función de métricas como el soporte (frecuencia de aparición de un patrón) y
la confianza (probabilidad de que el patrón se cumpla en casos específicos).
Uno de los algoritmos más empleados en la generación de estas reglas es
el algoritmo Apriori, que permite descubrir relaciones recurrentes al identificar
itemsets frecuentes en grandes bases de datos.
Un ejemplo común del uso de Apriori se encuentra en los supermercados, donde se
analiza el comportamiento de los clientes en sus compras. Este análisis de la “cesta de
la compra” ha revelado, por ejemplo, que los clientes que compran pan y mantequilla
suelen también adquirir leche. Esta información ayuda a diseñar promociones
conjuntas, ajustar el stock y colocar productos estratégicamente en el supermercado.
El Apriori también permite trabajar con grandes volúmenes de datos, haciendo que el
análisis de asociaciones sea eficiente y altamente aplicable en el sector retail.
2.3.3 Tabla de ejemplos prácticos de asociación en diversos
sectores
Las técnicas de asociación, mediante reglas y patrones recurrentes, son un recurso
valioso en el análisis de datos para descubrir relaciones significativas y tomar
decisiones estratégicas basadas en hechos. La siguiente tabla expone algunos
ejemplos de asociación en distintos sectores.
Sector Ejemplo de Aplicación Beneficios
Comercio Análisis de cesta de Optimización de ventas y
Minorista compra promociones
Medicina Detección de patrones de Mejora en diagnósticos y
síntomas tratamientos personalizados
Redes Análisis de interacción de Personalización de contenidos y
Sociales usuarios publicidad
Ciencias Análisis de Segmentación de votantes y
Sociales comportamiento electoral estrategias de campaña
Tabla 10: Aplicaciones de técnicas de asociación en distintos sectores
37
Tema 3. Técnicas de Evaluación de
Modelos
Las técnicas de evaluación de modelos permiten analizar y validar el rendimiento de
los algoritmos de Machine Learning, garantizando que las predicciones generadas
sean precisas y útiles para aplicaciones prácticas.
Evaluar un modelo es un paso indispensable para medir su precisión, detectar errores
y evitar problemas como el sobreajuste, que afecta la capacidad de generalización en
datos nuevos.
Estas técnicas aportan un análisis detallado sobre métricas de desempeño, como la
precisión, el recall y la F1-score, lo que permite seleccionar el modelo más adecuado
según el objetivo. Gracias a la evaluación de modelos, los desarrolladores pueden
optimizar algoritmos, hacer ajustes necesarios y asegurar que su implementación sea
efectiva y confiable en escenarios reales.
3.1 Validación Cruzada: Evaluación del
rendimiento del modelo en diferentes
subconjuntos de datos
La validación cruzada es una técnica clave en la evaluación de modelos de Machine
Learning, utilizada para medir la capacidad de generalización y rendimiento de un
modelo en distintos subconjuntos de datos.
Dividiendo el conjunto de datos en varias partes, esta técnica permite entrenar y
probar el modelo en diferentes combinaciones, obteniendo así una evaluación más
precisa y menos susceptible a errores debidos al sobreajuste.
La validación cruzada es especialmente útil cuando el volumen de datos es limitado,
ya que maximiza el uso del conjunto de datos para entrenar y probar el modelo de
forma equilibrada. Su aplicación resulta indispensable en sectores como la medicina,
la banca y el análisis de texto, donde la precisión y la fiabilidad de las predicciones son
fundamentales para una implementación efectiva.
3.1.1 Concepto y Funcionamiento de la Validación Cruzada
La validación cruzada es una técnica empleada en la evaluación de modelos de
Machine Learning que permite comprobar la consistencia y robustez de un modelo
mediante la partición de los datos en subconjuntos.
38
El objetivo es obtener una evaluación precisa del rendimiento del modelo a través del
análisis en diferentes subconjuntos de datos, lo cual reduce la posibilidad de
sobreajuste y permite una generalización adecuada en datos nuevos.
En el procedimiento más común, conocido como k-fold cross-validation, los datos se
dividen en (k) subconjuntos o “folds”. El modelo se entrena en (k-1) subconjuntos y se
prueba en el subconjunto restante, repitiendo este proceso (k) veces y promediando
los resultados para obtener una métrica representativa del rendimiento.
La validación cruzada permite obtener una visión más completa del comportamiento
de los modelos, ya que cada subconjunto de datos se utiliza como conjunto de prueba
en alguna de las iteraciones. Este método es ideal en situaciones donde los datos son
limitados o cuando se necesita evaluar de forma objetiva los resultados de un modelo
en diferentes escenarios.
Entre las aplicaciones prácticas se incluyen áreas como la medicina, la banca y el
procesamiento de lenguaje natural, donde la capacidad de predicción y la fiabilidad
de los modelos son prioritarias.
3.1.2 Ejemplos de Aplicación en la Práctica
La validación cruzada asegura que los modelos de Machine Learning sean capaces
de generalizar en múltiples contextos, minimizando los errores de predicción y
garantizando un rendimiento confiable en distintos escenarios y aplicaciones
prácticas. A continuación, se plantean tres ejemplos de aplicación práctica de la
validación cruzada.
A. EJEMPLO 1:
En el campo de la medicina, la validación cruzada se utiliza para evaluar modelos
predictivos en estudios clínicos y diagnósticos. Imaginemos un modelo que analiza
imágenes médicas para identificar señales de una enfermedad específica.
Dividir el conjunto de imágenes en varios subconjuntos y evaluar el modelo con
validación cruzada permite detectar si el modelo es capaz de identificar patrones de
la enfermedad en muestras no vistas anteriormente.
Esta técnica ayuda a garantizar que el modelo mantenga una precisión adecuada en
casos clínicos diversos, lo cual resulta indispensable en aplicaciones donde la precisión
en el diagnóstico puede afectar directamente la calidad de vida de los pacientes.
39
B. EJEMPLO 2:
Otro ejemplo se da en la banca, en el análisis de perfiles de crédito. Un banco podría
utilizar un modelo predictivo para evaluar el riesgo de impago de clientes nuevos. La
validación cruzada permite entrenar y probar este modelo en diferentes subconjuntos
de datos, lo cual asegura que el modelo no solo se adapta a patrones en un conjunto
específico de clientes, sino que tiene la capacidad de generalizar en distintos perfiles
crediticios.
Así, el banco reduce el riesgo de fallos en el modelo y asegura una estimación más
fiable del perfil de riesgo de cada cliente.
C. EJEMPLO 3:
En el ámbito del procesamiento de lenguaje natural (NLP), la validación cruzada
también juega un papel importante. Imaginemos un modelo entrenado para analizar
opiniones de clientes en reseñas de productos y clasificarlas como positivas o
negativas.
Al aplicar validación cruzada, se evalúa el modelo en diferentes subconjuntos de
textos, lo cual asegura que el modelo sea capaz de clasificar correctamente las
opiniones de clientes con distintos estilos de escritura, aumentando su precisión en
análisis de sentimientos en redes sociales o sitios de reseñas.
La siguiente tabla resume de manera más visual los beneficios de los ejemplos
anteriores en cada sector.
Sector Ejemplo de Aplicación Beneficios
Medicina Detección de patrones en Mejora en diagnósticos y
imágenes médicas fiabilidad del modelo
Banca Evaluación de riesgo Reducción del riesgo de
crediticio sobreajuste en perfiles
crediticios
Procesamiento de Clasificación de opiniones Mayor precisión en análisis de
Texto de clientes sentimientos
Tabla 11: Ejemplos de aplicaciones de la validación cruzada en distintos sectores
40
3.2 Matriz de Confusión: Análisis de la
precisión del modelo en tareas de
clasificación
La matriz de confusión es una herramienta fundamental en la evaluación de
modelos de clasificación en Machine Learning. Permite evaluar la precisión del
modelo al visualizar el rendimiento de sus predicciones frente a los valores reales. La
matriz organiza las predicciones en cuatro categorías clave, ayudando a los analistas
a interpretar no solo la efectividad general del modelo, sino también a identificar áreas
de mejora al evaluar la cantidad de errores y aciertos en cada clase.
A continuación, se muestra el enlace a un video explicativo sobre el funcionamiento
de la matriz de confusión.
Enlace a video: [Link]
3.2.1 Estructura de la Matriz de Confusión
La matriz de confusión presenta los resultados en forma de una tabla cuadrada, en la
que se comparan las predicciones del modelo con los valores reales. La estructura
básica de la matriz en un problema de clasificación binaria se compone de las
siguientes categorías:
• Verdaderos Positivos (VP): Casos en los que el modelo predijo correctamente la
clase positiva.
• Falsos Positivos (FP): Casos en los que el modelo predijo la clase positiva
incorrectamente, cuando en realidad era negativa.
• Verdaderos Negativos (VN): Casos en los que el modelo predijo correctamente la
clase negativa.
• Falsos Negativos (FN): Casos en los que el modelo predijo la clase negativa
incorrectamente, cuando en realidad era positiva.
La matriz puede extenderse para problemas multiclase (con más de dos clases),
organizando los datos en una matriz cuadrada donde cada fila representa la clase real
y cada columna la clase predicha. Esta estructura permite un análisis detallado de la
precisión del modelo, facilitando la interpretación de los tipos de errores que comete
y en qué categorías.
41
Figura 3: Gráfica de la estructura básica de la Matriz de Confusión. Fuente:
[Link]
[Link]
A. MÉTRICAS DERIVADAS DE LA MATRIZ DE CONFUSIÓN
A partir de los valores en la matriz de confusión, se pueden calcular varias métricas
para evaluar el rendimiento del modelo en profundidad:
• Precisión: Es la proporción de predicciones correctas realizadas por el modelo y se
calcula como la suma de los VP y VN dividido entre el total de predicciones. Es una
métrica general que muestra el rendimiento global del modelo, pero puede ser
poco informativa en conjuntos de datos desbalanceados.
𝐕𝐏+𝐕𝐍
Precisión=
𝐕𝐏+𝐕𝐍+𝐅𝐏+𝐅𝐍
• Recall (Sensibilidad o Tasa de Verdaderos Positivos): Mide la capacidad del
modelo para identificar correctamente las instancias positivas. Es especialmente
útil en contextos donde es crucial detectar todos los casos positivos, como en
diagnósticos médicos.
𝐕𝐏
Recall =
𝐕𝐏+𝐅𝐍
42
• Especificidad: Es la proporción de verdaderos negativos sobre el total de casos
negativos. Esta métrica es relevante en situaciones donde los falsos positivos
pueden tener consecuencias significativas, como en sistemas de seguridad.
𝑽𝑵
Especificidad =
𝑽𝑵 +𝑭𝑷
• F1-Score: Combina precisión y recall en una única métrica armónica, útil para
problemas en los que es importante equilibrar ambas métricas. Un F1-score alto
indica que el modelo tiene un buen equilibrio entre precisión y recall.
𝑷𝒓𝒆𝒄𝒊𝒔𝒊ó𝒏 ×𝑹𝒆𝒄𝒂𝒍𝒍
F1-Score = 2 ×
𝑷𝒓𝒆𝒄𝒊𝒔𝒊ó𝒏 +𝑹𝒆𝒄𝒂𝒍𝒍
• Tasa de Falsos Positivos (FPR): Es la proporción de negativos incorrectamente
clasificados como positivos, importante en problemas de clasificación de riesgo o
detección de fraudes.
𝐹𝑃
Tasa de Falsos Positivos =
𝐹𝑃 +𝑉𝑁
Estas métricas brindan una visión integral del rendimiento del modelo, permitiendo
ajustar el balance entre los distintos tipos de errores y adaptar el modelo según las
necesidades del problema.
B. APLICACIONES PRÁCTICAS DE LA MATRIZ DE CONFUSIÓN
La matriz de confusión es aplicable en una amplia variedad de sectores y problemas
de clasificación, en los que permite realizar un análisis detallado de los errores.
Algunos ejemplos incluyen:
• Diagnóstico Médico: En aplicaciones de diagnóstico, como la detección de
enfermedades, la matriz de confusión es útil para evaluar la precisión de los
modelos al clasificar correctamente a los pacientes enfermos.
Por ejemplo, en un modelo de diagnóstico de cáncer, los VP representan a los
pacientes correctamente identificados como enfermos, mientras que los FN
corresponden a los casos en los que el modelo no detecta la enfermedad.
Minimizar los FN es crucial para evitar diagnósticos erróneos y asegurar una
intervención temprana.
43
• Filtrado de Spam: En sistemas de clasificación de correos electrónicos, la matriz
de confusión ayuda a evaluar la precisión del modelo al identificar correos como
“spam” o “no spam”.
Por ejemplo, un FP en este contexto representa un correo legítimo clasificado
erróneamente como spam, lo cual afecta la experiencia del usuario. Reducir los FP
es esencial para asegurar que los correos importantes lleguen a la bandeja de
entrada.
• Seguridad Informática: En sistemas de detección de intrusiones, los VN
representan los accesos legítimos correctamente identificados, mientras que los
FP indican intentos de acceso legítimos clasificados como amenazas.
Minimizar los FP es importante para evitar bloqueos innecesarios en el sistema. La
matriz de confusión permite identificar estos errores y ajustar el sistema para
mejorar su precisión.
• Clasificación de Clientes: En marketing, la matriz de confusión se emplea para
evaluar modelos que clasifican a los clientes en función de su probabilidad de
realizar una compra.
Los VP representan a los clientes correctamente identificados como compradores,
mientras que los FN son clientes que el modelo no identificó como potenciales
compradores, lo que puede llevar a perder oportunidades de venta.
C. LIMITACIONES DE LA MATRIZ DE CONFUSIÓN
A pesar de su utilidad, la matriz de confusión tiene limitaciones. Una de ellas es su
sensibilidad a los datos desbalanceados; en estos casos, métricas como la precisión
pueden resultar engañosas si no se consideran junto con el recall y la F1-score.
Además, interpretar la matriz puede ser complejo en problemas multiclase, donde el
número de VP, FP, FN y VN se distribuye en múltiples categorías, aumentando la
dificultad para identificar patrones específicos de error y optimizar el modelo de
forma precisa.
La matriz de confusión, con sus métricas derivadas, es una herramienta clave para
evaluar el rendimiento y precisión de los modelos de clasificación. Su capacidad
de distinguir entre tipos de errores ayuda a comprender mejor el comportamiento del
modelo y optimizarlo para cumplir los objetivos de la tarea.
3.2.3 Tabla de la estructura y ejemplos de aplicación de
una matriz de confusión
La tabla siguiente describe brevemente los tipos de error dentro de la matriz de
confusión.
44
Tipo de Error Descripción Ejemplo Práctico
Verdadero Clasificación correcta de Pacientes diagnosticados
Positivo (VP) un caso positivo correctamente en un modelo
médico
Verdadero Clasificación correcta de Accesos legítimos identificados
Negativo (VN) un caso negativo como seguros en un modelo de
seguridad
Falso Positivo Clasificación incorrecta de Usuarios legítimos identificados
(FP) un caso negativo como como amenazas en seguridad
positivo informática
Falso Negativo Clasificación incorrecta de Clientes potenciales mal
(FN) un caso positivo como clasificados como no interesados
negativo en marketing
Tabla 12: Estructura y ejemplos de aplicación de una matriz de confusión
Dato Curioso: La matriz de confusión es una herramienta que se utiliza mucho más
allá del ámbito de Machine Learning. En medicina, por ejemplo, se utiliza para evaluar
la precisión de los métodos de diagnóstico en distintos estudios clínicos.
Un uso común es en el diagnóstico de enfermedades graves, donde los errores
pueden tener consecuencias importantes. Minimizar los falsos negativos es
especialmente vital en estos contextos, ya que significa no pasar por alto casos de la
enfermedad en pacientes afectados.
3.3 Métricas de Evaluación: Introducción a las
métricas clave como la precisión, el recall, la
F1-score y el ROC-AUC
La matriz de confusión es una herramienta clave para analizar la precisión de los
modelos de clasificación en Machine Learning, permitiendo evaluar el desempeño del
modelo al clasificar correctamente o equivocarse en sus predicciones.
45
Organizada en una tabla, esta matriz muestra la distribución de verdaderos
positivos, verdaderos negativos, falsos positivos y falsos negativos, lo que facilita
entender los tipos de errores y aciertos del modelo en cada categoría.
Esta información es útil en aplicaciones prácticas, ya que permite optimizar modelos
en tareas como el diagnóstico médico, la seguridad informática y la segmentación de
clientes, donde minimizar errores es determinante.
3.3.1 Importancia de las Métricas de Evaluación
Las métricas de evaluación permiten analizar el rendimiento y la efectividad de los
modelos de Machine Learning en tareas de clasificación, especialmente en contextos
donde la precisión es decisiva.
Seleccionar la métrica adecuada es indispensable para entender cómo el modelo se
comporta en distintos escenarios y permite ajustar sus parámetros para mejorar su
rendimiento en la práctica. Métricas como la precisión, el recall, la F1-score y el ROC-
AUC son de gran utilidad en la evaluación de modelos, y cada una ofrece una
perspectiva diferente sobre el equilibrio entre aciertos y errores en las predicciones.
3.3.2 Precisión y su Aplicación Práctica
La precisión mide la proporción de predicciones correctas entre todas las
predicciones realizadas por el modelo, y es especialmente útil en situaciones donde
los falsos positivos pueden representar un problema relevante.
Por ejemplo, en un sistema de diagnóstico de enfermedades, una alta precisión
significa que el modelo rara vez predice enfermedad en pacientes sanos, aunque es
posible que omita algunos casos de la enfermedad.
Matemáticamente, la precisión se define como el número de verdaderos positivos
dividido entre el total de predicciones positivas (verdaderos positivos más falsos
positivos).
Verdaderos Positivos
Precisión =
Verdaderos Positivos+Falsos Positivos
Un ejemplo práctico de aplicación de la precisión se encuentra en la detección de
fraudes financieros. En este contexto, un modelo con alta precisión minimizaría los
falsos positivos, es decir, evitaría etiquetar transacciones legítimas como fraudulentas.
Esto es particularmente importante para no generar inconvenientes a los clientes, ya
que cada vez que el sistema clasifica incorrectamente una transacción válida como
46
fraudulenta, se produce una fricción en la experiencia del usuario y posibles pérdidas
de confianza en el sistema.
3.3.3 Recall y Casos de Uso
El recall, o sensibilidad, se centra en la proporción de casos positivos correctamente
identificados entre el total de casos positivos reales. Esta métrica es esencial en
situaciones donde los falsos negativos deben minimizarse, ya que cada caso positivo
no identificado puede tener consecuencias adversas.
El recall se calcula dividiendo los verdaderos positivos entre el total de casos positivos
(verdaderos positivos más falsos negativos).
Verdaderos Positivos
Recall =
Verdaderos Positivos+Falsos Negativos
Un ejemplo donde el recall es prioritario es en el diagnóstico de enfermedades graves.
En un modelo que detecta casos de cáncer, maximizar el recall significa identificar
correctamente el mayor número posible de casos reales de cáncer, minimizando los
falsos negativos.
Cada falso negativo representa un paciente al que el sistema etiquetó
incorrectamente como libre de la enfermedad, lo que podría retrasar el tratamiento.
Por ello, en este contexto, el recall se vuelve una métrica determinante para maximizar
la detección y priorizar la seguridad del paciente.
3.3.4 F1-Score: Equilibrio entre Precisión y Recall
La es una métrica combinada que ofrece un equilibrio entre la precisión y el recall, y
se calcula como la media armónica de ambas métricas. Esto la hace ideal en
escenarios donde es importante encontrar un balance entre falsos positivos y falsos
negativos.
La F1-score es particularmente útil en problemas de clasificación donde los datos
están desbalanceados, es decir, cuando una de las clases es mucho más frecuente
que la otra.
Precisión × Recall
F1-score = 2×
𝐏𝐫𝐞𝐜𝐢𝐬𝐢ó𝐧 + Recall
Un caso práctico en el que la F1-score es adecuada es en la clasificación de emails
como spam o no spam. En este contexto, se busca reducir tanto los falsos positivos
47
(emails importantes clasificados como spam) como los falsos negativos (emails de
spam que pasan desapercibidos).
Al maximizar la F1-score, el sistema de clasificación logra un equilibrio, mejorando la
precisión sin descuidar la detección de correos no deseados, lo cual es determinante
para mejorar la efectividad del filtro de spam y optimizar la experiencia del usuario.
3.3.5 Área Bajo la Curva (ROC-AUC): Evaluación Gráfica del
Modelo
La métrica ROC-AUC (Receiver Operating Characteristic - Area Under Curve) mide la
capacidad del modelo para diferenciar entre clases mediante una representación
gráfica.
El área bajo la curva ROC (AUC) es una métrica de evaluación fundamental en
modelos de clasificación, especialmente en aquellos con problemas de clases
desbalanceadas. La curva ROC (Receiver Operating Characteristic) permite
visualizar la relación entre la tasa de verdaderos positivos (sensibilidad o recall) y
la tasa de falsos positivos a través de diferentes umbrales de decisión del modelo.
La AUC representa el área bajo esta curva ROC y proporciona un valor entre 0 y 1,
donde un AUC más cercano a 1 indica un modelo con excelente capacidad de
discriminación entre las clases.
La curva ROC se construye al variar el umbral de decisión del modelo y observar cómo
cambian las tasas de verdaderos positivos (TPR) y falsos positivos (FPR). En una curva
ROC típica:
• El eje Y muestra la tasa de verdaderos positivos (TPR), calculada como la
proporción de predicciones correctas entre el total de casos positivos reales.
• El eje X representa la tasa de falsos positivos (FPR), que mide la proporción de
predicciones incorrectas entre el total de casos negativos reales.
Al trazar el TPR frente al FPR a través de varios umbrales, se obtiene una curva que
refleja el rendimiento del modelo en diferentes escenarios de clasificación. Una curva
ROC que se aproxima a la esquina superior izquierda indica un modelo con una alta
sensibilidad y un bajo FPR, lo cual es deseable.
En contraste, una curva cercana a la diagonal (con un AUC de aproximadamente 0.5)
indica un modelo incapaz de diferenciar entre las clases, como si realizara
predicciones al azar.
48
La AUC es el área bajo la curva ROC y varía entre 0 y 1. Un AUC de 1 indica un modelo
perfecto, capaz de clasificar todas las instancias de forma correcta sin cometer errores.
Un AUC de 0.5 sugiere que el modelo es incapaz de distinguir entre las clases, lo cual
equivale a realizar una predicción aleatoria. Valores de AUC más cercanos a 1 reflejan
un mejor desempeño del modelo.
Matemáticamente, el AUC se calcula integrando el área bajo la curva ROC. Aunque
existen métodos de cálculo aproximados, como el método trapezoidal, muchos
paquetes de software en Python y R, como scikit-learn, ofrecen herramientas
automatizadas para calcular esta métrica de manera eficiente.
Aunque la AUC es una métrica ampliamente utilizada, presenta algunas limitaciones.
En situaciones de clasificaciones multicategoría o en datos desbalanceados extremos,
la AUC puede ser menos efectiva en reflejar el rendimiento real del modelo.
Por ejemplo, en casos donde las clases son extremadamente desiguales, un AUC alto
puede no significar que el modelo clasifique correctamente todas las clases. En tales
casos, es recomendable complementar el AUC con otras métricas como el F1-score o
la precisión para una evaluación más completa.
La siguiente tabla contiene algunos ejemplos de prácticos de aplicación de la AUC:
Aplicación Interpretación del AUC Ejemplo Práctico
Diagnóstico Un AUC alto indica buena Detección de cáncer y
Médico capacidad de detección sin enfermedades cardíacas
muchos falsos positivos
Detección de AUC alto reduce falsos negativos Bancos y sistemas de
Fraudes en detección de transacciones pago electrónico
fraudulentas
Clasificación en Optimiza la segmentación de Empresas de suscripción
Marketing clientes de alto riesgo de y retención de clientes
cancelación
Tabla 13: Interpretación y Ejemplos del Área bajo la Curva ROC en Aplicaciones
Prácticas
Dato Curioso: La curva ROC y el AUC se originaron durante la Segunda Guerra
Mundial en el análisis de señales de radar para detectar la presencia de objetos.
49
Desde entonces, esta técnica ha sido adoptada en la evaluación de modelos de
Machine Learning, ya que permite medir la capacidad de un modelo para distinguir
entre clases, lo cual resulta crucial en aplicaciones donde la precisión en la detección
es fundamental, como en el diagnóstico médico o en la detección de fraudes
financieros.
3.3.6 Tabla de las principales métricas de evaluación y sus
aplicaciones prácticas
Las métricas de evaluación permiten obtener una perspectiva detallada del
rendimiento de los modelos de Machine Learning, lo cual es indispensable para
asegurar que se ajustan de manera efectiva a las necesidades del contexto y cumplen
con los objetivos de precisión y fiabilidad establecidos.
La tabla siguiente muestra las principales métricas de evaluación y algunas de sus
aplicaciones prácticas.
Métrica Fórmula Aplicación Ejemplo Práctico
Precisión VP / (VP + FP) Detección de Minimiza falsos positivos
fraudes en transacciones
Recall VP / (VP + FN) Diagnóstico Maximiza detección en
médico enfermedades graves
F1-Score 2 ×(Precisión × Recall) Clasificación de Balance entre falsos
/ (Precisión + Recall) emails positivos y negativos
ROC- Área bajo la curva Modelos de Evaluación de umbrales
AUC ROC crédito para minimizar riesgos
Tabla 14: Principales métricas de evaluación y sus aplicaciones prácticas
50
Ejercicios prácticos
Ejercicio Práctico 1: Predicción de Gastos
Médicos
Una aseguradora quiere implementar un modelo para predecir los gastos médicos de
sus clientes en función de sus características personales. El conjunto de datos
contiene las siguientes variables:
• Edad
• IMC (Índice de Masa Corporal)
• Número de visitas anuales al médico
• Condición de fumar (1 para fumadores, 0 para no fumadores)
• Gasto anual en salud (variable a predecir)
A. OBJETIVO
• Utilizar regresión lineal para predecir el gasto anual en salud de los clientes.
• Emplear un árbol de decisión para la misma predicción y comparar ambos
modelos en cuanto a su precisión y capacidad de generalización.
B. INSTRUCCIONES
• Divide el conjunto de datos en un 80% para entrenamiento y 20% para prueba.
• Entrena ambos modelos y calcula el Error Cuadrático Medio (MSE) y
el coeficiente de determinación (R^2) para cada uno en el conjunto de prueba.
• Compara los resultados de ambos modelos y selecciona el más adecuado.
Solucionario
Regresión Lineal
Entrenamos el modelo de regresión lineal con las características proporcionadas y
obtenemos un MSE de 2000 y un (R^2) de 0.75 en el conjunto de prueba. Este
resultado indica que el modelo de regresión lineal explica el 75% de la variabilidad de
los gastos médicos.
51
La variable condición de fumar tiene un fuerte peso en la predicción de gastos,
mientras que el número de visitas anuales también muestra una relación directa con
el gasto anual.
Árbol de Decisión
Entrenamos el árbol de decisión, obteniendo un MSE de 1800 y un (R^2) de 0.80 en
el conjunto de prueba, lo que indica una mejora en la precisión del modelo.
Observamos que el árbol de decisión da mayor peso al IMC y la condición de
fumador, mostrando una mayor capacidad para capturar relaciones no lineales entre
las características.
Conclusión: El árbol de decisión muestra un mejor rendimiento y es más adecuado
para este problema debido a su menor error y mayor capacidad de captura de
relaciones no lineales.
Ejercicio Práctico 2: Segmentación de
Clientes para Estrategias de Marketing
Una tienda online desea segmentar a sus clientes para personalizar sus estrategias de
marketing. Los datos disponibles incluyen:
• Edad del cliente
• Gasto promedio mensual
• Frecuencia de compra mensual
• Tiempo promedio de navegación por visita
Objetivo:
• Implementar K-means para agrupar a los clientes en diferentes segmentos de
comportamiento.
• Determinar el número óptimo de clusters usando el método del codo.
• Describir los perfiles de cada grupo y proponer una estrategia de marketing
personalizada para cada uno.
Instrucciones:
• Estandariza las variables para que tengan el mismo rango.
• Utiliza el método del codo para seleccionar el número óptimo de clusters.
52
• Realiza el clustering con K-means y analiza los patrones dentro de cada cluster.
Solucionario
Selección de Clusters con el Método del Codo:
Ejecutamos K-means para diferentes valores de (K) y seleccionamos K=3 como el
óptimo, donde la variación de error comienza a estabilizarse.
Análisis de Clusters:
• Cluster 1: Jóvenes, alta frecuencia de compra, menor gasto promedio. Estrategia:
Promociones de descuentos para fomentar más compras.
• Cluster 2: Edad media, alto gasto promedio, frecuencia de compra media.
Estrategia: Ofrecer programas de lealtad y recompensas.
• Cluster 3: Usuarios mayores, baja frecuencia y tiempo de navegación alto.
Estrategia: Envío de recomendaciones personalizadas por correo electrónico.
Conclusión
K-means permite agrupar clientes en segmentos bien diferenciados, lo que facilita
diseñar estrategias específicas para cada grupo y optimizar el marketing.
Ejercicio Práctico 3: Evaluación de un Modelo
de Clasificación de Clientes en Riesgo de
Cancelación
Una empresa de suscripción mensual quiere evaluar un modelo que predice si un
cliente cancelará su suscripción. El conjunto de datos contiene:
• Frecuencia de uso semanal
• Tiempo de permanencia promedio en la plataforma
• Edad del cliente
• Historial de cancelaciones anteriores
El objetivo es clasificar a los clientes como En riesgo de cancelar o No en riesgo (1 =
en riesgo, 0 = no en riesgo).
Objetivo:
• Evalúa el modelo mediante una matriz de confusión y calcula las métricas
de precisión, recall, F1-score y ROC-AUC.
53
• Interpreta los resultados y ajusta el modelo si es necesario para reducir los errores
de clasificación.
Instrucciones:
• Divide el conjunto de datos en un 80% para entrenamiento y 20% para prueba.
• Calcula la matriz de confusión y las métricas de evaluación.
• Determina si es necesario ajustar el umbral de decisión para mejorar el recall o
precisión, dependiendo de la importancia de reducir los falsos positivos o
negativos.
Solucionario
Matriz de Confusión:
Predicción En Predicción No en
Riesgo Riesgo
Real En Riesgo 120 25
Real No en 30 200
Riesgo
Cálculo de Métricas:
• Precisión: 91%
• Recall: 82%
• F1-score: 0.86
• ROC-AUC: 0.89
Interpretación:
El modelo tiene una alta precisión, pero el recall es algo menor, lo cual indica que está
pasando por alto algunos clientes en riesgo de cancelar (falsos negativos). Para
mejorar la detección de estos clientes en riesgo, se puede ajustar el umbral de
decisión y así priorizar el recall.
54
Conclusión
La matriz de confusión y las métricas derivadas muestran que el modelo es sólido,
aunque se recomienda ajustar el umbral para mejorar la sensibilidad y reducir el
riesgo de perder clientes en riesgo de cancelar.
55
Resumen
En este resumen, repasarás los puntos más importantes del Módulo
2: Fundamentos de Machine Learning.
1: Introducción al Machine Learning
El Machine Learning ha revolucionado la capacidad de transformar datos en
decisiones, permitiendo automatizar y mejorar predicciones en áreas como salud,
finanzas y tecnología. Este módulo se centra en los fundamentos de esta disciplina,
explicando las bases de los algoritmos supervisados y no supervisados, además de las
técnicas para evaluar su rendimiento. Estos conocimientos son clave para aplicar
modelos predictivos en diferentes sectores, optimizando sus procesos y potenciando
su capacidad para responder ante datos complejos.
2: Algoritmos de Aprendizaje Supervisado
El aprendizaje supervisado permite entrenar modelos con datos etiquetados para
predecir valores o clasificar datos nuevos. Las técnicas de regresión
lineal y logística son herramientas principales, útiles para predecir valores continuos
y probabilidades en problemas binarios. Además, los algoritmos de Máquinas de
Soporte Vectorial (SVM) y Naive Bayes se destacan en la clasificación, logrando
separar categorías de datos en casos complejos y facilitando tareas de clasificación
como el filtrado de spam o la detección de fraudes financieros.
3: Árboles de Decisión y Random Forest
Los árboles de decisión y Random Forest permiten interpretar el proceso de toma
de decisiones de forma clara. Un árbol de decisión divide los datos en ramas según
sus características, siendo ideal para problemas de clasificación. Random Forest
mejora la precisión mediante la combinación de múltiples árboles, lo que resulta útil
en sectores como finanzas y seguridad. Ambos modelos destacan por su capacidad
para proporcionar decisiones precisas y claras, especialmente cuando se requieren
altos niveles de interpretabilidad.
4: Redes Neuronales Básicas y Multicapa
Las redes neuronales se inspiran en el cerebro humano y permiten procesar patrones
complejos en datos, especialmente en tareas como reconocimiento de voz e
imágenes. Las redes multicapa incrementan su complejidad, permitiendo resolver
problemas de mayor dificultad. Esta técnica se emplea en diagnóstico médico y
56
personalización de contenidos, logrando que aplicaciones como Netflix recomienden
contenidos según las preferencias del usuario.
5: Embeddings y Representación Densa
Los embeddings convierten información compleja en vectores densos que facilitan
su procesamiento en Machine Learning. En NLP, estos embeddings representan
palabras en un espacio vectorial, permitiendo que términos con significados similares
estén próximos. Se emplean en plataformas como Amazon para analizar búsquedas y
recomendar productos afines. En redes sociales, los embeddings ayudan a identificar
tendencias y patrones de comportamiento.
6: Algoritmos de Aprendizaje No Supervisado
A diferencia del aprendizaje supervisado, los algoritmos no supervisados, como
el clustering o el Análisis de Componentes Principales (PCA), detectan patrones en
datos no etiquetados. El clustering organiza datos en grupos, útil en segmentación de
clientes, mientras que el PCA simplifica grandes volúmenes de datos, optimizando
modelos en sectores como la biología molecular o la banca. Estas técnicas aportan
valor al extraer insights en datos complejos y no estructurados.
7: Técnicas de Evaluación de Modelos
Para medir el rendimiento de los modelos, se emplean técnicas como la validación
cruzada, que verifica la consistencia de los resultados, y la matriz de confusión, que
evalúa el tipo de errores en clasificación. Métricas como la precisión, el recall y
la AUC-ROC permiten analizar el balance entre aciertos y errores, asegurando que el
modelo sea confiable. Estas técnicas de evaluación son vitales en aplicaciones como
diagnóstico médico o evaluación de riesgos financieros.
8: Cierre del Resumen
El módulo “Fundamentos de Machine Learning” proporciona una base sólida en
técnicas de aprendizaje supervisado y no supervisado, así como en la evaluación de
modelos. Estos conceptos son esenciales para comprender y aplicar algoritmos en
proyectos del mundo real, maximizando el valor de los datos y optimizando decisiones
en sectores como la salud, las finanzas y la tecnología.
Conclusión:
¡Esperamos que este resumen os haya sido útil!
No te pierdas la oportunidad de seguir explorando y adquiriendo nuevos
conocimientos sobre CHATGPT, COPILOT y GEMINI en el siguiente módulo.
57
Glosario
• Algoritmo Apriori: Algoritmo de minería de datos que identifica itemsets
frecuentes para construir reglas de asociación eficaces en grandes bases de datos.
• Algoritmo de Aprendizaje No Supervisado: Modelo que aprende de los datos sin
etiquetas o resultados específicos. Descubre relaciones o patrones inherentes en
los datos por medio de técnicas como el clustering.
• Árbol de Decisión: Estructura de Machine Learning en forma de árbol, utilizada
para clasificar o predecir resultados mediante decisiones secuenciales en función
de características específicas. Cada nodo representa una decisión y cada rama
indica un posible resultado.
• Centroides: Puntos centrales de cada cluster en K-means. Los datos se asignan al
cluster cuyo centroide está más cercano, y se recalculan a lo largo del proceso para
optimizar la agrupación.
• Clasificación: Técnica de Machine Learning que asigna datos a categorías o clases
específicas en función de patrones en las variables de entrada. Es esencial para
tareas de segmentación y toma de decisiones en diversos campos, como el
marketing y la medicina.
• Clustering: Técnica de aprendizaje no supervisado que agrupa datos no
etiquetados en conjuntos o clusters, basándose en la similitud entre las
características de los datos. Es útil para descubrir patrones y tendencias ocultas en
grandes volúmenes de datos.
• Confianza: Métrica que indica la probabilidad de que la ocurrencia de un itemset
lleve a otro en una regla de asociación.
• Entropía: Métrica utilizada para calcular la impureza o desorden de los nodos en
un árbol de decisión. Una entropía baja implica nodos más homogéneos,
facilitando la clasificación.
• Espacio Vectorial: Espacio matemático donde se representan los embeddings,
facilitando el procesamiento y comparación de datos.
• Falso Negativo (FN): Error en la predicción en el que el modelo clasifica
incorrectamente un caso positivo como negativo.
• Falso Positivo (FP): Error en la predicción en el cual el modelo clasifica un caso
negativo como positivo.
• Función de Activación: Función que transforma la entrada de una neurona y
decide si transmite la señal, clave en el aprendizaje de patrones no lineales.
• Función Sigmoide: Curva en forma de S utilizada en regresión logística para
transformar valores en probabilidades.
58
• Generalización: Capacidad de un modelo de Machine Learning para ofrecer un
rendimiento consistente en nuevos datos, distintos de los utilizados en el
entrenamiento.
• Gráfico de Conocimiento: Estructura que representa relaciones entre entidades
y utiliza embeddings para simplificar la búsqueda de información.
• Hiperplano: En el contexto de SVM, es la línea o superficie que separa distintas
clases de datos en un espacio multidimensional, proporcionando una frontera
óptima para la clasificación.
• Índice de Gini: Medida de pureza de los nodos en un árbol de decisión, utilizada
para seleccionar las características más efectivas en la partición de datos. Cuanto
menor sea el índice, mayor será la homogeneidad dentro de cada nodo.
• Itemsets: Conjuntos de elementos que aparecen juntos en los datos con cierta
frecuencia, utilizados para construir reglas de asociación.
• k-fold cross-validation: Técnica de validación en la que el conjunto de datos se
divide en k subconjuntos de igual tamaño, usando cada uno como conjunto de
validación en una iteración.
• K-means: Algoritmo de clustering que organiza los datos en (K) grupos o clusters.
El algoritmo asigna puntos a los centroides más cercanos y ajusta estos centroides
iterativamente hasta lograr una distribución estable.
• Knowledge Graph: Representación de entidades y sus relaciones utilizada en
motores de búsqueda y análisis de datos.
• Máquinas de Soporte Vectorial (SVM): Algoritmo de clasificación que separa los
datos en clases mediante un hiperplano óptimo, maximizando la distancia entre
las distintas clases. Es especialmente útil en problemas con fronteras de
separación complejas y alta dimensionalidad.
• Matriz de Confusión: Tabla que permite visualizar el rendimiento de un modelo
de clasificación, mostrando las categorías de predicciones correctas e incorrectas.
• Naive Bayes: Algoritmo probabilístico de clasificación basado en el teorema de
Bayes, que asume la independencia entre variables predictoras. Es eficiente en
tareas como la clasificación de texto y el filtrado de spam.
• Perceptrón Multicapa (MLP): Tipo de RNA con varias capas ocultas que permite
el aprendizaje de relaciones complejas y patrones profundos.
• Random Forest: Algoritmo de aprendizaje automático que combina múltiples
árboles de decisión para mejorar la precisión de la predicción y reducir el riesgo de
sobreajuste. Random Forest utiliza votación o promediación para obtener un
resultado final a partir de los distintos árboles.
• Recomendador de Productos: Sistema que emplea embeddings para
personalizar recomendaciones basadas en preferencias previas de los usuarios.
59
• Red Neuronal Artificial (RNA): Sistema compuesto por neuronas artificiales
conectadas en capas que procesan información y aprenden patrones complejos.
• Reglas de Asociación: Reglas que identifican relaciones de co-ocurrencia entre
distintos elementos en un conjunto de datos. Representan probabilidades de que
unos elementos aparezcan juntos en ciertos contextos.
• Regresión Lineal: Método estadístico para predecir valores continuos a través de
una relación lineal entre variables independientes y dependientes.
• Regresión Logística: Técnica que permite la clasificación binaria mediante la
conversión de una combinación lineal de variables en probabilidades.
• ReLU (Rectified Linear Unit): Función de activación ampliamente utilizada en
redes profundas debido a su eficiencia en el procesamiento de valores positivos.
• Retropropagación del Error: Algoritmo de aprendizaje en redes multicapa que
ajusta los pesos sinápticos minimizando el error a través de todas las capas de la
red.
• Segmentación de Clientes: Proceso mediante el cual se agrupan clientes en
función de características similares, como preferencias de compra o
comportamientos, permitiendo estrategias personalizadas en marketing y ventas.
• Sesgo Temporal: Error en modelos predictivos de series temporales cuando se
incluyen datos futuros en el entrenamiento.
• Sobreajuste (Overfitting): Situación en la que un modelo se ajusta excesivamente
a los datos de entrenamiento y pierde precisión en datos nuevos, debido a una
complejidad excesiva o un ajuste indebido a las particularidades de los datos de
entrenamiento.
• Soporte: Métrica en reglas de asociación que mide la frecuencia de aparición de
un patrón en el conjunto de datos.
• Subconjuntos (Folds): Divisiones en las que se organiza el conjunto de datos para
la validación cruzada, en las cuales se alternan los subconjuntos de entrenamiento
y prueba.
• Teorema de Bayes: Principio matemático utilizado en probabilidad que calcula la
probabilidad de un evento en función de conocimientos previos. Es fundamental
para el funcionamiento de algoritmos como Naive Bayes.
• Validación Cruzada (Cross-Validation): Técnica de evaluación de modelos que
consiste en dividir el conjunto de datos en varios subconjuntos, alternando entre
entrenamiento y prueba en cada iteración para medir la capacidad de
generalización del modelo.
• Validación Cruzada Estratificada: Variante de validación que asegura la misma
proporción de clases en cada subconjunto.
• Variable Dependiente: El valor que se busca predecir en un modelo estadístico.
60
• Variable Independiente: Factor o característica que se utiliza para predecir el valor
de la variable dependiente.
• Verdadero Negativo (VN): Predicción correcta donde el modelo clasifica un caso
negativo como tal.
• Verdadero Positivo (VP): Predicción correcta en la que el modelo clasifica un caso
positivo como tal.
• Word Embedding: Representación vectorial de palabras en NLP que agrupa
semánticamente palabras similares en el espacio vectorial.
61
Bibliografía
Referencias
Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer.
González Velasco, R. (2024). Analizando el Impacto de Modelos Preentrenados con
Deep Learning en Tareas de Visión Artificial. Universidad Politécnica de Madrid.
Goodfellow, I., Bengio, Y., & Courville, A. (2016). Deep Learning. MIT Press.
Han, J., Kamber, M., & Pei, J. (2011). Data Mining: Concepts and Techniques. Morgan
Kaufmann.
Hastie, T., Tibshirani, R., & Friedman, J. (2009). The Elements of Statistical Learning:
Data Mining, Inference, and Prediction. Springer.
Haykin, S. (2008). Neural Networks and Learning Machines. Pearson Education.
Jain, A. K. (2010). Data Clustering: 50 Years Beyond K-means. Pattern Recognition
Letters, 31(8), 651-666.
James, G., Witten, D., Hastie, T., & Tibshirani, R. (2013). An Introduction to Statistical
Learning with Applications in R. Springer.
Powers, D. M. W. (2011). Evaluation: From Precision, Recall and F-measure to ROC,
Informedness, Markedness & Correlation. Journal of Machine Learning Technologies,
2(1), 37-63.
Quinlan, J. R. (1986). Induction of decision trees. Machine Learning, 1(1), 81-106.
Valderrama, A. (2024). Modelo predictivo en el desarrollo de enfermedades
cardiovasculares a partir de factores de riesgo. Universidad Politécnica de Madrid.
González Velasco, R. (2024). Analizando el Impacto de Modelos Preentrenados con
Deep Learning en Tareas de Visión Artificial. Universidad Politécnica de Madrid.
Breiman, L. (2001). Random Forests. Machine Learning, 45(1), 5-32.
Webgrafía
4Geeks Academy. (s.f.). Máquinas de vectores de soporte. Recuperado
de [Link]
Data Source. (s.f.). Métricas de evaluación de modelos en el aprendizaje automático.
Recuperado de [Link]
evaluacion-de-modelos-en-el-aprendizaje-automatico
62
Datacamp. (s.f.). Clustering in Machine Learning: 5 Essential Clustering Algorithms.
Recuperado de [Link]
5-essential-clustering-algorithms
DataCamp. (s.f.). Decision Trees en R. Recuperado
de [Link]
DataCamp. (s.f.). Explainable AI: Understanding and Trusting Machine Learning
Models. Recuperado de [Link]
understanding-and-trusting-machine-learning-models
DataCamp. (s.f.). Multilayer Perceptrons in Machine Learning. Recuperado
de [Link]
learning
EducaOpen. (s.f.). Validación cruzada. Recuperado
de [Link]
FasterCapital. (s.f.). Clasificación de textos y análisis predictivo. Recuperado
de [Link]
[Link]
FasterCapital. (s.f.). El uso de la validación cruzada para probar la validez del modelo.
Recuperado de [Link]
[Link]
FasterCapital. (s.f.). Introducción a las Redes Neuronales Recurrentes. Recuperado
de [Link]
[Link]
Foqum. (s.f.). ¿Qué es el clustering? Recuperado
de [Link]
Grupo US. (s.f.). Redes Neuronales Artificiales. Recuperado
de [Link]
IBM. (s.f.). Logistic Regression. Recuperado de [Link]
es/topics/logistic-regression
ISDI. (s.f.). Clustering de datos: funcionamiento. Recuperado
de [Link]
Jordi, P. G. (s.f.). Naive Bayes al completo. LinkedIn. Recuperado
de [Link]
guti%C3%A9rrez-wrmrf
63
LinkedIn. (s.f.). What are the differences between linear and logistic
regression? Recuperado de [Link]
between-linear-logistic-regression-eh6cf?lang=es
MAMEL. (s.f.). Modelos predictivos y la matriz de confusión. Recuperado
de [Link]
Microsoft Azure. (s.f.). Cross-Validate Model. Recuperado
de [Link]
reference/cross-validate-model?view=azureml-api-2
Microsoft Azure. (s.f.). K-means Clustering Component. Recuperado
de [Link]
reference/k-means-clustering?view=azureml-api-2
OBS Business School. (s.f.). El algoritmo SVM y sus aplicaciones empresariales.
Recuperado de [Link]
aplicaciones-
empresariales#:~:text=%C2%BFQu%C3%A9%20es%20un%20SVM%20o,un%20espacio
%20de%20muchos%20aspectos
QuestionPro. (s.f.). Modelos de Machine Learning. Recuperado
de [Link]
RaúlLG. (s.f.). Qué son los embeddings y cómo funcionan en machine
learning. Raú[Link]. Obtenido de [Link]
SealPath. (2022). Ventajas de la clasificación de datos mediante IA y ML. Recuperado
de [Link]
StudySmarter. (s.f.). Regresión logística. Recuperado
de [Link]
logistica/
The Logistics World. (2022). Regresión logística: una herramienta analítica clave para
la toma de decisiones. Recuperado
de [Link]
analitica-clave-para-la-toma-de-decisiones/
The Machine Learners. (s.f.). Métricas de clasificación. Recuperado
de [Link]
64
The Valley. (2023). Cómo construir modelos de aprendizaje automático y utilizarlos
para tomar decisiones. Recuperado de [Link]
de-aprendizaje-automatico-y-utilizarlos-para-tomar-decisiones/
65