Listado de definiciones
Datos de Train: Utilizados para instruir a un modelo de aprendizaje automático,
estos conjuntos contienen información sobre variables independientes y
dependientes, permitiéndole al modelo reconocer patrones y hacer predicciones.
Datos de Validación: Después del entrenamiento, estos datos se emplean para
evaluar la eficacia de un modelo de aprendizaje automático, garantizando su
capacidad para generalizar a nuevos datos y evitar el sobreajuste.
Datos de Test: Empleados al final del proceso, estos datos permiten valorar el
desempeño definitivo del modelo de aprendizaje automático, sin haber sido
utilizados previamente en ninguna etapa de entrenamiento o validación.
GridSearchCV: Una herramienta de la biblioteca scikit-learn en Python, esta
función explora diversas combinaciones de hiperparámetros para optimizar el
rendimiento de un modelo de aprendizaje automático.
One Hot Encoding: Esta técnica transforma variables categóricas en variables
numéricas interpretables para modelos de aprendizaje automático, generando una
nueva variable binaria para cada categoría.
Matriz de confusión: Una herramienta utilizada en la evaluación de modelos de
clasificación, que presenta de manera organizada los resultados de las predicciones
del modelo, comparándolos con los valores reales. Esta matriz muestra la cantidad
de casos clasificados correctamente y los que han sido erróneamente clasificados.
Precision: Cuantifica el quilibrio de las predicciones positivas realizadas por un
modelo de clasificación que fueron correctas. En otras palabras, representa la
exactitud de las predicciones positivas en relación con todas las predicciones
positivas realizadas por el modelo.
Accuracy: Indica qué tan preciso es un modelo de clasificación en general,
tomando en cuenta tanto los verdaderos positivos como los verdaderos negativos, y
dividiendo esta suma por el total de predicciones.
Specificity: Esta medida analiza la habilidad del modelo de clasificación para
asociar correctamente los casos erroneos. Se calcula como la proporción de los
casos negativos correctamente identificados en relación con el total de casos
realmente negativos.
Recall: Este indicador analiza la habilidad del modelo de clasificación para detectar
adecuadamente los casos positivos. Se obtiene dividiendo el número de casos
positivos correctamente identificados entre el total de casos que son realmente
positivos.
F1 Score: Proporciona la evaluación equilibrada del desempeño para el modelo,
considerando tanto la exactitud en las predicciones de casos positivos como la
capacidad del modelo para identificar todos los casos positivos.
Curva ROC: Representación visual que ilustra cómo varía la relación en cuanto a
casos positivos correctamente identificados en relación con la tasa de falsos
positivos para diferentes umbrales de decisión. Esta curva permite evaluar la
capacidad predictiva de un modelo de clasificación en una amplia gama de
escenarios.
R cuadrado: Indicador que mide el equilibrio en cuanto a la inestabilidad que
puede tener la variable dependiente, que es explicada por el modelo de regresión. Es
esencial para determinar la adecuación del modelo a los datos observados,
mostrando qué tan bien se ajusta el modelo a la realidad.
Con los datasets anteriores diseñar los modelos predictivos de Regresión Lineal, Regresión
Logística y Árboles de decisión. Para cada algoritmo realizar los siguientes pasos:
1. Realizar un análisis exploratorio de los datos para identificar relaciones entre variables,
valores atípicos, tendencias, etc.
2. Preprocesar los datos limpiándolos, tratando valores faltantes y transformándolos según sea
necesario.
3. Seleccionar las características más relevantes para entrenar el 3 modelo utilizando selección
de características.
Dividir el dataset en Train y Test para evaluar correctamente el modelo.
BreynerParra/Repositorio ([Link])
Referencias bibliográficas
• Carlos Véliz. (2020). Aprendizaje automático. Introducción al aprendizaje
profundo. El Fondo Editorial de la Pontificia Universidad Católica del Perú.
[Link]
[Link]?direct=true&db=nlebk&AN=2600876&lang=es&site=eds-
live&scope=site&ebv=EB&ppid=pp_I Cap 3, 4, 5 y 6
• David Julian. (2016). Designing Machine Learning Systems with Python. Packt
Publishing.
[Link]
[Link]?direct=true&db=nlebk&AN=1218065&lang=es&site=eds-
live&scope=site&ebv=EB&ppid=pp_Cover. Cap 2
• Giuseppe Bonaccorso. (2018). Machine Learning Algorithms : Popular
Algorithms for Data Science and Machine Learning, 2nd Edition: Vol. 2nd ed.
Packt Publishing.
[Link]
[Link]?direct=true&db=nlebk&AN=1881497&lang=es&site=eds-
live&scope=site&ebv=EB&ppid=pp_Cover Cap 3, 4, 5 y 8
• Minguillón, J. Casas, J. y Minguillón, J. (2017). Minería de datos: modelos y
algoritmos. Editorial UOC.
[Link] Cap 4, 5,
13
• Pratap Dangeti. (2017). Statistics for Machine Learning : Build Supervised,
Unsupervised, and Reinforcement Learning Models Using Both Python and R.
Packt Publishing.
[Link]
[Link]?direct=true&db=nlebk&AN=1560931&lang=es&site=eds-
live&scope=site&ebv=EB&ppid=pp_Cover Cap 2, 3 y 4
• Romero Villafranca, R. y Zúnica Ramajo, L. (2020). Métodos estadísticos para
ingenieros. Editorial de la Universidad Politécnica de Valencia. [Link]
[Link]/es/ereader/unad/129644. Cap 12