See discussions, stats, and author profiles for this publication at: [Link]
net/publication/373361789
Apuntes: Una introducción al Aprendizaje Estadístico en Python. James, Witten,
Hastie, Tibshirani y Taylor.
Article · August 2023
CITATIONS READS
0 1,496
1 author:
Christian Limbert Paredes Aguilera
Universidad Mayor de San Andres
25 PUBLICATIONS 17 CITATIONS
SEE PROFILE
All content following this page was uploaded by Christian Limbert Paredes Aguilera on 24 August 2023.
The user has requested enhancement of the downloaded file.
Gereth James, Daniela Witten, Trevor Hastie, Robert Tibshirani and
Jonathan Taylor
Una introducción al Aprendizaje
estadístico
con applicaciones en Python
APUNTES
POR
FODE
CHRISTIAN LIMBERT PAREDES AGUILERA
π
2
2π π
3 3
5π π
6 6
0 2 4 6
π 0
7π 11π
6 6
4π 5π
3 3
3π
2
PRIMERA IMPRESIÓN
Título de la obra original:
An Introduction to Statistical Learning
Sin ninguna revisión de esta obra.
Propiedad de esta obra:
CHRISTIAN LIMBERT PAREDES AGUILERA
E-mail: soyfode@[Link]
Reservados todos los derechos. La reproducción total o parcial de esta obra, por cualquier medio o
procedimiento, comprendidos la reprografía y el tratamiento informático, y la distribución de ejem-
plares de ella mediante alquiler o préstamo públicos, queda rigurosamente prohibida sin la autor-
ización escrita de los titulares del copyright, bajo las sanciones establecidas por las leyes.
2023
Contents
2 Aprendizaje estadístico 3
2.2 Evaluación de la precisión del modelo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4
2.2.1 Medición de la calidad de ajuste . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4
2.2.2 El sesgo-varianza trade-off . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4
2.2.3 El contexto de la clasificación . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
3 Regresión lineal 7
1
Contents Contents
2
2
Aprendizaje estadístico
Nuestro objetivo es aplicar un método de aprendizaje estadístico a los datos de entrenamiento para
estimar la función desconocida f . En otras palabras, queremos encontrar una función fˆ tal que Y = fˆ( X )
para cualquier observación ( X, Y ). En términos generales, la mayoría de los métodos de aprendizaje
estadístico para esta tarea pueden caracterizarse como paramétricos o no paramétricos.
Subset Selection
Alto Lasso
Least Squares
Interpretabilidad
Generalized Additive Models
Trees
Bagging, Boosting
Support Vector Machines
Bajo
Deep Learning
Bajo Alto
Flexibilidad
Una representación de la compensación entre flexibilidad e interpretabilidad, utilizando diferentes métodos de
aprendizaje estadístico. En general, a medida que aumenta la flexibilidad de un método, disminuye su
interpretabilidad.
Cuando el objetivo es la inferencia, existen claras ventajas al utilizar métodos de aprendizaje estadístico
simples y relativamente inflexibles. Sin embargo, en algunos entornos sólo nos interesa la predicción
y la interpretabilidad del modelo predictivo simplemente no es de interés. Por ejemplo, si buscamos
desarrollar un algoritmo para predecir el precio de una acción, nuestro único requisito para el algoritmo
es que prediga con precisión; la interpretabilidad no es una preocupación. En este contexto, podríamos
esperar que sea mejor utilizar el modelo más flexible disponible. Pero este no es siempre el caso. A
menudo obtendremos predicciones más precisas utilizando un método menos flexible. Este fenómeno,
que puede parecer contradictorio a primera vista, tiene que ver con el potencial de sobreajuste en méto-
dos altamente flexibles.
La mayoría de los problemas de aprendizaje estadístico pertenecen a una de estas dos categorías: su-
pervisados o no supervisados. El aprendizaje supervisado tiene una respuesta asociada yi , contrario al
aprendizaje no supervisado.
3
2.2. Evaluación de la precisión del modelo Chapter 2. Aprendizaje estadístico
Solemos referirnos a los problemas con una respuesta cuantitativa como problemas de regresión, mien-
tras que los que implican una respuesta cualitativa se suelen denominar problemas de clasificación.
2.2 Evaluación de la precisión del modelo
Seleccionar el mejor método puede ser uno de los mayores retos a la hora de llevar a la práctica el apren-
dizaje estadístico.
2.2.1 Medición de la calidad de ajuste
Necesitamos cuantificar hasta qué punto el valor de respuesta predicho para una observación dada se
aproxima al valor de respuesta verdadero para esa observación. En el ámbito de la regresión, la medida
más utilizada es el error cuadrático medio (ECM), dado por
n i2
1 h
MSE =
n ∑ yi − fˆ ( xi ) ,
i =1
donde fˆ ( xi ) es la predicción que fˆ da para la i-ésima observación xi . MSE será pequeño si las respuestas
previstas son muy cercanas a las respuestas verdaderas, y serán grandes si para algunas de las observa-
ciones, las respuestas previstas difieren sustancialmente.
No nos importa realmente lo bien que funciona el método de entrenamiento con los datos. Más bien,
nos interesa la precisión de las predicciones que obtenemos cuando aplicamos nuestro método a datos
de prueba no vistos previamente.
Queremos elegir el método que ofrezca el MSE de prueba más bajo. Es decir, si tuviéramos un gran
número de observaciones de prueba, podríamos calcular
h i2
Ave y0 − fˆ ( x0 ) ,
el error cuadrático medio de predicción para estas observaciones de prueba ( x0 , y0 ).
A medida que aumenta la flexibilidad del modelo, el MSE de entrenamiento disminuye, pero no así el
MSE de prueba. Cuando un método determinado produce un MSE de entrenamiento pequeño pero
un MSE de prueba grande, se dice que estamos sobreajustando los datos. Esto ocurre porque nuestro
procedimiento de aprendizaje estadístico está trabajando demasiado para encontrar patrones en los datos
de entrenamiento, y puede estar detectando algunos patrones que sólo son causados por el azar en
lugar de por las verdaderas propiedades de la función desconocida f . Cuando sobreajustamos los datos
de entrenamiento, el MSE de prueba será muy grande porque los supuestos patrones que el método
encontró en los datos de entrenamiento simplemente no existen en los datos de prueba. Tenga en cuenta
que, independientemente de si se ha producido sobreajuste o no, casi siempre esperamos que el MSE
de entrenamiento sea menor que el MSE de prueba, porque la mayoría de los métodos de aprendizaje
estadístico buscan directa o indirectamente minimizar el MSE de entrenamiento. El sobreajuste se refiere
específicamente al caso en el que un modelo menos flexible habría producido un MSE de prueba menor.
2.2.2 El sesgo-varianza trade-off
Es posible demostrar que el MSE esperado de la prueba, para un valor dado x0 siempre puede descom-
ponerse en la suma de tres cantidades fundamentales: La varianza de fˆ ( x0 ), el sesgo al cuadrado de
fˆ ( x0 ) y la varianza de los términos de error. Esto es,
h i2 h i n h io2
E y0 − fˆ ( x0 ) = Var fˆ ( x0 ) + Bias fˆ ( x0 ) + Var (ϵ) .
4
Chapter 2. Aprendizaje estadístico 2.2. Evaluación de la precisión del modelo
h i2
Aquí la notación E y0 − fˆ ( x0 ) se define como el MSE esperado de la prueba en x0 . Esta ecuación nos
dice que para minimizar el error de prueba esperado, tenemos que seleccionar un método de aprendizaje
estadístico que consiga simultáneamente una varianza y un sesgo bajos. La varianza se refiere a la canti-
dad en la que fˆ cambiaría si la estimáramos utilizando un conjunto de datos de entrenamiento diferente.
Así, que la idea es que la estimación de f no varíe demasiado entre conjuntos de entrenamiento. En
general, los métodos estadísticos más flexibles tienen mayor varianza. Por otro lado, el sesgo se refiere
al error que se introduce al aproximar un problema de la vida real, que puede ser extremadamente com-
plicado, mediante un modelo mucho más simple.
Así, en general, a medida que utilicemos métodos más flexibles, la varianza aumentará y el sesgo dis-
minuirá. La tasa relativa de cambio de estas dos cantidades determinará si el MSE de la prueba aumenta
o disminuye. A medida que aumenta, el sesgo tiende a disminuir inicialmente más rápido de lo que
aumenta la varianza. En consecuencia, el MSE de prueba disminuye. Sin embargo, llega un momento en
el que el aumento de la flexibilidad tiene poco impacto en el sesgo, pero empieza a aumentar significati-
vamente la varianza. Por lo tanto, el MSE de la prueba aumenta.
Un buen rendimiento del conjunto de pruebas de un método de aprendizaje estadístico requiere una
varianza baja, así como un sesgo al cuadrado bajo.
El reto consiste en encontrar un método para el que tanto la varianza como el sesgo al cuadrado sean
bajos.
2.2.3 El contexto de la clasificación
El enfoque más común para cuantificar la precisión de nuestra estimación fˆ es la tasa de error de entre-
namiento, la proporción de errores que se cometen si aplicamos nuestra estimación fˆ a las observaciones
de entrenamiento:
1 n
n i∑
I (yi ̸= ŷi ) .
=1
Aquí ŷi es la predicción de la etiqueta de clase para la i-ésima observación utilizando fˆ. I (yi ̸= ŷi ) es
una variable indicadora igual a 1 si yi ̸= ŷi y cero si yi ̸= ŷi . Este último nos dice que fue clasificada
correctamente por nuestro método. Por lo tanto, la ecuación dada calcula la fracción de clasificaciones
incorrectas.
Lo que nos interesará encontrar es la tasa de error de prueba, asociada a observaciones de prueba ( x0 , y0 )
dada por:
Ave [ I (y0 ̸= ŷ0 )] ,
donde ŷ0 es la predicción de la etiqueta de clase que resulta de aplicar el clasificador a la observación de
prueba con el predictor x0 .
El clasificador de Bayes
Es posible demostrar que la tasa de error de prueba se minimiza, en promedio, por un clasificador muy
simple que asigna cada observación a la clase más probable. En otras palabras, simplemente deberíamos
asignar una observación de prueba con el vector predictor x0 a la clase j para la que
Pr (Y = j| X = x0 )
es Mayor. En un problema de dos clases en el que sólo hay dos valores de respuesta posibles, digamos
la clase 1 o la clase 2, el clasificador de Bayes corresponde a la predicción de la clase uno si Pr (Y =
1| X = x0 ) > 0.5, y de la clase dos en caso contrario. El clasificador de Bayes produce la tasa de error de
prueba más baja posible, denominada tasa de error de Bayes. Dado que el clasificador de Bayes siempre
elegirá la clase de error de Bayes para la que Pr (Y = j| X = x0 ) sea mayor, la tasa de error será la tasa
1 − max j Pr (Y = j| X = x0 ) en X = x0 . En general, la tasa global de error de Bayes viene dada por
1 − E max Pr (Y = j| X ) ,
j
La tasa de error de Bayes es análoga al error irreducible, discutido anteriormente.
5
2.2. Evaluación de la precisión del modelo Chapter 2. Aprendizaje estadístico
K-vecinos más cercanos
Calcular el clasificador de Bayes es imposible. Por lo que podemos utilizar el clasificador de K-vecinos
más cercanos. Dado un número entero positivo K y una observación de prueba x0 , el clasificador KNN
identifica primero los K puntos de los datos de entrenamiento más cercanos a x0 , representados por N0 .
A continuación estima la probabilidad condicional de la clase de j como la fracción de puntos en N0
cuyos valores de respuesta son iguales a j.
1
Pr (Y = j| X = x0 ) =
K ∑ I ( yi = j ) .
i ∈N0
Finalmente, KNN clasifica la observación de prueba x0 en la clase con la mayor probabilidad.
A medida que K aumenta, el método se vuelve menos flexible y produce un límite de decisión cercano
a la linealidad. Esto corresponde a un clasificador de baja varianza pero alto sesgo. Cuando el límite de
decisión es demasiado flexible y encuentra patrones en los datos que no se corresponden con el límite de
decisión de Bayes. Esto corresponde a un clasificador que tiene un sesgo bajo pero una varianza muy alta.
Tanto en la configuración de regresión como en la de clasificación, elegir el nivel correcto de flexibilidad
es fundamental para el éxito de cualquier método de aprendizaje estadístico. El equilibrio entre sesgo y
varianza y la forma de U resultante en el error de prueba pueden hacer que ésta sea una tarea difícil.
6
3
Regresión lineal
View publication stats