0% encontró este documento útil (0 votos)
3 vistas100 páginas

Introducción al Machine Learning

Cargado por

Alberto Díaz
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
3 vistas100 páginas

Introducción al Machine Learning

Cargado por

Alberto Díaz
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Inteligencia Artificial II

Profesora:
M.T.C.A. Rosa María Gutiérrez Apolonio
Lic. en Informática
NovaUniversitas
Ocotlán de Morelos, marzo 2024
Machine Learning


Machine Learning o aprendizaje automático
Machine Learning

Es unos de los subcampos de la Inteligencia


Artificial y es la ciencia que permite que las
computadoras aprendan y actúen como lo hacen
los humanos, mejorando su aprendizaje a lo largo
del tiempo de una forma autónoma, alimentándolas
con datos e información en forma de
observaciones e interacciones con el mundo real.
Machine Learning


Consiste en extraer conocimiento de los datos.

Es un campo de investigación en la intersección de la
estadística, la inteligencia artificial y la informática.

También se conoce como análisis predictivo o aprendizaje
estadístico.
Machine Learning
Aprendizaje Supervisado
 Identificar el código postal a partir de
dígitos escritos a mano en un sobre.
 Detectar actividad fraudulenta
en transacciones con tarjetas
de crédito.

 Determinar si un tumor es
benigno según una imagen
médica.
Aprendizaje No Supervisado

Segmentar a los
clientes en grupos
con preferencias
similares.

 Identificar temas en un

Detectar patrones conjunto de
de acceso publicaciones de blog.
anormales a un
sitio web.
Machine Learning


Los datos deben tener una representación, como una tabla.

Cada entidad o fila se conoce como una muestra o punto de
datos.

Las columnas, las propiedades que describen estas
entidades, se denominan características.

Fila: cada correo electrónico, cada cliente, cada transacción.

Columna: la edad de un cliente o la cantidad o ubicación de
una transacción.

Extracción de características o ingeniería de características.
Machine Learning
Antes de usar Machine Learning
¿Creo que los ¿Cuál es la mejor
¿Qué pregunta (s) datos recopilados manera de formular
estoy tratando pueden responder mis preguntas como un
de responder? a esa pregunta? problema de aprendizaje
automático?
Antes de usar Machine Learning
¿Qué características
¿He recopilado suficientes de los datos extraje
datos para representar y permitirán las ¿Cómo mediré el
el problema que predicciones éxito de mi solicitud?
quiero resolver? correctas?
Antes de usar Machine Learning
¿Cómo interactuará
la solución de
aprendizaje automático
con otras partes
de mi investigación
o producto comercial?
Preprocesado

13
Preprocesado

Engloba todas aquellas


transformaciones realizadas sobre los
datos con el objetivo que puedan ser
interpretados por el algoritmo de
machine learning lo más
eficientemente posible.
Debe aprenderse con las
observaciones de entrenamiento y
luego aplicarse al conjunto de
entrenamiento y al de test.

14
Preprocesado

Cuando el conjunto de datos contiene valores ausentes, se puede:


 Eliminar aquellas observaciones que estén incompletas.
 Eliminar aquellas variables que contengan valores ausentes.
 Tratar de estimar los valores ausentes empleando el resto de información disponible
(imputación).
La eliminación de observaciones solo puede aplicarse cuando se dispone de muchos y el
porcentaje de registros incompletos es muy bajo.
Eliminar variables, el impacto dependerá de cuánta información aporten dichas variables al
modelo.
Cuando se emplea la imputación, existe riesgo al introducir valores en predictores que tengan
mucha influencia en el modelo.
El riesgo de que la imputación sea errónea es muy alto, por lo que es preferible obtener una
predicción basada únicamente en la información disponible.

15
Preprocesado

Módulo [Link]:
SimpleImputer: permite imputaciones empleando un valor constante o un
estadístico de la misma columna en la que se encuentra el valor ausente.
IterativeImputer: permite imputar el valor de una columna teniendo en cuenta el
resto de columnas. Proceso iterativo en el que, en cada iteración, una de las
variables se emplea como variable respuesta y el resto como predictores. El
modelo obtenido, se emplea para predecir las posiciones vacías de esa variable.
KNNImputer
from [Link] import SimpleImputer
imp = SimpleImputer(missing_values=[Link], strategy='mean')
[Link](X_train)
[Link](X_test)
16
Preprocesado

Módulo [Link]:
SimpleImputer: permite imputaciones empleando un valor constante o un
estadístico de la misma columna en la que se encuentra el valor ausente.
IterativeImputer: permite imputar el valor de una columna teniendo en cuenta el
resto de columnas. Proceso iterativo en el que, en cada iteración, una de las
variables se emplea como variable respuesta y el resto como predictores. El
modelo obtenido, se emplea para predecir las posiciones vacías de esa variable.
KNNImputer
from [Link] import SimpleImputer
imp = SimpleImputer(missing_values=[Link], strategy='mean')
[Link](X_train)
[Link](X_test)
17
Preprocesado

from [Link] import IterativeImputer

imp = IterativeImputer(max_iter=10, random_state=0)


[Link](X_train)

[Link](X_test)

from [Link] import KNNImputer


imputer = KNNImputer(n_neighbors=2, weights="uniform")

imputer.fit_transform(X)
18
Exclusión de variables

No se deben incluir en el modelo predictores que tengan


varianza cero o próxima cero.
selector = VarianceThreshold()
selector.fit_transform(X)

19
Estandarización y escalado de variables numéricas

Cuando los predictores son numéricos, la escala en la que se miden, así como la magnitud
de su varianza pueden influir en gran medida en el modelo.
Muchos algoritmos de machine learning son sensibles a esto.

Estrategias:
 Centrado: consiste en restarle a cada valor la media del predictor al que pertenece.
StandardScaler(with_std=False)
 Normalización (estandarización): consiste en transformar los datos de forma que todos los
predictores estén aproximadamente en la misma escala:
 Normalización Z-score (StandardScaler): dividir cada predictor entre su desviación
típica después de haber sido centrado, de esta forma, los datos pasan a tener una
distribución normal.
 Estandarización max-min (MinMaxScaler): transformar los datos de forma que estén
dentro del rango [0, 1].
20
Estandarización y escalado de variables numéricas

scaler = StandardScaler()

[Link](data)
[Link](data)

scaler = MinMaxScaler()
[Link](data)

[Link](data)

21
Datos atípicos

Cuando se trabaja con un conjunto de datos reales con frecuencia ocurren en ellos hechos
puntuales que desconocemos.
Los datos pueden haber estado sometidos a intervenciones desconocidas como errores de
medición.
Las observaciones afectadas por estas intervenciones pueden presentar una estructura
distinta de las demás.
Barnett y Lewis, (1984): es una observación o conjunto de observaciones que parecen ser
inconsistentes con el resto del conjunto de datos.
Hawkins (1980): una observación que se desvía mucho de otras observaciones y despierta
sospechas de ser generada por un mecanismo diferente.
Beckman y Cook (1983): observaciones discordantes o contaminantes. Una observación
discordante es cualquier observación sorpresiva o discrepante para el investigador. Un
contaminante es cualquier observación que no es parte de la distribución objetivo.

22
Datos atípicos

Datos atípicos también conocidos como: outliers, anomalías,


observaciones discordantes, excepciones, fallas, defectos, ruido,
errores, contaminantes, valores extremos entre otros.
Aplicada en: detección de fraudes con tarjetas de crédito, seguros o
asistencia en salud, detección de intrusos en sistemas de cómputo,
aprobación de préstamos para detectar clientes potencialmente
problemáticos, limpieza de datos, predicción meteorológica, etc.
Los datos atípicos no pueden ser caracterizados como benéficos o
problemáticos.

23
Datos atípicos

Es importante identificar datos atípicos debido a que:


Si sus efectos son grandes pueden sesgar la estimación de los
parámetros, lo que conduce a malas predicciones futuras.
Si el suceso ha ocurrido en los últimos datos y alguna observación
afectada se utiliza para generar predicciones estas no serán buenas,
aunque los parámetros estén bien estimados.
Si se identifican correctamente los datos atípicos y estimamos sus
efectos, en el momento que estos aparezcan en el futuro, se puede
incorporar esta información en las predicciones y obtener intervalos de
predicción más realistas.

24
Datos atípicos

Es importante identificar datos atípicos debido a que:


El no identificar a los datos atípicos puede conducir a decisiones erróneas con
consecuencias como pérdida de dinero, tiempo y credibilidad.
Aunque los datos atípicos pueden aparentar ser inválidos pueden ser correctos y
viceversa.
Su principal problema radica en que son elementos que pueden no ser
representativos de la población pudiendo distorsionar seriamente el
comportamiento de los contrastes estadísticos.
Aunque los datos atípicos son diferentes a la mayor parte de la muestra, pueden
ser indicativos de las características de un segmento válido de la población y, por
consiguiente, una señal de la falta de representación de la muestra.

25
Datos atípicos

Peat and Barton (2005) establecen la existencia de dos tipos


de datos atípicos:
Dato atípico univariante: son aquellos datos muy
diferentes al resto para una sola variable.
Dato atípico multivariante: es aquel dato extremo para una
combinación de variables.

26
Datos atípicos

Chandola et al. (2007) clasifican los datos atípicos en tres tipos de a cuerdo a
su composición y relación con el resto de los datos:
Tipo I: Son aquellos que corresponden a instancias individuales de los datos.
Tipo II: Son datos individuales pero se definen con respecto a un contexto
específico.
Tipo III: Constituyen un subconjunto de datos que se encuentra por fuera del
conjunto total de datos.
En los datos se pueden encontrar datos atípicos mínimos así como máximos.
Los valores extremadamente altos desplazan la media hacia la derecha.
Los valores extremadamente bajos atraen la media hacia a la izquierda.
Esto ocasiona que la media pierda su cualidad de representar el punto medio.

27
Datos atípicos

Técnicas para identificar observaciones candidatas para su eliminación o sustitución: diagramas de


caja, prueba de Grubbs, métodos basados en proximidad (KNN, regresión, PCA, SVMs, RNAs,
entre otros).
La elección de la técnica de detección y corrección de valores atípicos es de suma importancia
pero no es una tarea sencilla ya que a veces el dato erróneo es muy similar al resto de los datos.

La técnica elegida debe cumplir las siguientes características:


 Debe identificar a los valores extremos de acuerdo con las
características, requisitos, limitaciones y la naturaleza de los datos.
 Debe ser capaz de detectar el tipo de valores atípicos que se
presentan en el problema.
 Debe obtener óptimos resultados en términos de precisión así
como de eficiencia computacional.

28
Datos atípicos

Al elegir la técnica de detección de datos atípicos, es importante que


dicha técnica no esté afectada por el efecto:

Enmascaramiento (masking effect): se refiere a que valores bastante
alejados del centro de la nube de datos, no aparezcan como atípicos.

Inundación (swamping effect): se refiere a que algunos datos pueden
parecer atípicos cuando no lo son, simplemente porque están alejados
de la media.

29
Primer Ejemplo: Flor Iris

Conjunto de datos con 50 muestras de cada una de las tres


especies de Iris:

Se midieron cuatro rasgos de cada muestra: la longitud y el


ancho de los sépalos y pétalos.
Primer Ejemplo: Flor Iris

Los sépalos son los que envuelven a las otras piezas florales en
las primeras fases de desarrollo, cuando la flor es solo un capullo.
Los pétalos son la parte inferior del perianto y comprende las
partes estériles de una flor.
Machine Learning

Aprendizaje
Supervisado
Aprendizaje Supervisado

 El aprendizaje supervisado se usa siempre que queremos predecir un


resultado determinado a partir de una entrada determinada, y tenemos
ejemplos de pares de entrada/salida.

 Construimos un modelo de aprendizaje automático a partir de estos


pares de entrada/salida, que componen al conjunto de entrenamiento.

 El objetivo es realizar predicciones precisas para datos nuevos y nunca


antes vistos.

 El aprendizaje supervisado a menudo requiere un esfuerzo humano


para construir el conjunto de capacitación, pero luego automatiza y, a
menudo, acelera una tarea que de otro modo sería laboriosa o inviable.
Aprendizaje Supervisado

Clasificación: el objetivo es predecir una etiqueta de clase,


que es una elección de una lista predefinida de
posibilidades. A veces se separa en clasificación binaria y
clasificación multiclase.
Regresión: el objetivo es predecir un número continuo o un
número de punto flotante en términos de programación (o
un número real en términos matemáticos).
Generalización, sobreajuste y desajuste

 En el aprendizaje supervisado, queremos construir un


modelo a partir de los datos de entrenamiento y luego poder
hacer predicciones precisas sobre datos nuevos y no vistos
que tengan las mismas características que el conjunto de
entrenamiento que usamos.

 Si un modelo puede hacer predicciones precisas sobre datos


invisibles, decimos que puede generalizar desde el conjunto
de entrenamiento al conjunto de prueba.

 Queremos construir un modelo que sea capaz de generalizar


con la mayor precisión posible.
Generalización, sobreajuste y desajuste

 Por lo general, construimos un modelo de tal manera que


pueda hacer predicciones precisas sobre el conjunto de
entrenamiento.

 Si los conjuntos de entrenamiento y prueba tienen


suficiente en común, esperamos que el modelo también
sea preciso en el conjunto de prueba.

 ¿Y si no ocurre esto?
Generalización, sobreajuste y desajuste

 Si el cliente es mayor de 45 años y tiene menos de 3 hijos o no está


divorciado, entonces quiere comprar un barco
Generalización, sobreajuste y desajuste

 Sobreajuste: se produce cuando ajusta un modelo demasiado


de cerca a las particularidades del conjunto de entrenamiento y
obtiene un modelo que funciona bien en el conjunto de
entrenamiento pero no puede generalizar a nuevos datos.

 Por otro lado, si su modelo es demasiado simple, digamos, es


posible que no pueda capturar todos los aspectos y la
variabilidad de los datos, y su modelo funcionará mal incluso en
el conjunto de entrenamiento.

 La elección de un modelo demasiado simple se llama


desajuste.
Generalización, sobreajuste y desajuste

 Cuanto más complejo permitamos que nuestro modelo sea,


mejor seremos capaces de predecir los datos de
entrenamiento.

 Sin embargo, si nuestro modelo se vuelve demasiado complejo,


comenzamos a enfocarnos demasiado en cada punto de datos
individual en nuestro conjunto de entrenamiento, y el modelo no
se generalizará bien a nuevos datos.

 Hay un punto óptimo en el medio que producirá el mejor


rendimiento de generalización. Este es el modelo que
queremos encontrar.
Complejidad del modelo vs tamaño del
conjunto de datos

¿Cuál es la relación de la
complejidad del modelo con el
tamaño del conjunto de datos?
Complejidad del modelo vs tamaño del
conjunto de datos

Cuanto mayor sea la variedad de puntos de datos que contenga el
conjunto de datos, más complejo será el modelo que puede usar sin
sobreajustar.

Sin embargo, simplemente duplicar los mismos puntos de datos o
recopilar datos muy similares no ayudará.

Tener más datos y construir modelos apropiadamente más
complejos a menudo puede hacer maravillas para las tareas de AS.

En el mundo real, a veces puede decidir cuántos datos recopilar, lo
que podría ser más beneficioso que ajustar y afinar su modelo.

Nunca subestimes el poder de más datos.
Complejidad del modelo vs tamaño del
conjunto de datos

¿A qué nos referimos con


un modelo más complejo?
Teorema de Bayes
Sea {A₁, A₂,…, An} un conjunto de eventos mutuamente
excluyentes tales que P(Ai)≠0, para i=1,2,…,n. Si B es un
suceso tal que se conocen P(B|Ai) entonces:

P ( B ∨ A i ) P ( A i)
P ( Ai ∨ B )=
P (B)
K-vecino más cercano

KNN por sus siglas en inglés K-nearest neighbors.

Dado un entero positivo K y una observación x₀, el clasificador
KNN primero identifica los K puntos en el conjunto de
entrenamiento que son cercanos a x₀, representado por N ₀.

Esto es estimado por la probabilidad condicional para la clase j
como la fracción de punto en N ₀ cuya respuesta es igual a j:

1
Pr ( Y = j ∨ X =x 0 )=
K
∑ I ( y i= j )
i∈ N0

KNN aplica la regla de Bayes y clasifica la observación x₀ en la
clase con mayor probabilidad.
K-vecino más cercano
Si K=1, el algoritmo KNN solo considera exactamente un vecino más
cercano, que es el punto de datos de entrenamiento más cercano al
punto para el que queremos hacer una predicción.
K-vecino más cercano
Cuando consideramos a más de un vecino, usamos la votación para asignar una
etiqueta.
Esto significa que para
cada punto de prueba
contamos cuántos vecinos
pertenecen a cada clase.
Luego asignamos la clase
que es más frecuente, es
decir, la clase mayoritaria
entre los k vecinos más
cercanos.
K-vecino más cercano
Izquierda: K=1, Derecha: K=10
K-vecino más cercano
K-vecino más cercano

 Cuando K=1, la frontera de decisión es muy flexible, esto es,


corresponde a un clasificador con bajo bias pero varianza alta.
 Cuando K crece el método es menos flexible y produce una frontera
de decisión cercano a uno lineal, esto es, baja varianza pero bias alto.
 En el conjunto de regresión, no existe una relación fuerte entre el
error del conjunto de entrenamiento y el error del conjunto de prueba.
 Para un método de clasificación más flexible, el error en el conjunto
de entrenamiento puede ser cero, pero en el conjunto de prueba no
necesariamente.
K-vecino más cercano
Regresión Lineal
Desarrollar un modelo preciso que se pueda utilizar para predecir las ventas
sobre la base de los tres presupuestos de medios. Ventas, en miles de unidades,
en función de los presupuestos de televisión, radio y periódicos, en miles de
dólares, para 200 mercados diferentes.
Regresión Lineal
Suponga que se observa una respuesta cuantitativa Y y p
predictores diferentes X₁, X₂,…, Xp. Suponga que existe una
relación entre Y y X=(X₁, X₂,…, Xp), tal que:

Y=f(X)+ε

Donde f es una función fija pero desconocida que representa


la información sistemática que X proporciona sobre Y y, ε es
un error aleatorio.
La función f puede involucrar más de una variable de entrada.
Regresión Lineal
Regresión Lineal
Existen dos razones para estimar a f: predicción e inferencia.

Predicción

Un conjunto de entradas X están fácilmente disponibles, pero la salida


Y no se puede obtener fácilmente. En esta configuración, ya que los
promedios del término de error es cero, podemos predecir Y usando:
Y^ = f^ ( X )
Donde f^ representa nuestra estimación de f y Y^ representa la
predicción resultante para Y.

Error reducible y error irreducible (mayor a cero).


Regresión Lineal
Inferencia

 A menudo nos interesa comprender la forma en que Y se ve afectado conforme X₁,. . . ,


XP cambian.

 En esta situación deseamos estimar f, pero nuestro objetivo no es necesariamente


hacer predicciones para Y.

 Se quiere comprender la relación entre X e Y, o más específicamente, comprender


cómo cambia Y en función de X₁,. . . , XP.

 Ahora f^ no puede tratarse como una caja negra, porque necesitamos conocer su forma
exacta.
Inferencia

 ¿Qué predictores están asociados con la respuesta?

 ¿Cuál es la relación entre la respuesta y cada predictor?

 ¿Se puede resumir adecuadamente la relación entre Y y cada predictor usando una
ecuación lineal, o la relación es más complicada?
Estimación de f

Sea el conjunto de entrenamiento

{(x₁, y₁), (x₂, y₂),. . . , (xn, yn)}

donde xi = (xi1, xi2,..., xip)T, xij es el valor del j-ésimo predictor, o entrada, para la
observación i, donde i = 1, 2,. . . , n y j = 1, 2,. . ., p.

Nuestro objetivo es aplicar un método de aprendizaje estadístico a los datos de


entrenamiento para estimar la función desconocida f. Es decir, queremos
encontrar una función f^ tal que
Y = f^ ( X ) para cualquier observación (X, Y).

En términos generales, la mayoría de los métodos de aprendizaje estadístico


para esta tarea se pueden caracterizar como paramétricos o no paramétricos.
Métodos Paramétricos
Los métodos paramétricos implican un enfoque basado en modelos
de dos pasos:

1. Primero, hacemos una suposición sobre la forma funcional, o


forma, de f:

se necesita estimar p+1 coeficientes.

2. Una vez que se ha seleccionado un modelo, necesitamos un


procedimiento que utilice los datos de entrenamiento para ajustar o
entrenar el modelo. Se necesita estimar los parámetros, es decir,
encontrar los valores de dichos parámetros tales que:
Métodos Paramétricos

 Los modelos paramétricos reducen el problema de estimar f a uno de


estimar un conjunto de parámetros.

 Es mucho más fácil estimar un conjunto de parámetros en el modelo


lineal que para ajustar una función f completamente arbitraria.

 La posible desventaja de un enfoque paramétrico es que el modelo


que elegimos generalmente no coincidirá con la verdadera forma
desconocida de f.

 Si el modelo elegido está demasiado lejos de la verdadera f, entonces


nuestra estimación será pobre.
Métodos Paramétricos

 Podemos intentar abordar este problema eligiendo modelos


flexibles que puedan adaptarse a muchas formas funcionales
posibles diferentes para f.

 Ajustar un modelo más flexible requiere estimar un mayor


número de parámetros.

 Estos modelos más complejos pueden conducir a un fenómeno


conocido como sobreajuste de los datos, lo que esencialmente
significa que siguen los errores o el ruido demasiado de cerca.
Métodos Paramétricos
Métodos No Paramétricos

 Los métodos no paramétricos no hacen suposiciones explícitas sobre


la forma funcional de f.

 Buscan una estimación de f que se acerque lo más posible a los


puntos de datos sin ser demasiado tosco u ondulado.

 Ventaja: al evitar la suposición, tienen el potencial de ajustarse con


precisión a una gama más amplia de formas posibles para f.

 Desventaja: dado que no reducen el problema de estimar f a un


número pequeño de parámetros, se requiere un número muy grande
de observaciones.
Métodos Paramétricos
Precisión de la predicción vs
interpretabilidad del modelo

¿Por qué elegiríamos


utilizar un método más
restrictivo en lugar de un
enfoque muy flexible?
Precisión de la predicción vs interpretabilidad del
modelo

 Inferencia: utilizar métodos de aprendizaje estadístico simples


y relativamente inflexibles.

 Predicción: la interpretabilidad del modelo predictivo no es de


interés, por lo que es mejor utilizar el modelo más flexible
disponible. Aunque se puede obtener predicciones más
precisas utilizando un método menos flexible. Depende del
potencial de sobreajuste en métodos altamente flexibles.
Precisión de la predicción vs
interpretabilidad del modelo
Evaluación de la precisión del modelo

¿Por qué es necesario introducir


tantos enfoques de aprendizaje
estadístico diferentes, en lugar
de solo un mejor método?
Evaluación de la precisión del modelo

El rendimiento de un método de aprendizaje estadístico en


un conjunto de datos dado es qué tan bien sus predicciones
coinciden realmente con los datos observados.
Se cuantifica hasta qué punto el valor de respuesta
predicho para una observación determinada se acerca al
valor de respuesta real para esa observación.
En regresión, la medida más comúnmente utilizada es el
error cuadrático medio (MSE), dado por:
Evaluación de la precisión del modelo

El MSE será pequeño si las respuestas predichas están muy


cerca de las respuestas verdaderas.
El MSE será grande si para algunas de las observaciones, las
respuestas predichas y verdaderas difieren sustancialmente.
El MSE se calcula utilizando los datos de entrenamiento que se
utilizaron para ajustar el modelo.
Es más importante la precisión de las predicciones cuando se
aplica el método a datos de prueba nunca antes vistos.
 Lo mejor es eleccionar el modelo para el MSE de prueba, es lo
más pequeño posible.
Evaluación de la precisión del modelo
Evaluación de la precisión del modelo

En la práctica, normalmente se puede calcular el


MSE de entrenamiento con relativa facilidad, pero
estimar el MSE de prueba es considerablemente más
difícil porque generalmente no hay datos de prueba
disponibles.

Validación cruzada (cross-validation), es un método


para estimar el MSE de prueba utilizando los datos
de entrenamiento.
Evaluación de la precisión del modelo

¿Qué entendemos por varianza y sesgo de un


método de aprendizaje estadístico?

¿ f^ cambiaría si la estimáramos utilizando un


conjunto de datos de entrenamiento diferente?

¿ Qué pasa con el error que se introduce al


aproximar un problema de la vida real?
Evaluación de la precisión del modelo
Evaluación de la precisión del modelo

La varianza se refiere a la cantidad en la que f^cambiaría si la estimáramos


utilizando un conjunto de datos de entrenamiento diferente.

El sesgo se refiere al error que se introduce al aproximar un problema de


la vida real.

En métodos más flexibles, la varianza aumenta y el sesgo disminuye.

Al aumentar la flexibilidad el sesgo tiende a disminuir inicialmente más


rápido de lo que aumenta la varianza, por lo que el MSE en la prueba
disminuye.

Si el aumento de la flexibilidad tiene poco impacto en el sesgo, pero


comienza a aumentar significativamente la varianza, el MSE en la prueba
aumenta.
Conclusión

En los siguientes caso indique si en general esperaríamos que el


rendimiento de un método de aprendizaje estadístico flexible es
mejor o peor que un método inflexible:

a) El tamaño de la muestra n es extremadamente grande y el


número de predictores p es pequeño.

b) El número de predictores p es extremadamente grande y el


número de observaciones n es pequeño.

c) La relación entre los predictores y la respuesta es muy no lineal.

d) La varianza de los términos de error es extremadamente alta.


Conclusión

Explique si cada escenario es un problema de clasificación o regresión e


indique si estamos más interesados en la inferencia o la predicción.

(a) Recopilamos un conjunto de datos sobre las 500 empresas más


importantes de EE. UU. Para cada empresa, registramos las ganancias, el
número de empleados, la industria y el salario del CEO. Estamos
interesados en comprender qué factores afectan el salario del CEO.

(b) Estamos considerando lanzar un nuevo producto y deseamos saber si


será un éxito o un fracaso. Recopilamos datos sobre 20 productos
similares que se lanzaron anteriormente. Para cada producto, hemos
registrado si fue un éxito o un fracaso, el precio cobrado por el producto,
el presupuesto de marketing, el precio de la competencia y otras diez
variables.
Conclusión

(c) Estamos interesados en predecir el% de variación del dólar


estadounidense en relación con los cambios semanales en los
mercados bursátiles mundiales. Por lo tanto, recopilamos datos
semanales para todo el año 2012. Para cada semana registramos el%
de cambio en el dólar, el% de cambio en el mercado estadounidense,
el% de cambio en el mercado británico y el% de cambio en el
mercado alemán.
Regresión Lineal

Suponga que quiere sugerir, sobre la base de estos datos, un plan de


marketing para el próximo año que resultará en altas ventas de productos.
¿Qué información sería útil para ofrecer tal recomendación?
Regresión Lineal

1. ¿Existe una relación entre el presupuesto publicitario y las ventas?

2. ¿Qué tan fuerte es la relación entre el presupuesto publicitario y las ventas?

3. ¿Qué medios contribuyen a las ventas?

4. Por cada dólar gastado en publicidad en un medio en particular, ¿en qué


cantidad aumentarán las ventas? ¿Con qué precisión podemos predecir esta
cantidad de aumento?

5. Para cualquier nivel dado de publicidad en televisión, radio o periódicos, ¿cuál


es nuestra predicción para las ventas y cuál es la precisión de esta predicción?

6. ¿Es la relación lineal?

7. ¿Existe sinergia entre los medios publicitarios? (efecto de interacción)


Regresión Lineal Simple

Modelo:
Regresión Lineal Simple
Regresión Lineal Simple
Regresión Lineal Múltiple
Regresión Lineal Múltiple
Regresión Lineal Múltiple
1. Es al menos uno de los predictores X ₁, X₂,. . . , X p útil para
predecir la respuesta?

2. ¿Todos los predictores ayudan a explicar Y, o sólo es útil un


subconjunto de predictores?

3. ¿Qué tan bien se ajusta el modelo a los datos?

4. Dado un conjunto de valores predictores, ¿qué valor de


respuesta deberíamos predecir y qué tan precisa es nuestra
predicción?
Regresión Lineal Múltiple
1. Selección hacia adelante.

[Link]ón hacia atrás.

[Link]ón mixta.

La selección hacia atrás no se puede usar si p>n.

La selección hacia adelante siempre se puede usar.

La selección hacia adelante es un enfoque codicioso y puede


incluir variables al principio que luego se vuelven redundantes.
Regresión Lineal Múltiple
Cuando ajustamos un modelo de regresión lineal a un conjunto de datos en
particular, pueden surgir muchos problemas:

1. No linealidad de las relaciones respuesta-predictor.

2. Correlación de términos de error.

3. Varianza no constante de los términos de error.

4. Valores atípicos.

5. Puntos de alto apalancamiento.

6. Colinealidad.
No linealidad de los datos
Correlación de términos de error
 En el modelo de regresión lineal se supone que los términos de error no
están correlacionados.

 Si de hecho existe una correlación entre los términos de error, entonces los
errores estándar estimados tenderán a subestimar los errores estándar
verdaderos.

 Si los términos de error están correlacionados, es posible que tengamos un


sentido de confianza injustificado en nuestro modelo.

 Estas correlaciones ocurren con frecuencia en el contexto de datos de


series de tiempo, que consisten en observaciones para las cuales se
obtienen mediciones en puntos discretos en el tiempo.
Correlación de términos de error
Correlación de términos de error

 Para determinar si este es el caso para un conjunto de datos dado,


podemos graficar los residuos de nuestro modelo en función del
tiempo.

 Si los errores no están correlacionados, entonces no debería haber un


patrón discernible.

 Por otro lado, si los términos de error están correlacionados


positivamente, entonces podemos ver un seguimiento en los residuos,
es decir, los residuos adyacentes pueden tener valores similares.
Varianza no constante
Valores atípicos
Valores atípicos

Un valor atípico es un punto en el que y i está lejos del valor predicho
por el modelo.

Los valores atípicos pueden surgir por el registro incorrecto de una
observación durante la recopilación de datos.

Un valor atípico puede indicar una deficiencia en el modelo, como
un predictor faltante.

Los gráficos de residuos se pueden utilizar para identificar valores
atípicos.

Se puede graficar los residuales studentizados, dividiendo cada ei
residual por su error estándar estimado. Las observaciones cuyos
residuales estudentizados son superiores a 3 en valor absoluto son
posibles valores atípicos.
Valores atípicos
Puntos de alto apalancamiento


Las observaciones con alto apalancamiento tienen un valor inusual para x i.

Las observaciones de alto apalancamiento tienden a tener un impacto
considerable en la línea de regresión estimada.

Cualquier problema con estos puntos puede invalidar todo el ajuste.
Puntos de alto apalancamiento

Para identificar los puntos de alto apalancamiento:



Regresión lineal simple: fácil, se buscan observaciones para las cuales el valor
del predictor está fuera del rango normal de las observaciones.

Regresión lineal múltiple con muchos predictores: difícil, es posible tener una
observación que esté dentro del rango de los valores de cada predictor
individual, pero que es inusual en términos del conjunto completo de
predictores.

La estadística de apalancamiento permite cuantificar el apalancamiento de una


observación. Un gran valor de esta estadística indica una observación con alto
apalancamiento.
Colinealidad


La colinealidad se refiere cuando dos o más variables
predictoras están estrechamente relacionadas entre sí.
KNN regresión

La predicción que utiliza un solo vecino es solo el valor objetivo del vecino
más cercano.

Cuando se utilizan varios vecinos más cercanos, la predicción es el promedio,
o la media, de los vecinos relevantes.

[Link].plot_knn_regression(n_neighbors=3)
KNN regresión vs regresión lineal

También podría gustarte