K-NEAREST NEIGHBORS
Aprendizaje automático supervisado
Haider Rodriguez
y Emily Noreña
UN ALGORITMO CON MÁS DE MEDIO
SIGLO DE HISTORIA
Introducido en 1951 por Evelyn Fix y Joseph
Hodges (UC Berkeley).
Popularizado en 1967 por Thomas Cover y Peter
Hart.
Uno de los primeros clasificadores no
paramétricos.
Inspirado en la idea estadística de proximidad y
vecindad.
Los elementos que estan cerca entre si tienden a
pertenecer a la misma categoria
¿QUE PROBLEMA BUSCABA
RESOLVER?
Dificultad para modelar distribuciones
complejas de datos.
Necesidad de métodos simples pero
efectivos para clasificación.
Deseo de evitar suposiciones estadísticas
(como en modelos paramétricos).
Enfoque: “Los datos hablan por sí mismos”.
POR QUE KNN SIGUE SIENDO
RELEVANTE
Base para muchos métodos de aprendizaje basados en instancias.
Se usa como referencia o línea base en experimentos modernos.
Ilustra el principio de “aprendizaje perezoso” (lazy learning).
Fundamenta ideas modernas como métricas de similitud,
embeddings y clustering.
ARQUITECTURA
COMPONENTES:
Base de datos: almacena todos los ejemplos de
entrenamiento.
Función de distancia: mide similitud (Euclidiana,
Manhattan, Minkowski, etc.).
Parámetro K: número de vecinos considerados.
Estrategia de decisión: votación mayoritaria o
promedio ponderado.
ECUACIONES/FUNCIONAMIENTO
Conjunto de entrenamiento
Datos etiquetados: Usa las
etiquetas conocidas durante
el entrenamiento para
aprender cómo clasificar
nuevos datos.
FUNCION DE
DISTANCIA
El núcleo de K-NN es medir la
similitud entre ejemplos. La
distancia euclidiana es la más
común.
NUMERO DE VECINOS
(K)
K determina cuántos vecinos se consideran para
Benefit clasificar.
Result
K pequeño → baja sesgo, alta varianza (sensible al ruido).
K grande → alto sesgo, baja varianza (menos preciso en
detalles).
Se recomienda un k impar para evitar empates.
Usar validación cruzada para encontrar el k óptimo.
CLASIFICACION
Adicionalmente, se puede asignar un peso inversamente proporcional a la
distancia para que aquellos vecinos más cercanos tengan más influencia.
REGRESION
prediccion de valores numericos
Promediamos los valores de los vecinos más
cercanos (k).
Ej: Queremos predecir el precio de una casa de
110m². Supongamos k = 2, donde obtenemos:
100 m² → 100,000
120 m² → 120,000
Calculando el promedio: 110 m² → 110,000
CASO DE USO
Clasificacion de digitos escritos a mano
Formato:
Cada imagen tiene 28×28 píxeles → 784
características (cada píxel es un valor
entre 0 y 255).
Cada imagen tiene una etiqueta (el
número real: 0, 1, 2, …, 9).
Recordemos que KNN no entrena un modelo
paramétrico, solo guarda los datos
Clasificacion de digitos escritos a mano
Cuando llega una nueva imagen:
Se calcula la distancia entre esa imagen y
todas las imágenes del conjunto de
entrenamiento (por ejemplo, usando
distancia Euclidiana).
Se eligen los k vecinos más cercanos (por
ejemplo, k = 5).
Se observa la etiqueta más común entre
esos 5 vecinos.
El modelo predice esa etiqueta.
GRACIAS