0% encontró este documento útil (0 votos)
3 vistas13 páginas

K-Nearest Neighbors: Algoritmo Clave en ML

El algoritmo K-Nearest Neighbors (KNN), introducido en 1951, es un clasificador no paramétrico que se basa en la proximidad de los datos para realizar clasificaciones y predicciones. Su relevancia persiste en la actualidad como base para métodos de aprendizaje y se utiliza en diversas aplicaciones, como la clasificación de dígitos escritos a mano. KNN funciona midiendo la similitud entre ejemplos mediante funciones de distancia y eligiendo un número determinado de vecinos (K) para tomar decisiones de clasificación o regresión.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
3 vistas13 páginas

K-Nearest Neighbors: Algoritmo Clave en ML

El algoritmo K-Nearest Neighbors (KNN), introducido en 1951, es un clasificador no paramétrico que se basa en la proximidad de los datos para realizar clasificaciones y predicciones. Su relevancia persiste en la actualidad como base para métodos de aprendizaje y se utiliza en diversas aplicaciones, como la clasificación de dígitos escritos a mano. KNN funciona midiendo la similitud entre ejemplos mediante funciones de distancia y eligiendo un número determinado de vecinos (K) para tomar decisiones de clasificación o regresión.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

K-NEAREST NEIGHBORS

Aprendizaje automático supervisado

Haider Rodriguez
y Emily Noreña
UN ALGORITMO CON MÁS DE MEDIO
SIGLO DE HISTORIA
Introducido en 1951 por Evelyn Fix y Joseph
Hodges (UC Berkeley).
Popularizado en 1967 por Thomas Cover y Peter
Hart.
Uno de los primeros clasificadores no
paramétricos.
Inspirado en la idea estadística de proximidad y
vecindad.

Los elementos que estan cerca entre si tienden a


pertenecer a la misma categoria
¿QUE PROBLEMA BUSCABA
RESOLVER?
Dificultad para modelar distribuciones
complejas de datos.
Necesidad de métodos simples pero
efectivos para clasificación.
Deseo de evitar suposiciones estadísticas
(como en modelos paramétricos).
Enfoque: “Los datos hablan por sí mismos”.
POR QUE KNN SIGUE SIENDO
RELEVANTE
Base para muchos métodos de aprendizaje basados en instancias.
Se usa como referencia o línea base en experimentos modernos.
Ilustra el principio de “aprendizaje perezoso” (lazy learning).
Fundamenta ideas modernas como métricas de similitud,
embeddings y clustering.
ARQUITECTURA
COMPONENTES:
Base de datos: almacena todos los ejemplos de
entrenamiento.
Función de distancia: mide similitud (Euclidiana,
Manhattan, Minkowski, etc.).
Parámetro K: número de vecinos considerados.
Estrategia de decisión: votación mayoritaria o
promedio ponderado.
ECUACIONES/FUNCIONAMIENTO
Conjunto de entrenamiento
Datos etiquetados: Usa las
etiquetas conocidas durante
el entrenamiento para
aprender cómo clasificar
nuevos datos.
FUNCION DE
DISTANCIA
El núcleo de K-NN es medir la
similitud entre ejemplos. La
distancia euclidiana es la más
común.
NUMERO DE VECINOS
(K)
K determina cuántos vecinos se consideran para
Benefit clasificar.
Result
K pequeño → baja sesgo, alta varianza (sensible al ruido).
K grande → alto sesgo, baja varianza (menos preciso en
detalles).
Se recomienda un k impar para evitar empates.
Usar validación cruzada para encontrar el k óptimo.
CLASIFICACION

Adicionalmente, se puede asignar un peso inversamente proporcional a la


distancia para que aquellos vecinos más cercanos tengan más influencia.
REGRESION
prediccion de valores numericos
Promediamos los valores de los vecinos más
cercanos (k).

Ej: Queremos predecir el precio de una casa de


110m². Supongamos k = 2, donde obtenemos:
100 m² → 100,000
120 m² → 120,000
Calculando el promedio: 110 m² → 110,000
CASO DE USO
Clasificacion de digitos escritos a mano

Formato:
Cada imagen tiene 28×28 píxeles → 784
características (cada píxel es un valor
entre 0 y 255).
Cada imagen tiene una etiqueta (el
número real: 0, 1, 2, …, 9).

Recordemos que KNN no entrena un modelo


paramétrico, solo guarda los datos
Clasificacion de digitos escritos a mano

Cuando llega una nueva imagen:

Se calcula la distancia entre esa imagen y


todas las imágenes del conjunto de
entrenamiento (por ejemplo, usando
distancia Euclidiana).

Se eligen los k vecinos más cercanos (por


ejemplo, k = 5).

Se observa la etiqueta más común entre


esos 5 vecinos.

El modelo predice esa etiqueta.


GRACIAS

También podría gustarte