Bosques aleatorios
¿QUÉ SON?
Un bosque aleatorio es un algoritmo utilizado para
clasificar grandes cantidades de datos. Para lograrlo,
los datos pasan a través de una serie de filtros que
permiten determinar si cumplen con ciertas
características; a cada uno de estos filtros se le
denomina árbol de decisión. Al combinar varios de estos
árboles se obtiene un bosque, de ahí el nombre del
algoritmo.
Cada árbol (o filtro) se entrena con una porción
aleatoria de los datos, de modo que todos sean
ligeramente diferentes entre sí. Finalmente, la
clasificación se determina mediante un proceso de
votación: el resultado elegido por la mayoría de los
árboles es el que se toma como decisión final.
¿CÓMO FUNCIONAN?
Para comprender cómo funciona un bosque
aleatorio, primero es necesario explicar qué es un
árbol de decisión.
Un árbol de decisión es un modelo que clasifica
datos dividiéndolos según si cumplen o no una
serie de condiciones, lo que genera distintas
ramificaciones.
En este modelo:
Cada prueba o condición es un nodo.
Cada posible resultado de la prueba forma una
rama.
Al final de cada rama se encuentran las hojas,
que representan la clasificación final del dato.
Cuando se combinan varios árboles de decisión, se
obtiene un bosque.
¿Pero por qué se llama aleatorio?
Porque:
[Link] árbol se entrena con un conjunto
aleatorio de datos, lo que hace que cada uno
sea diferente.
[Link] cada división (nodo), el modelo selecciona un
subconjunto aleatorio de variables para decidir
la mejor separación
VENTAJAS
Eficiente: una computadora común puede analizar
hasta 6 GB de información en alrededor de 4 minutos
usando este algoritmo.
Certero: ofrece un porcentaje de aciertos entre el 85%
y el 99%.
Importancia de variables: permite identificar qué
variables tienen mayor peso en la clasificación.
Robusto: maneja sin problema grandes volúmenes de
datos
Flexible: puede trabajar con múltiples tipos de datos,
incluyendo valores numéricos y categóricos
Procesamiento paralelo: se pueden crear múltiples
árboles en paralelo, ya que no hay dependencia entre
iteraciones
DESVENTAJAS
Baja interpretabilidad: es muy difícil rastrear la ruta
exacta que sigue cada dato para ser clasificado.
Parcialización de la información: tiende a favorecer
variables categóricas con muchos niveles, incluso
cuando esto no mejora la predicción.
Sobreajuste: puede ajustarse demasiado bien a los
datos de entrenamiento, lo que provoca que su
precisión disminuya al evaluar datos nuevos
Rango de clasificación limitado: no puede clasificar
datos que estén fuera del rango observado durante el
entrenamiento, por lo que no predice tendencias ni
extrapola.
APLICACIONES
Finanzaz:
Permite clasificar operaciones bancarias como
fraude
Se utiliza para evaluar riesgos crediticios.
Puede predecir tendencias en el mercado de valores.
Física:
Clasifica objetos extra galácticos de interés, como
cuásares, dentro de grandes conjuntos de datos.
Es ampliamente usado en física de partículas para
filtrar y clasificar eventos de colisión entre partículas
Medicina:
Clasifica pacientes con riesgo de diabetes,
enfermedades cardiovasculares o cáncer a partir de
historiales clínicos.
Identifica genes específicos (entre miles) que están
más correlacionados con una enfermedad concreta.
Marketing:
Sugiere productos personalizados según el historial
de compras y las características del usuario.
Permite agrupar clientes en nichos específicos según
su comportamiento de compra.
Geografía:
Utiliza imágenes satelitales para clasificar distintos
tipos de suelo y terreno, como bosques, cuerpos de
agua o zonas urbanas.
REFERENCIAS
Whitfield, B. (2024, 26 noviembre). Random
Forest: A Complete Guide for Machine Learning.
Built In. [Link]
science/random-forest-
Kavlakoglu, E. (s. f.). ¿Qué es el bosque
aleatorio? IBM Think.
Inesdi. (s. f.). Random Forest: qué es, cómo
funciona y ejemplos de uso. Inesdi.
[Link]
que-es/