RANDOM FOREST
MANUEL ALEJANDRO RIVEROS GUTIÉRREZ
CONCEPTO SOBRE RANDOM FOREST
• El random forest es un algoritmo de machine learning
de uso común registrado por Leo Breiman y Adele
Cutler, que combina la salida de múltiples árboles de
decisión para alcanzar un solo resultado. Su facilidad
de uso y flexibilidad han impulsado su adopción, ya
que maneja problemas de clasificación y regresión.
CONCEPTO SOBRE RANDOM FOREST
• Es una técnica fácil de interpretar, estable, que
por lo general presenta buenas coincidencias y
que se puede utilizar en tareas de regresión o de
clasificación. Cubre, por tanto, gran parte de los
problemas de Machine Learning.
ARBOLES DE DECISION
• Los árboles de decisión comienzan con una pregunta básica,
como "¿Debería navegar?" A partir de ahí, puede hacer una
serie de preguntas para determinar una respuesta, como,
"¿Es un oleaje prolongado?" o "¿El viento sopla en alta mar?".
Estas preguntas constituyen los nodos de decisión en el
árbol, actuando como un medio para dividir los datos. Cada
pregunta ayuda a un individuo a llegar a una decisión final,
que sería indicada por el nodo hoja.
EMBOLSADO
• El embolsado, también conocido como Bootstrap
Aggregation, elige una muestra aleatoria del conjunto de
datos. Cada modelo se entrena de forma independiente, y el
resultado final se basa en la votación por mayoría después
de combinar los resultados de todos los modelos. Este paso
que consiste en combinar todos los resultados y generar
resultados basados en la votación por mayoría se conoce
como agregación.
APLICACIONES DEL RANDOM FOREST
• Finanzas:
Es un algoritmo preferido sobre otros, ya que reduce el tiempo dedicado a la
gestión de datos y las tareas de preprocesamiento. Se puede utilizar para evaluar
clientes con alto riesgo crediticio, para detectar fraudes y problemas de opciones de
precios.
• Cuidado de la salud:
El algoritmo de random forest tiene aplicaciones dentro de la Biología
Computacional lo que permite a los médicos abordar problemas como la
clasificación de la expresión génica, el descubrimiento de biomarcadores y la
anotación de secuencias. Como resultado, los médicos pueden hacer estimaciones
sobre las respuestas de los medicamentos a medicamentos específicos.
• Comercio electrónico:
Se puede utilizar para motores de recomendación con fines de venta cruzada.
PROCEDIMIENTO PARA RANDOM FOREST
1. Tamaño del nodo
2. Cantidad de árboles
3. Cantidad de características muestreadas
Procedimiento:
El algoritmo toma “n” números de registros aleatorios del conjunto de
datos.
Se construyen árboles de decisión individuales para cada muestra.
Cada árbol de decisión generará una salida.
El resultado final depende de la mayoría o el promedio para la
clasificación y la regresión, respectivamente.