Pandas (pd): Biblioteca esencial para la manipulación y análisis
de datos en estructuras tipo DataFrame.
Seaborn (sns) y Matplotlib (plt): Bibliotecas de visualización
de datos que permiten crear gráficos y representaciones
visuales.
sklearn.model_selection: Importa funciones para dividir
conjuntos de datos y evaluar modelos.
[Link]: Incluye escaladores y codificadores
de etiquetas para preparar los datos.
Modelos de regresión: Se importan varios modelos de
regresión
como LinearRegression, DecisionTreeRegressor, RandomForestR
egressor, y GradientBoostingRegressor.
Métricas: Se importan funciones para evaluar la precisión del
modelo, como mean_squared_error y r2_score.
RESULTADO: Este análisis proporciona una visión general de las
estructuras y tipos de datos en el conjunto de datos de accidentes de
tráfico. Identificar columnas con valores nulos esenciales es
fundamental para preparar los datos antes de realizar análisis o
modelado.
Resultados Explicados
El resultado del método describe() proporciona diversas estadísticas
para las columnas numéricas del DataFrame. Aquí están las
estadísticas explicadas:
Estadísticas Clave
1. count: Número de observaciones no nulas en cada columna.
o Por ejemplo, count para Severity, Start_Lat, etc.,
muestra que hay 10,000 entradas para estas columnas.
o Para columnas como Visibility(mi) y Wind_Speed(mph),
el conteo es menor (9904 y 8226, respectivamente),
indicando que hay valores nulos.
2. mean: Promedio de los valores en la columna.
o Por ejemplo, el mean de Severity es 2.39, lo que indica
que en promedio, la severidad de los accidentes es leve a
moderada.
3. std: Desviación estándar, que mide la variación o dispersión de
los valores en la columna.
o std de Temperature(F) es 17.36, lo que sugiere que las
temperaturas tienen una amplia variabilidad.
4. min: Valor mínimo en la columna.
o Por ejemplo, los accidentes ocurrieron con una severidad
mínima de 1 (que puede ser el menos severo).
5. 25%, 50%, 75% (percentiles): Estas cifras indican los
cuartiles de los datos.
o 25% significa que el 25% de los datos está por debajo de
este valor (por ejemplo, para Severity, el 25% de las
observaciones tienen severidad ≤ 2).
o 50% es la mediana, y 75% significa que el 75% de los datos
está por debajo de este valor.
6. max: Valor máximo en la columna.
o Por ejemplo, Distance(mi) tiene un máximo de 24.04
millas.
Análisis de Resultados
Columnas Destacadas:
Severity:
o Rango de severidad de 1 a 4, con un promedio de 2.39.
Temperature(F):
o Rango de temperaturas entre 8°F y 106°F. El promedio es
de 59.6°F.
Wind Chill(F):
o Promedio de 33.1°F con un máximo de 66°F. Indica que
algunas condiciones climáticas son bastante frías.
Visibility(mi):
o Promedio de 8.91 millas, aunque hay un máximo de 80
millas. Esto sugiere que la visibilidad puede variar
significativamente.
Wind Speed(mph):
o Promedio de 8.87 mph con un máximo de 33.4 mph.
Precipitation(in):
o Los valores oscilan desde 0 a 0.49 pulgadas, con un
promedio muy bajo, lo que podría sugerir pocas
precipitaciones en los días de accidente registrados.
El resumen estadístico proporciona una comprensión
clara de las propiedades de los datos, las
distribuciones, y las variaciones en diferentes
variables.
GRAFICO DE # Contar accidentes por 'Day' (día o noche)
4. ⚠️Dividir datos en entrenamiento
(train) y prueba (test) ⚠️
Resumen
Este bloque de código prepara los datos para que sean más
adecuados para el aprendizaje automático. Principalmente, divide los
datos en conjuntos de entrenamiento y prueba, y aplica un escalado a
las características numéricas para facilitar el entrenamiento del
modelo. El escalado ayuda a que algunos algoritmos, como la
regresión lineal, funcionen mejor.
INGENIERIA DE CARACTERISTICAS
ENTRENAR DIFERENTES MODELOS
7. Evaluación del modelo - métricas
de rendimiento
8. Escoger el mejor modelo usando las
métricas de rendimiento
9. Interpretando el modelo